第三百八十四章 双标 (第2/3页)
国的大模型厂商在公开排行榜上有非常强的优化动机。你也看到了,这个来自中国的模型分数极为异常,我们都有理由相信这个测试结果是不准确的。」
只是分高就是不准确?
林伟伦「嘿」了一声:「如果测试结果不准确的话,难道不是所有的模型测试结果都不准确吗?为什麽单独剔除这一个模型?」
「这套测试题是多家机构和专家联合设计的,我认为作为最新的、评价现行模型的标准,是很有价值的——只要剔除掉明显作弊的模型就可以了。」
林伟伦环视了一圈坐在会议室里的代表,ai foundations的成员单位大部分都来自於美国,这里大部分的代表也都来自於美国。
对这个结果,没有一个代表提出不同的意见。
他感到自己刚刚经历了一场学术霸凌。
虽然这个霸凌不是针对他本人的。
「那麽,」林伟伦继续说道,「这样一套经过严密设计的测试题,他们是怎麽作弊的?」
理察看向林伟伦。
「我没想到你会问出这个问题,林教授。」他说道,话里意有所指,「一个模型的成绩异常的高,自然是因为提前进行了针对性的训练,我认为,可能有ai foundations的合作单位把这套本应视为机密的测试题进行了泄露。」这场人工智慧大会新加坡站,ai foundations的合作单位只有两家,新加坡国立大学和新加坡国家ai研究院,这个指责指向谁,不言而喻。
林伟伦气极反笑。
以他的权限,他只能看到分数结果,却对测试里的内容一无所知。
合作方唯一能接触到的信息是内部公告和关於会议议程、测试流程的一些统一邮件。
偷测试集,他难道是商业间谍吗?如果是的话,他直接偷模型不好吗,为什麽要去偷一个没什麽用的测试集?
现在理察不仅要作废排名第一的测试结果,还要把提前泄露考题的黑锅扣在他身上?
林伟伦冷笑了一声,说道:「科尔曼教授,你的指责令人发笑,如果你执意要执行这样的决定的话,我会代表新加坡国立大学退出这次合作。」
林伟伦说这话只是在虚张声势,他只是个教授,不是校长,更不姓李。他完全因为专业对口担任合作方的负责人,根本没有权利决定退出合作。
理察果然没被吓到,他微微一笑:「林教授,请便吧。」
林伟伦没等到会议结束就直接走出了会议室,一路回到自己的办公室。
回到办公室之後,他又拿出测试结果的分数看了一遍。
以往的模型测试集主要集中在测试知识、数学能力、编程能力、理解能力和推理能力之类的方向。但是因为智能体应用最近的爆火,ai foundations这一次的测试集特意注重了长程任务的能力,而且占比极高,总分一百分的测
(本章未完,请点击下一页继续阅读)