返回

第三百八十四章 双标

首页
关灯
护眼
字:
大
中
小
上一页 回目录 下一章 进书架
    第三百八十四章 双标 (第3/3页)

试题中有三十五分是与长程任务的管理有关的。

    当然,这里说的分并不是像学生考试做卷子一样,四个选项里蒙一个,对了就拿分。具体的测试过程相当复杂,每一题都要完成一个跨度长达几个小时、进行很多个步骤才能完成的任务,最後成功之後才能拿到一分,有时甚至要重复多次来验证稳定性,取平均分。

    在这样的新标准下,现在的公开模型评分普遍不算太高。

    之前霸榜了很久的汤圆0.9只有70.2分。

    gemini的新模型最终得分70.8分,openai的gpt-v-ii最终得分71.7。

    分数第二高的金星模型2.0得分是72.3分。

    互相之间咬的很紧。

    只有汤圆1.0,得分93.5,比第二名领先了二十多分。

    说实话,这种程度的领先,林伟伦也不理解。

    但正是因为不理解,他更不能接受理察等人毫无理由的打压。打不过就修改规则?这些傲慢的西方人。

    林伟伦翻看起了源智科技来参会成员的联系方式,他决定等对方到了之後,亲自过去交流一下。

    至少要让他们知道自己所受到的不公正待遇。如果他们需要帮助的话,林伟伦也做好了准备。

    另外一边,理察刚刚接通和矽谷的电话。

    电话那边的是nexus ai的ceo瑞恩。

    「测试成绩你看到了吗?」理察一边喝红茶一边说道,「恭喜你啊,瑞恩,这次你可是堂堂正正的打败了山姆。」

    「看到了,还要多亏了老师你的指点。」瑞恩说道。

    在他的学术生涯中,瑞恩曾经和理察有过友好的学习关系,这个关系一直保留了下来,在他的创业过程中也起到了很大的帮助。

    就拿这次来说,如果没有理察在大方向上的指点,甚至指出了某些极为具体的技术挑战,金星2.0的研究方向肯定也会优化长程任务,但是出来的效果能不能有现在这麽好,瑞恩也不敢保证。

    「很好,听说mcp最近的推广也很有成效,我为你自豪。」理察在电话里笑了两声,「期待在新加坡见到你展示你的最新成果。我知道,你的对手,那个汤圆协议公司的人也会来,但是你放心,你会得到我的支持。」

    理察没提汤圆1.0的事。

    毕竟他是真心认为,这个模型是作弊了,大部分顶级模型之间的差距都在一两分之间,这个模型一次高出二十分去,除了作弊他想不到别的原因。

    虽然理察也没想出他们是怎麽作弊的,但这不重要。

    电话挂断之後,瑞恩靠在老板椅的椅背上,把双脚翘上了办公桌的桌面,同时鼻子里哼起了义大利小曲。nexus ai的最新模型能力超过了openai的最新模型。

    值得纪念的一天。

    什麽叫技术储备啊?这就是技术储备!
上一页 回目录 下一章 存书签