首页 / 科技

科技

公开评测榜连续四周走平,真实任务成为新锚

数据图表屏幕

榜上分数不再拉开差距。实验室改用内部工单和代码仓库做验收,走平只说明旧题被做满了。

主流公开评测榜连续四周走平。头部模型分差收在误差范围内,实验室把验收改到内部工单、代码补丁和客服对话上。走平说明旧题被做满了,不说明工作场景里没有差距。

对外稿件仍在争夺小数点后的第一。对内,大家已经换锚。谁还把全部研发资源砸在刷公开题上,谁就会在工位上突然掉队。公开榜仍然有用,它只是不再够当唯一的北。

量平并不等于停

检索增强、工具调用和拒答策略,仍能在真实任务里分出高下。一个模型也许在多项选择上难分胜负,却在“根据仓库现状提交最小补丁”时频繁改错文件。另一种情况相反:聊天流畅,却不敢拒答,把不确定的医疗建议说得很满。

这些差距需要任务包才能看见。任务包必须定期更换,以免过拟合。对外少报分数,对内按任务类型拆开看,是目前比较诚实的做法。诚实的代价是:你很难再用一个数字去打广告。

新锚是任务包

好的任务包有三个特征:来自真实分布、有可执行的对错标准、更新频率高于模型发布频率。合同比对要有标准答案和允许的误差;代码任务要能跑测试;客服任务要标出不该说的话。没有标准,评测会重新变成口味讨论。

维护成本很高。这正是公开榜依然存在的原因:它便宜、可引用、适合写进新闻。只是它越来越解释不了采购决策。采购要问的是:接到我们的工单之后,少了几次改派,多了几次必须人工接管。

对外怎么写

如果只报榜单第一,读者会以为竞争结束。把走平写进新闻,是提醒:下一轮比较会离开排行榜,回到工位。媒体需要新的句子,比如“在内部工单上少了三次改派”,而不是又一个百分数。

厂商也该学会这种写法。第一名用旧了。能讲清自己在哪类任务上稳定省时间的团队,会更容易被当成可合作的基础设施,而不是又一个套壳。套壳靠榜单活,基础设施靠任务包活。

走平是镜头该换了

分数还会被刷新,偶尔会再拉开。那并不否定这四周的信号:公开题作为唯一锚,已经不够用。真正的竞赛转移到了谁更敢把评测做成脏活。脏活没有颁奖台,但有账单和工单。