从Alpha Arena到UP主出题:AI评测为什么都在下场?

随着GPT-6发布,人类进入AGI时代。根据OpenAI 官方资料,GPT-6 Astra已经开始向部分企业开放,API以及Plus、Pro、Business和 Enterprise 用户会在随后数日陆续获得使用权限。

随着GPT-6发布,人类进入AGI时代。根据OpenAI 官方资料,GPT-6 Astra已经开始向部分企业开放,API以及Plus、Pro、Business和 Enterprise 用户会在随后数日陆续获得使用权限。它拥有105万 Token上下文和12.8万Token 最大输出,支持网页搜索、文件处理、代码、计算机操作、MCP、Skills与多 Agent协作真正的变化,是AI开始完成整项工作。

过去的大模型更像是一个顾问:你来问问题,它给一段答案;后面的工作仍然由人完成。GPT-6强调的却是“端到端工作”。它可以进入浏览器和专业软件,调用不同工具,持续推进多步骤任务,最后交付文档、表格、程序或研究成果。新增的异步工具调用,还让它在等待一个工具时继续处理其他环节;任务进行到一半,用户也可以补充要求、修正方向,不必全部推倒重来。光是这一点就让无数的创作者和企业心动不已。

为什么评测都开始下场?我想主要是这几点:

一、是行业自己不太信跑分了。纸面分数和真实任务之间隔着一条鸿沟,静态基准越来越难回答"这个模型到底能不能用"。

二、是模型的活儿变了。现在的模型不只会聊天,还会调工具、跑流程、执行多步任务,这些能力只有放进真实场景里才测得出真假。

三、是评测本身成了注意力生意。UP 主出题是内容,全民盲测是参与感,谁的下场姿势更真实,谁就更能赢得开发者的信任。

但“下场评测”也会带来新的问题,任务越接近真实世界,往往就越难做到绝对公平。同一道题换一个提示词、换一套工具,甚至换一种评分标准,结果都可能不同。最后比的到底是模型本身,还是模型加上提示词、工具链和操作策略,这件事其实还挺值得讨论多。

b站的无限竞技场榜单,不看跑分而是全民参与实测,更精准的理解语境,目前来看想法挺好的,可以持续关注一下,最重要的还是要有更多有价值的主题出现。

descript

descript

descript

THE END
责任编辑:飞天影视
免责声明:本站所使用的字体和图片文字等素材部分来源于互联网共享平台。如使用任何字体和图片文字有冒犯其版权所有方的,皆为无意。如您是字体厂商、图片文字厂商等版权方,且不允许本站使用您的字体和图片文字等素材,请联系我们,本站核实后将立即删除!任何版权方从未通知联系本站管理者停止使用,并索要赔偿或上诉法院的,均视为新型网络碰瓷及敲诈勒索,将不予任何的法律和经济赔偿!敬请谅解!

栏目精选