围绕7×24小时客服支持,问题及时解决,九游网页官网持续打磨更优质的服务。
何恺明团队的最新研究成果,在X平台上引发了轰动。
国庆期间上传至arXiv的VISTA论文揭示,过去半年里,全球最顶尖的大模型,实际上都是在“蒙眼”状态下被送入AGI考核的。
同一款Claude Opus 5,在官方标准测试中仅获得了可怜的40分。
何恺明团队只是为它摘掉了“眼罩”,让它能直接观察游戏画面,并递给它一本可以随时翻阅的“相册”。
结果,Claude直接攻克了ARC-AGI-3的全部25个公开游戏,取得了满分100分!
而且,它完成游戏所需的步数,甚至比初次体验的人类玩家少了一半以上。
18个从未接触过的游戏,没有任何说明,AI自行摸索规则并一路通关。
知名AI博主Mark Kretschmann在X平台写道:“赋予Agent‘再看一眼’的能力,差异可能极为显著。”
过去几个月,为了攻克ARC-AGI-3,众多编程高手耗费数千行代码构建世界模拟器。
何恺明团队的判断是,大模型的智力早已足够,限制它的,是视觉和记忆能力。
大模型被一张数字表格,困扰了半年
ARC-AGI-3,是由Keras之父François Chollet和ARC Prize基金会于今年3月推出的AGI测试。它包含一系列交互式像素小游戏,开局没有任何说明或规则,完全依赖玩家自行摸索试错。
评分标准极为严格。官方邀请了近500名人类新手进行实测,AI不仅要通关,其步数还不能超过人类,才能获得满分。
然而,官方测试场提供给大模型的,仅仅是一张64×64的数字表格。人类看到的角色、机关和路径,对模型而言只剩下4096个数字。
这相当于让人闭着眼睛,听别人报坐标来玩《超级马里奥》。
同一帧画面,左边是官方提供给模型的数字表格,右边是VISTA让它直接看到的图像。
VISTA团队所做的第一件事,就是将数字表格替换回图像。
除此之外没有任何改动,GPT-5.6 Sol的分数就从13.33分跃升至47.32分。
使用图像还更节省算力。一个数字格子需要消耗约4000个Token,而一张512×512的图像仅需308个。
运行一局下来,文本版本消耗了7190万Token,图像版本仅需3070万,且分数更高。
仅仅是换上一双真正的“眼睛”,大模型就多得了34分。
仅仅将数字替换为图像,GPT-5.6 Sol的分数就增长了三倍多,能通关的游戏从1个增至9个。
让AI过目不忘,一步多拿24分
仅能看见还不够。一局游戏动辄数百步,多模态模型的通病在于:图像只看一遍,上下文一满就会被删除,或被压缩成几句文字摘要。
当模型想回头核对细节时,那一帧早已消失。
VISTA的核心策略,就是一本无损视觉记忆的“相册”。
游戏输出的每一帧画面,包括动画帧,都按编号完整存档。模型想看哪一帧,随时可以调用inspect功能调出,还能并排对比数帧、放大角落,甚至使用read_pixels读取精确颜色。
最重要的是,翻阅相册不计入步数,只有真正在游戏中进行操作才会计步。
团队将这套机制称为“显式注意力”,翻看哪一帧、查看哪一部分,完全由模型自主决定。
它还随身携带两个笔记本:GUIDE.md用于记录游戏规则,WORKING.md则作为草稿纸。
VISTA的一个回合中,模型观察画面、思考规则,需要时翻阅相册,最后才执行一步操作。
论文中记录了一个极为“拟人化”的操作瞬间。
在BP35游戏的第3关,画面中出现了一个橙色方块。模型点击后,橙色方块变成了“X”。
它先停了下来,将上一回合的最后一帧与刚才的三帧动画调出,并排回放。
几个回合后,它又发现点击“X”能让橙色方块重新生成,当场写道:“这就是我需要的工具,用它搭建天花板,阻挡致命的上升。”
这一关,初次游玩的人类需要44步,而它仅用了34步。
点击橙色方块后,模型先将前后4帧动画调出逐帧对比,理解后才继续行动。
在《吃豆人》游戏中,迷宫中的豆子每吃一颗就少一颗。模型干脆在第13回合和第36回合,两次强行翻回开局第一帧,以记忆迷宫地图寻找路径。
给模型增加上下文、提供更多像素,是许多人的第一反应。但论文测试结果显示,这两种方法都不奏效。
上下文从默认的200K扩展至780K,每局Token从3070万增至1.057亿,但成绩却从99分下降至93.9分。
图像也是如此。放大至16倍后,每帧Token增至1229个,成绩仅为88.3分;仅放大4倍时,成绩为99.7分,甚至高于默认的8倍。
论文的解释是,图像过大,多余的Token白白占用了上下文,但模型并未因此看得更清楚。
上下文从200K拉至780K、图像从8倍放大至16倍,分数反而下降。
更多不一定更好,VISTA的整体设计都遵循这一思路。团队在博客中提到,他们刻意追求极简。
系统中没有一个新训练的模型,每个游戏的提示词都是同一份,总共只有四句话,没有一句指导它具体如何操作。
VISTA提供给模型的全部提示词。
代码派忙碌了整个夏天,它一页笔记就追平了
这个夏天,在ARC-AGI-3上取得高分的主流方案,如Tycho和Schema,都是让大模型为每个游戏编写一套可运行的程序,硬生生构建一个模拟器来反复试错。
仅跳棋游戏LF52一个,Schema就编写了整整4000行Python代码。
而VISTA中的模型,仅用自然语言在笔记中写了三句话,就掌握了同样的规则。
同一条跳棋规则,左边是程序路线的代码(总计约4000行),右边是VISTA模型自行记录的三句笔记。
根据论文所述,VISTA是首个不依赖编写程序,就在ARC-AGI-3上获得满分或接近满分成绩的系统。
这一点在游戏之外更为重要。在真实世界中,没有人能提前为你编写一套4000行的模拟器。
Claude Opus 5打通了25个游戏的全部183关,每个游戏都获得满分,总共走了7302步,仅为人类步数的0.43倍。
GPT-5.6 Sol同样全部通关,获得99分。
在m0r0这个游戏中,人类需要1107步,Claude仅用了219步。这两份成绩在ARC Prize官方平台上均有记录。
ARC Prize官方平台上的记分卡显示,183关全部通关,25个游戏均为满分。
25个游戏逐一比较,蓝色条均比灰色条短,蓝色代表Claude,灰色代表初次游玩的人类。
这套纯机械、零训练的Harness具有极强的通用性。
将其放入带透视的3D画面中,同样获得了84.12分。
套上GPT-5.6 Sol后,在34个网页游戏(包括马里奥、2048、我的世界等)中,任务成功率达到63.3%,直接超越了人类新手(55.3%)。
即使是静态的看图题也能应用。在BabyVision的一道连线题中,不使用VISTA时,模型将驼鹿和兔子连反了;使用VISTA放大后,就正确回答了。
即便是官方实现几乎交了白卷(1.89分)的320B开源模型,套上VISTA后也被硬生生提升至66.93分,暴涨了35倍!
一年三篇,何恺明团队专注视觉
ARC测试的主流解法,一直由大语言模型的文本推理所主导。
但何恺明团队偏不信邪,一年内连续发表三篇论文,专注于同一件事:ARC是视觉问题。
第一篇VARC,一个1800万参数的小型视觉模型从零开始训练,仅凭看图就追平了人类平均分。
第二篇NAT-ARC,先让模型在ImageNet上观察猫狗进行“补课”,抽象推理能力随之增强。
第三篇就是VISTA,不再训练小型模型,而是直接为前沿大模型配备“相册”。
何恺明团队一年三篇ARC论文,都押注在“ARC是视觉问题”这一观点上。
串联起这三篇论文的,是何恺明的博士生胡珂雅,本科毕业于上海交大ACM班,三篇论文中两篇为一作、一篇为二作。
VISTA的另外两位共同一作是MIT博士生Qiushi Han和Linlu Qiu,MIT副教授Cathy Wu也在作者名单中。
曾经凭借ResNet和MAE封神的何恺明,这次将视觉路线一路推进了AGI考场。
这也是对整个行业默认路线的挑战。
过去几年,大家拼命扩大模型规模、延长推理过程,智能的进步几乎都押注在模型本身。
VISTA让同一个Claude从40分打到满分,依靠的却是模型外部的一双眼睛和一本相册。
ARC Prize联合创始人Mike Knoop也判断,越来越多的“学习”将发生在模型权重之外。
通往AGI的下一程,比拼的是谁能让模型看清世界、记住世界。
何恺明团队的下一步,是充满真实画面的具身环境,那里没有人会提前将世界翻译成一张数字表格。
参考资料:
https://x.com/mark_k/status/2106377357078450620
本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。关于更多AI前沿资讯,可访问九游网官方网站获取。
九游网页官网致力于为用户提供稳定、流畅的在线娱乐体验,实时更新热门体育赛事与电竞资讯,让每一位用户都能轻松畅享精彩互动内容。
最新评论
王强
作为体育爱好者,九游网页官网是我的首选平台。赛事覆盖全面,从足球到网球应有尽有,客服响应速度也很快。
李明
九游APP的界面设计非常人性化,操作简单。我经常用它查看篮球赛事比分,推送通知也很及时,非常满意。
张伟
通过九游娱乐网站观看电竞比赛直播,画质清晰,延迟低。平台还提供丰富的数据分析,帮助我更好地了解比赛动态。