吴恩达 AGI 新测试图解:图灵-AGI 测试
会不会聊天不重要,能不能上岗干活才算数。
这是什么
吴恩达在 2026 年初提出「图灵-AGI 测试」(Turing-AGI Test),认为传统图灵测试(靠对话骗过人类评估者)在 AGI 时代不够用了——现在的 AI 要能完成经济上有用的工作。
核心设想:
- 测试对象:AI 系统或专业人士
- 设备:一台能上网、带浏览器、能开 Zoom、能收发邮件的电脑
- 任务:评委任意设计一个持续多天的真实工作任务,测试前双方都不知道任务内容
- 通过标准:AI 能像人类一样熟练完成工作任务
为什么重要
- 现有基准测试(GPQA、AIME、SWE-bench 等)都有固定测试集,团队会针对测试集调模型,导致榜单好看、真实场景能力不足
- 图灵-AGI 测试直接对标经济性和实际产出——衡量标准就是能不能像员工一样上岗干活,更贴近 AGI 的本义
- 吴恩达表示可能举办一场公开测试,让所有 AI 参与;即便全部不达标,也能给过度炒作降温,让行业回到务实进步
图解
Gemini 分享的图解:https://gemini.google.com/share/5e47b464411a
参考报道:量子位《吴恩达:图灵测试不够用了,我会设计一个AGI专用版》
内容整理自公开报道(量子位),仅作学习分享;如涉版权请联系删除。
— 完 —
返回首页