AI 图解

吴恩达 AGI 新测试图解:图灵-AGI 测试

会不会聊天不重要,能不能上岗干活才算数。

目录

这是什么

吴恩达在 2026 年初提出「图灵-AGI 测试」(Turing-AGI Test),认为传统图灵测试(靠对话骗过人类评估者)在 AGI 时代不够用了——现在的 AI 要能完成经济上有用的工作。

核心设想:

  • 测试对象:AI 系统或专业人士
  • 设备:一台能上网、带浏览器、能开 Zoom、能收发邮件的电脑
  • 任务:评委任意设计一个持续多天的真实工作任务,测试前双方都不知道任务内容
  • 通过标准:AI 能像人类一样熟练完成工作任务

为什么重要

  • 现有基准测试(GPQA、AIME、SWE-bench 等)都有固定测试集,团队会针对测试集调模型,导致榜单好看、真实场景能力不足
  • 图灵-AGI 测试直接对标经济性和实际产出——衡量标准就是能不能像员工一样上岗干活,更贴近 AGI 的本义
  • 吴恩达表示可能举办一场公开测试,让所有 AI 参与;即便全部不达标,也能给过度炒作降温,让行业回到务实进步

图解

Gemini 分享的图解:https://gemini.google.com/share/5e47b464411a

参考报道:量子位《吴恩达:图灵测试不够用了,我会设计一个AGI专用版》

内容整理自公开报道(量子位),仅作学习分享;如涉版权请联系删除。

— 完 —

返回首页