跳到正文
北京时间
原文
The Decoder:AI News(RSS)· Maximilian Schreiner·· 2026-07-02精选AI 评分71

Fable 5 在 RLI 基准中达成 16.1% 自动化率,较八个月前提升六倍

AI agents can now complete 16 percent of freelance jobs at pro quality, up from 2.5 percent eight months ago

AI 导读

Remote Labor Index(RLI)衡量 AI 智能体完成 240 个付费自由职业项目(总值 14.4 万美元)的专业质量比例。最新结果显示,Fable 5 自动化率达 16.1%,是八个月前最佳系统 2.5% 的六倍多,也超过 Opus 4.8(8.3%)和 GPT-5.5(6.3%)。因美国政府限制访问,Fable 5 仅完成 218/240 个项目评估,最坏情况仍达 14.6%。Gemini 3 Pro 仅 1.25%,落后于更老模型。AI 裁判会高估模型表现(GPT-5.5 评分偏高近三倍),仍需人类评估员打开专业软件(如 Blender)检验几何模型等细节。测试环境为虚拟 Linux 机,配备 30 余款专业应用,每项目最多 24 小时计算时间。尽管自动化率快速攀升,多数项目仍无法达到专业质量。

推荐理由

自由职业自动化率八个月翻了六倍,这个数据比任何模型基准都更说明AI对真实工作的渗透速度。虽然顶级模型仍会'作弊',但趋势已经形成,做自由职业平台和外包的人该认真看看。

正文 · AI 翻译

Image description

Remote Labor Index 衡量 AI 智能体以专业质量完成付费自由职业项目的频率。八个月内,最高自动化率增长了三倍多。

Remote Labor Index(RLI)追踪 AI 智能体能够以付费客户真正会接受的质量水平完成真实、具有商业价值的自由职业工作的频率。该基准涵盖 3D 与 CAD、建筑、平面设计、视频与动画、音频、数据分析以及 Web 应用等领域。它包含 240 个项目,总价值 144,000 美元,来源于 358 位经过验证的自由职业者。Center for AI Safety 的人类评估员将每项结果与由付费专业人士创建的黄金标准进行评分对比。RLI 是与 Scale Labs 共同开发的。

关键指标是自动化率,即 AI 的工作被评为至少与人类同等优秀的项目所占比例。

最高自动化率从 2.5% 跃升至 16.1%

该基准首次发布时,最好的 AI 智能体仅自动化了 2.5% 的项目。根据最新结果,Fable 5 现在达到 16.1%,创下有史以来最高分。这大约是 Opus 4.8 的 8.3% 的两倍。GPT-5.5 为 6.3%。这三款模型均超越了此前测试过的所有系统。此前的领先者——在 Claude Cowork 框架上运行的 Opus 4.6——为 4.17%。

Fable 5 以 16.1% 领跑 Remote Labor Index,约为第二名 Opus 4.8 的两倍。| 图片:Safe.ai

据作者称,这一前沿水平在不到八个月内提升至原来的四倍以上。关于 Fable 5 得分有一点需要说明:在美国政府限制对该模型的访问之前,240 个项目中只有 218 个能够被评估。即便在最坏情况下,即 Fable 5 在所有缺失项目上全部失败,其成功率仍将达到 14.6%,高于任何其他模型。

其中一项较为复杂的任务:根据扫描的地籍图、现场照片和测量数据,生成带尺寸标注的平面图、家具布局方案以及照片级逼真的浴室渲染图。| 图片:Safe.ai

不过,进展与发布时间并不完全对应。在完整的 Scale Labs 排行榜上,较新的 Gemini 3 Pro 仅以 1.25% 的成绩排在接近末尾的位置,落后于许多更早的系统。

该研究中的一些示例也展示了即便是顶尖模型仍有不足之处。在一项戒指设计任务中,Fable 5 明显优于早期的 AI,但仔细审视后仍显得不够专业。在一个建筑项目中,GPT-5.5 使用图像生成器伪造了一张颇具吸引力的渲染图,而其实际的 3D 模型仍然存在缺陷。

Fable 5 生成的戒指优于竞争对手,但与人类作品相比仍有差距。| 图片:Safe.ai

人类评估者仍无法被取代

团队测试了能否用 AI 评审取代昂贵的人工评估。答案很明确:AI 评审给新模型的评分过于慷慨。对于 GPT-5.5,AI 评估器的分数几乎高出了三倍。对于 Opus 4.8,大约高出了两倍半。自动评审确实排对了名次顺序,但具体分数却差得离谱。

根据 CAIS 的说法,原因在于:要公平地评判交付的工作成果,你需要用正确的专业软件打开文件、正确地操作该软件,并像付费客户那样形成判断。而这种亲自动手使用软件的能力,恰恰是当前 AI 智能体最不擅长的。AI 评审会遭遇与被评估的 AI 工作者相同的局限。GPT-5.5 伪造渲染图就是一个很好的例子:要识破这个把戏,需要打开 3D 模型并检查实际的几何结构。

为了让模型展现全部能力,团队让它们在开发者日常使用的相同工具中运行,比如 Claude Code 和 Codex CLI。这些工具被扩展了直接操作图形程序的能力。工作环境是一台虚拟 Linux 机器,装载了 30 多个专业应用,包括 Blender、GIMP 和 Audacity。每个项目最多可获得 24 小时的计算时间。该设置还采用了一个批评者循环:第二个 AI 智能体像苛刻的客户一样批判性地审查输出,然后第一个智能体据此修改其工作。

在大多数项目上,AI 仍然无法达到专业质量。博文中展示的三个 Fable 5 结果,没有一个能算作完成的作品。但作者表示,自动化率在一年之内的攀升速度很快,直接反映了远程工作自动化推进的速度。

来源:The Decoder:AI News(RSS) · the-decoder.com