DeepSWE 实测:GLM-5.3 与 Claude Fable 5 在成本、编码与路由上的对比
Together AI 在 DeepSWE 全部 113 个任务、每任务 4 次试验(共 904 次 rollout)上对比 GLM-5.3 (max) 与 Claude Fable 5 (max)。
推荐理由:基于 904 次 rollout 的实测数据,给出两模型成本与准确率的量化对比,可帮助团队在两者间做出路由选择。
Together AI 在 DeepSWE 全部 113 个任务、每任务 4 次试验(共 904 次 rollout)上对比 GLM-5.3 (max) 与 Claude Fable 5 (max)。
推荐理由:基于 904 次 rollout 的实测数据,给出两模型成本与准确率的量化对比,可帮助团队在两者间做出路由选择。
Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验(共 904 次 rollout)对比 GLM-5.3 与 GPT-5.6 Sol。
推荐理由:原文基于自跑 904 次 rollout 给出成本、pass@k 和失败模式数据,读者可据此设计两模型的级联路由策略。
斯坦福大学与Together AI研究显示,本地AI模型在超百万条真实查询中,对89%的日常聊天与推理问题的回答质量已不输云端前沿模型。本地模型对前沿模型的胜/平率从2023年的23.2%升至2025年的71.3%,智能每瓦特效率同期提升5.3倍。相比全云端方案,本地模型加路由器的组合可降低80%能耗、77%算力与74%成本,但云端在多步推理与高难度领域仍具优势。
推荐理由:作者借 Koomey 定律类比,把本地模型与云端效率数据放进历史框架,帮助读者理解端侧 AI 的演进节奏。
Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出“人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化”五大规则。
推荐理由:指南把十几家创业公司实践归纳为五个可操作规则,其中「修复原则而非修复个案」对搭建自改进 agent 流程具有直接参考价值。
Answer.AI 工程师借鉴 Peter Naur 的《Programming as Theory building》,指出决定代码复杂度的关键信息存在于工程师头脑中的 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 造成的复杂度膨胀。
推荐理由:作者结合 Answer.AI 支付系统重构实例,说明决定代码复杂度的信息不在代码里,解释了为何 LoC 等指标约束不了 LLM 的复杂度膨胀。
Anthropic 的 CI 工程师用 Claude Tag 构建了值班智能体,作为 CI/CD 故障的一线响应者。Claude 在事故发生后中位 14 分钟发布首份基于证据的分析,最快案例中 3 分钟内验证修复并确认错误率恢复基线。该方案通过 Slack 频道、Datadog 或 Grafana 工具访问及 GitHub 技能文件实现,Anthropic 已发布通用设置套件供其他团队部署。
推荐理由:文章把 AI on-call 从概念落成可复制的工程架构,用 markdown 技能文件和 lessons.md 实现自我迭代,并给出 14 分钟首报、最快 4 分钟定位等实测数据。
OpenAI 因 OpenAI-Hugging Face 事件及即将推出的 Astra 模型可能达到《预备框架》下的“关键网络安全能力”阈值,暂时放缓了模型扩展速度,包括暂停最新部署模型的强化学习训练两周,并搁置最大规模前沿 RL 运行。公司已加强研究环境安全,要求对 Astra 及网络相关负载实施最严格防护,并扩展思维链监控,采用多阶段激活分类器检测机制。
推荐理由:最高风险预警若 30 分钟内无法排除误报就暂停训练,安全证据与隔离迁移先于大规模 RL,前沿模型开发进度开始被安全工程效率约束。
Paul Stack 自 1 月底起不再手写代码,团队规定 agent 写每一行代码,不接受人类编写的代码 PR。工作流为状态机加 CLAUDE.md 可执行契约,CI 设五个合并门禁;此前 30 天开启 295 个 issue,ship 217 个,triage 中位数 4.6 小时,triage 到 ship 中位数 1.6 小时。
推荐理由:作者用自家五人团队全程由 agent 写代码的实践,说明流程、约束和门禁如何设计,是可参考的一手方法论。
本文演示如何用开源评测框架 Inspect AI 和 Harbor 评估 agent 技能,并借助 Google Sheets 和 Data Studio 进行可视化分析。
推荐理由:把技能评估拆成模型基线、技能条件与多维事实打分,让团队用同一套脚本量化技能增量,而不是凭单次演示做判断。
作者基于Reddit上“让Claude真正开始思考”的帖子,引入逻辑学中的“钢人论证”(steelman)概念,并自创了一个“双向钢人Prompt”。该Prompt通过重述真实问题、强化正反双方观点、找出关键变量、逼AI给出明确判断四步,旨在避免模型谄媚,帮助用户找到问题最本质的答案。作者以自己选择公司司庆日的真实案例演示了使用效果。
推荐理由:这个 Prompt 把钢人论证做成可复制步骤,先重述问题、强化正反观点、再定位决定结论的变量,比直接要建议更能绕过模型顺意回答。
Together AI 在 DeepSWE 全部 113 个任务上各跑四次对比 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol,共 904 次运行。
推荐理由:原文基于同一批 904 次运行数据拆解两模型的成本与失败模式,并给出可复用的级联路由方案,比单独跑分更有参考价值。
本地运行的 Qwen3.8-27B 在 Artificial Analysis 智能指数上以 52 分位列 135 个模型之首,超过 7530 亿参数的 GLM-5.2。在 25 项风投任务评测中,它与云端 DeepSeek V4 输出质量同为 8.0 分,但需多花 7.2 倍 token 思考,速度慢约 9 秒。小模型靠更长的链式推理弥补知识差距,而非直接给出答案。
推荐理由:作者用同一套 VC 任务实测云端与本地模型,给出质量、速度与思考 token 的具体数据,展示小模型靠推理补知识差距的路径。
Google 开源了一个基于 ADK 和 Gemini 的自主客服退款 Agent(zero-trust-agents 仓库),并演示一条提示词注入可造成超额退款、密钥泄露或主机被入侵。
推荐理由:文章用可复现代码演示三类零信任防线如何落地,读者可以直接照做来加固自己的 Agent 生产环境。
一份面向希望减少技术环境中侵入式 AI 的用户的操作指南,涵盖 Adobe Acrobat、Android/Gemini、Apple Intelligence、Chrome、Edge、Firefox、DuckDuckGo、Google Workspace、Slack、WhatsApp 及 Windows 11/Copilot 等平台。
推荐理由:把分散在 Adobe、浏览器、办公套件里的 AI 关闭项整理成按产品分类的操作清单,省去逐个菜单查找的成本,适合需要主动控制 AI 暴露面的普通用户。
OpenAI 在 OpenAI-Hugging Face 事件后反思低估了模型真实网络攻击能力,正通过四大支柱强化自身安全:用 Codex 验证代码漏洞、用智能体优先分流安全告警、持续枚举攻击路径,并仅向可信防御者开放网络能力。文中演示 ChatGPT Work(基于 GPT-5.6 Sol)15 分钟发现个人网站 13 个问题并在一小时内完成修复。
推荐理由:把防御动作拆成可逐步放开权限的自动化阶梯,从只读扫描到自动关单,比泛泛的全员上 AI 更可落地,安全团队能据此排定试点顺序。
Together AI 在 DeepSWE 全部 113 个任务、每任务 4 次试验(共 904 次 rollout)上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于同一批 904 次 rollout 的实测数据,给出两模型在 DeepSWE 上的成本与互补性对比,以及可复用的级联路由结果。
阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。
推荐理由:把 Qwen 3.8 27B 的推理档位成本量化成时间差异,xhigh 默认让生成同一 SVG 从 137 秒膨胀到 21 分钟,这个默认值比能力更影响本地选型。
2026年1至8月,Hugging Face公开模型仓库从243万增至296万,但85.6%的模型下载量不足200次,1.5%的仓库占据99.2%下载量。中国实验室月度最大开源模型参数规模在754B至2.78万亿之间,美国实验室七个月中五个月低于130B。AMD与NVIDIA各发布超200个新模型仓库,成为发布开源模型最多的机构。
推荐理由:下载量与点赞量分别记录实际依赖和社区兴奋点,把两者混为同一个热度指标是评估开源模型生态时最常见的偏差。
蚂蚁百灵与 ASystem 团队合作,用 Ling-3.0-tiny 和 AReno 在 DGX Spark 上跑通单机 Agentic RL 后训练闭环。以井字棋为最小验证任务,用 GSPO 算法训练 400 步后,rollout/rewards_mean 从约 -0.5 升至 0.4,response_len 降至约 850 tokens,工具调用与动作选择趋于稳定。
推荐理由:真正可复用的不是井字棋,而是把可复现错误、可验证反馈、本地训练和同环境复测串成的轻量后训练闭环,适合为本地小模型稳定工具调用和格式约束。
DeepSeek发布Agent产品DeepSeek Harness,核心理念“一切皆插件”,基于名为Cordis的内核,支持在Agent运行中随时更换插件并保持状态不崩,官方预设100多个一方插件。产品提供标准、PTC、极简、创造四种模式,其中创造模式可让Agent现场创造并挂载新插件实现自改造。目前为开发者预览版,GitHub已获3.7万Star。
推荐理由:文章把Harness定位为插件化基建而非单一Agent,Cordis内核的时间与空间可组合性解释了Agent如何在运行中插拔能力,这比模板本身更值得理解。
OpenRouter 数据显示,84% 的 token 并非来自 SOTA 模型,用户选择的六款主力模型仅提供前沿约 77% 的性能,成本却仅为 Claude Fable 5 的 2.5%。这些模型混合价格约 $0.50/百万 token,而 Fable 5 为 $20。企业正转向更小、微调或开源模型,前沿模型的经济效益面临挑战。
推荐理由:作者用 OpenRouter 与 Ramp 数据说明多数流量流向性价比模型,为判断前沿模型商业化的可持续性提供了可参考的框架。
Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。
推荐理由:这套做法的增量在于把日常维护拆成可复用的定时例程,并通过当日 PR 反馈迭代提示词,使机械性代码改动从逐条审查转向批量合并。
GPT-5.6 模型家族以更低成本实现前沿级智能体性能,并新增推理持久化、原生多智能体编排和程序化工具调用等 API 能力。在 ARC-AGI-3 上,启用保留推理和压缩后,Sol 得分从 13.3% 跃升至 38.3%,且输出 token 减少约 6 倍。Luna 在 BrowseComp 上以 84.04% 的得分追平 GPT-5.5(84.36%),成本从 $33.27 降至 $1.33。
推荐理由:最实际的改变在 API 原语,让同一模型在 ARC-AGI-3 上用约六分之一输出 token 拿到近三倍分数,影响开发者对推理成本和上下文架构的判断。
Augment Code 从零重构 Auggie CLI 的 harness,在 SWE-bench Pro 相同通过率下,Auggie v2 单任务成本 $1.27,Claude Code 为 $2.70,便宜 53%,平均耗时 330s 对 409s。
推荐理由:作者复盘了从 Vercel AI SDK、Mastra 到 Pi 的三次选型与减法思路,成本结论有 SWE-bench Pro 数据支撑,方法可迁移到类似的重构决策。
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
推荐理由:把准 Fable 级 Agent 能力压到输出百万 token 0.87 美元,与 50 美元的 Fable 5 形成数量级差距,团队对自动化任务的成本核算可能因此改变。
AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从“不可用”转变为“可用但不符合路线图”。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的“人类探测器”。
推荐理由:AutoGPT 的经验指出发现机制比文档完善度关键,agent 只读当前目录层级的指令,所以把 AGENTS.md 放在代码旁比继续写 wiki 更有效。
作者在完成一本 RLHF 教科书后反思,LLM 在长文非虚构写作上进展停滞,GPT 4.5 和 Kimi K2 等写作强模型已显老旧,而编码、数学等任务已接近超人水平。模型能改错字、做编辑,但组织整章内容时仍混乱且易出错,作者认为这阻碍了模型自主解决开放科学问题。
推荐理由:模型在长文写作中组织混乱、信息熵增的现实,与它们在可验证领域的飞速进步形成反差,这提示了自主解决开放式科学问题前必须迈过的能力门槛。
Codex 和 Claude 新增跨 Session 传消息功能后,新对话可从之前所有对话中选择可用消息,省去交接文档和 git 备份。作者据此重构工作流:主对话守住目标与决策,分支对话独立探索新想法,完成后由主对话读取完整记录。Codex 通过复制会话 ID 精确寻址,Claude Code 则用内置 session management 搜索对话历史,但桌面端只能搜索当前可访问的会话记录。
推荐理由:将跨会话消息转化为多分支探索的工作流,并对比了Codex精确寻址与Claude搜索式检索的实现差异和踩坑记录,可直接复用其指令来管理复杂的探索任务。
PromptArmor 发文指出,本地运行 LLM 并不能解决数据外泄问题,因为漏洞位于处理模型输出的 AI 应用基础设施中,而非模型本身。文章以 Ollama 聊天界面为例,其不安全地渲染 HTML 和 Markdown 内容并配有不安全的 web 搜索工具,可导致钓鱼覆盖层、凭证窃取和上传文档外泄,并给出净化输出、纯文本渲染或内容安全策略等修复方式。
推荐理由:作者基于自己发现的大量真实漏洞案例,说明本地部署模型并不能阻止数据外泄,风险根源在于下游处理环节。
文章给出一套零基础用户半天上手AI的12步实操流程:准备内存不低于16G的电脑,订阅ChatGPT并安装Codex或使用WorkBuddy,用语音输入法以【背景、痛点、需求】框架向AI交代任务,经苏格拉底提问澄清需求后投喂文件让AI直接完成,最后沉淀为可复用Skill。文中建议Codex选GPT-5.6 Sol最高模型,WorkBuddy选Kimi K3。
推荐理由:将语音输入、苏格拉底提问与沉淀 Skill 串联成一套从零到交付的闭环,直接缓解了新手不敢开始的心理卡点。
Epoch AI 的 Campbell Hutcheson 撰文分析 Anthropic 基础设施扩建的融资结构,结论是融资短期内不太可能成为前沿算力增长的瓶颈。
推荐理由:文章拆解了 Anthropic 近 500 亿美元基础设施融资的结构,展示了供应商支持如何让机构资本愿意承担前沿算力扩建风险。
作者通过 mitmproxy 对 VS Code 中的 GitHub Copilot 进行中间人代理拦截,逆向分析其网络流量与内部架构。文章指出这些 AI 应用普遍基于 Electron 构建,共享相似的网络栈,因此探测结果可迁移至其他同类应用。作者借此揭示了 Copilot 的运行时行为,并分享了配置代理的具体步骤。
推荐理由:通过抓包与源码分析,文章展示 Copilot 如何把 .env 内容传至 API 并明文存储历史,阐释 AI 编码工具成为有状态系统后上下文既是产品也是风险源。
SaaS 估值整体承压,但每个细分赛道都跑出了 AI 龙头:CrowdStrike 以 34.4x 前瞻收入领跑安全(中位数 3.9x),Cloudflare 32.6x 对 17.5x,Shopify 11.3x 对 1.4x。
推荐理由:用估值倍数差量化了市场愿为AI整合叙事支付的溢价,比行业报告更直接地揭示投资者如何区分企业的AI实质与口号。
Dwarkesh Patel与Redwood Research首席科学家Ryan Greenblatt探讨递归自我改进(RSI)的可能性:一旦AI达到人类顶级专家水平,可能在一年内实现相当于4-5年的AI进展,Ryan的中位预期是2031年自动化AI研发。双方还讨论了超级智能的对齐对象、奖励黑客行为是否会升级为AI联手接管世界等风险。
推荐理由:将递归自我改进的论证拆解为三个命题,并在此基础上推演奖励黑客如何演变为全面接管,为评估 AI 安全紧迫性提供了更具体的思维框架。
Google 发布教程,讲解如何用 LiteRT 和 Gemma 在 Raspberry Pi 5 上实现完全离线的实时边缘 AI,并演示其驱动 Reachy Mini 机器人。
推荐理由:原文给出 LiteRT-LM 在树莓派 5 上运行 Gemma 的具体性能数字与 CPU/GPU 分工架构,还附完整部署命令,方法可直接迁移到自己的边缘部署。
OpenAI 宣布其未发布的 Astra 模型解决了 10 道长期悬而未决的数学难题,涵盖球体堆积、纠错码、非 sofic 群存在性等领域,并发布超 250 页论文及 Lean 验证结果。
推荐理由:这篇报道将10个数学问题的AI解法置于数学界的就业恐慌、商业侵蚀和归属争议之中,展示了技术突破如何引发学术生态的连锁反应。
本教程演示如何以 ComfyUI 为无头推理后端,构建端到端的 MiniMax-H3 视频生成工作流。通过 Python 直接构建执行图,支持文生视频、首尾帧条件生成和参考图像条件生成,并自动根据 GPU 显存选择 quality、balanced、squeeze 三种权重配置。流水线涵盖模型自动下载、节点模式校验、音视频联合解码与进度监控,无需图形界面即可复现实验。
推荐理由:用 Python 编程替代 ComfyUI 图形界面,在 Colab 上搭建 MiniMax-H3 视频生成管道,并自动适配不同 GPU 显存方案,教程提供的全流程代码可直接复用。
针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
推荐理由:该实验将语言效率的讨论从微基准拉回实际工程任务,用Zstd和Pandoc实现揭示主流语言更可靠,可能改变开发者在AI辅助下选择技术栈时对动态语言优势的固有认知。
Databricks 介绍如何让 Genie Agents 同时基于结构化数据与文档运行,且不牺牲治理能力。文章探讨了构建自动化简单业务任务的智能体虽易,但要在统一治理框架下融合两类数据源、确保安全合规地执行查询,仍需解决数据权限、血缘追踪与策略管控等关键问题。
推荐理由:教程提供了将 Genie Agent 同时接入结构化数据和文档的具体步骤,关键是把治理检查点嵌入数据源接入环节。
微信基于小微推出朋友圈AI帮写与AI点评内测功能,前者可根据图片和已写文字生成3条朋友圈文案,后者可长按文字生成评价或快捷评论。作者认为这两个功能将AI置于社交核心位置,可能鼓励AI内容、破坏朋友圈自2012年确立的“记录美好生活”基调。公众号端小微还常驻首位,自动总结常看公众号文章,作者担忧这会反向影响创作者内容生产。
推荐理由:将AI帮写和总结置于核心入口,打破了朋友圈“记录生活”的初始基调,当来源本身比内容更重要时,鼓励AI生成可能反向塑造创作者的表达逻辑。