最新精选 第 101–120 条 · 共 716 条 04:04 OpenAI:官网动态(RSS · 排除企业/客户案例) 04:04 精选AI 评分 59 59 GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。
推荐理由:在 Terminal-Bench 2.1 上,GPT‑5.6 Terra 在 Kiro 中完成任务的成本约下降 82%,为长周期编码任务的投入产出评估提供了一个量化基准。
00:00 Tessl:产品与工程博客 00:00 精选AI 评分 66 66 Tessl 研究工程师 Amy Heineike 提出 harness engineer 这一新角色,认为智能体大量写码后工程工作不是变少而是形态改变。其自建技能基准测试显示任务完成率高但平均只有约 70% 的技能指令被真正遵守;Tessl 近一周约 90% 代码经内部软件工厂生成,并给出从最近 50 个 PR 提炼不变量、转为 CI 门禁等三项可本周上手的练习。
推荐理由:作者基于自家软件工厂的实测数据,提出 harness engineer 角色和三个可上手的技能方向,适合想管理 AI 代码质量的工程师参考。
22:28 Claude:Blog(网页) 22:28 精选AI 评分 73 73 Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。
推荐理由:把各阶段产物固化为可版本化 markdown 并让下一阶段读取,人工审查就从逐行看代码转向在关卡看代理标记,对改造研发流程的团队有直接参考价值。
08:00 Together AI 研究与产品博客(RSS) 08:00 精选AI 评分 79 79 Together AI 在 DeepSWE 全部 113 个任务、每任务 4 次试验(共 904 次 rollout)上对比 GLM-5.3 (max) 与 Claude Fable 5 (max)。
推荐理由:基于 904 次 rollout 的实测数据,给出两模型成本与准确率的量化对比,可帮助团队在两者间做出路由选择。
08:00 Together AI 研究与产品博客(RSS) 08:00 精选AI 评分 72 72 Together AI 在 DeepSWE 全部 113 个任务上各跑 4 次试验(共 904 次 rollout)对比 GLM-5.3 与 GPT-5.6 Sol。
推荐理由:原文基于自跑 904 次 rollout 给出成本、pass@k 和失败模式数据,读者可据此设计两模型的级联路由策略。
21:26 Claude:Blog(网页) 21:26 精选AI 评分 65 65 Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出“人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化”五大规则。
推荐理由:指南把十几家创业公司实践归纳为五个可操作规则,其中「修复原则而非修复个案」对搭建自改进 agent 流程具有直接参考价值。
22:17 公众号:百度智能云(文心) 22:17 精选AI 评分 64 64 百度千帆今日上架智谱开源旗舰模型GLM-5.3,API定价与智谱官方保持一致。该模型与上代同架构、同参数,依靠后训练Scaling在代码与网络安全能力上表现超预期,AA综合智能指数取得60分,与Kimi K3并列开源模型第一。开发者可通过API调用或订阅Token Plan企业版接入Claude Code等AI工具使用。
推荐理由:GLM-5.3 与上代同参数却靠后训练 Scaling 进入前沿,单任务成本又是同档最低,这让原本受调用成本限制的长链路智能体和编码任务有了开源可选项。
09:11 公众号:智谱(GLM) 09:11 精选AI 评分 79 79 GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。
推荐理由:GLM-5.3 把前沿智能的单任务成本压到同档最低,模型选型时成本与智能可以放在同一优先级比较,而不必默认高价闭源旗舰。
08:00 Answer.AI 官方研发博客(RSS) 08:00 精选AI 评分 63 63 Answer.AI 工程师借鉴 Peter Naur 的《Programming as Theory building》,指出决定代码复杂度的关键信息存在于工程师头脑中的 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 造成的复杂度膨胀。
推荐理由:作者结合 Answer.AI 支付系统重构实例,说明决定代码复杂度的信息不在代码里,解释了为何 LoC 等指标约束不了 LLM 的复杂度膨胀。
00:00 Tessl:产品与工程博客 00:00 精选AI 评分 66 66 Paul Stack 自 1 月底起不再手写代码,团队规定 agent 写每一行代码,不接受人类编写的代码 PR。工作流为状态机加 CLAUDE.md 可执行契约,CI 设五个合并门禁;此前 30 天开启 295 个 issue,ship 217 个,triage 中位数 4.6 小时,triage 到 ship 中位数 1.6 小时。
推荐理由:作者用自家五人团队全程由 agent 写代码的实践,说明流程、约束和门禁如何设计,是可参考的一手方法论。
08:00 Together AI 研究与产品博客(RSS) 08:00 精选AI 评分 70 70 Together AI 在 DeepSWE 全部 113 个任务上各跑四次对比 DeepSeek V4 Pro 0813 与 GPT-5.6 Sol,共 904 次运行。
推荐理由:原文基于同一批 904 次运行数据拆解两模型的成本与失败模式,并给出可复用的级联路由方案,比单独跑分更有参考价值。
06:23 Hacker News 热门(buzzing.cc 中文翻译) 06:23 精选AI 评分 81 81 Cursor 今日起向所有付费计划用户开放 Origin 代码托管的早期测试版,提供仓库、拉取请求、代码浏览及 GitHub 同步功能。用户可创建以 cursor.com/codebase/ 为前缀的仓库,或将 GitHub 仓库同步至 Origin,双向同步评论与审查。Vercel、Depot 和 Buildkite 集成已可用,智能体功能即将推出。
推荐理由:与外部 GitHub 托管相比,Origin 把源码、PR 和 agent 放进同一环境,免去跨工具切换,影响已用 Cursor 做开发的团队对代码审查与 CI 集成的组织方式。
08:00 Together AI 研究与产品博客(RSS) 08:00 精选AI 评分 70 70 Together AI 在 DeepSWE 全部 113 个任务、每任务 4 次试验(共 904 次 rollout)上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。
推荐理由:原文基于同一批 904 次 rollout 的实测数据,给出两模型在 DeepSWE 上的成本与互补性对比,以及可复用的级联路由结果。
07:01 Simon Willison 博客 07:01 精选AI 评分 73 73 阿里 Qwen 实验室发布 Apache 2 许可的 27B 参数视觉大模型 Qwen 3.8 27B,官方基准显示其超越前代 Qwen 3.6 27B 及闭源 Qwen 3.7-Plus。
推荐理由:把 Qwen 3.8 27B 的推理档位成本量化成时间差异,xhigh 默认让生成同一 SVG 从 137 秒膨胀到 21 分钟,这个默认值比能力更影响本地选型。
上一页 1 … 4 5 6 7 8 … 36 下一页