跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 81–100 条 · 共 716 条
9月3日周四
  1. Claude:Blog(网页)64

    Anthropic 发布 Claude 商务智能体蓝图,含购物与商家智能体参考实现

    Anthropic 发布面向电商、旅游、电信和票务平台的商务智能体蓝图,提供可在数天内上线的 harness、模式和护栏,附购物智能体与商家智能体的完整参考实现及 Claude Code 插件。

    推荐理由:原文给出完整可部署的购物与商家智能体实现、接入方式和合作生态,工程团队可据此评估落地铁路线。

  2. Claude:Blog(网页)79

    Anthropic 发布 Claude 电商智能体构建指南及参考实现

    Anthropic 发布构建电商智能体的指南,总结架构、延迟与成本优化、生产运维三部分实践,涉及购物和商家两类智能体,企业客户部署后出现购物车变大和卖家运营效率提升。核心建议包括用单个智能体加技能而非子智能体、将 UI 组件做成工具、用提示词缓存实现 90-99% 命中率、在 harness 中强制安全规则,并开源参考实现 anthropics/commerce-agents。

    推荐理由:Anthropic 根据多个企业部署经验总结电商智能体架构、延迟成本优化和生产实践,并附参考实现,可迁移到类似 Agent 项目。

  3. Sundar Pichai65

    Google 发布 Gemini 3.8 Flash,为 6 周内第 3 次 Flash 更新。官方称相较 3.7 Flash 在软件工程、智能体任务和多步推理上有显著提升,在 DeepSWE v1.1 上以更低成本自主端到端解决复杂工程问题,表现超越多数更大的前沿模型。图中基准显示其 Terminal-bench 2.1 得 89.4%、HLE-Verified 得 54.9%,输入价格 $0.75/1M tokens、输出 $3.75/1M tokens,为 2026 年 12 月 31 日前 introductory 价。详情见 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

    推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。

9月2日周三
  1. Google AI:DEV 作者专属(RSS)69

    什么是 harness 工程?Google 用 ADK 2.0 与 Antigravity SDK 演示自动修复编码循环

    Google 员工 Shir Meir Lador 介绍 harness 工程,即用确定性组件包裹 LLM,包括编排层、执行沙箱、状态持久化和验证工具,让 Agent 不需逐行人工审查即可安全生成代码。

    推荐理由:原文解释了 harness 工程的构成要素,并给出可运行的沙箱与修复循环示例代码,方法可直接迁移到自己的 Agent 工作流。

  2. Meituan LongCat68

    LongCat-2.0 现已在 @cline 中免费试用!🐱 [引用 @cline]:LongCat-2.0 目前在 Cline 中免费使用。 这是一款来自 @Meituan_LongCat 的 1.6T 开源权重 MoE 模型,拥有 1M 上下文,得分与 Claude Opus 4.7 和 Gemini 3.1 Pro 相近。 立即尝试:npm i -g cline /model 在免费模型下选择 LongCat-2.0

    引用Cline@cline

    LongCat-2.0 现在在 Cline 中免费开放。 这是一个 1.6T 开放权重 MoE 模型,拥有 1M 上下文,来自 @Meituan_LongCat,得分与 Claude Opus 4.7 和 Gemini 3.1 Pro 相近。 立即试用: npm i -g cline /model 在免费模型下选择 LongCat-2.0

    推荐理由:官方宣布 LongCat-2.0 可在 Cline 免费试用,并给出安装命令和模型选择路径,读者可直接接入现有编码工作流。

  3. 公众号:数字生命卡兹克65

    UU远程新版本上线:完整 TUI 渲染与多终端会话管理,强化远程 Vibe Coding 体验

    UU远程于9月2日上线新版本,重点优化终端功能,补齐 TUI 渲染交互与终端会话管理能力。主要更新包括:Mac 免密码登录、移动端输入优化并新增调用系统输入法的独立输入框、可同时创建和管理多个终端会话并支持手机与电脑间跨端同步接管(通过 uuyc-cli lterm 命令)。

    推荐理由:作者实测新版本并给出使用路径,读者可据此评估手机端远程跑 Coding Agent 的可行性。

  4. Anthropic:Newsroom(网页)87

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。

    推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。

  5. Qwen69

    通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。

    引用Arena.ai@arena

    Qwen3.8-Max-0902 由 @Alibaba_Qwen 发布,刚刚在 Code Arena: WebDev 中首次亮相便夺得综合第一,得分 1,691 分,并以每百万 Token 5 美元的混合价格成为帕累托前沿上得分最高的模型! 在更新后的前沿上,Qwen3.8-Max-0902 位于 HY4 Preview(1,629 分,每百万 Token 2.08 美元)和 Qwen3.8-Flash-Next(1,620 分,每百万 Token 0.39 美元)之上。 随着此次发布,综合排行榜顶部的三个模型尽管仍位居综合第 2 至第 4 名,却已移出帕累托前沿: - Claude Opus 5 (Max):第 2 名,1,688 分,每百万 Token 20 美元 - Kimi K3 (Max):第 3 名,1,674 分,每百万 Token 12 美元 - Qwen3.8 (Max):第 4 名,1,669 分,每百万 Token 5 美元 祝贺 @Alibaba_Qwen 团队发布!

    推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。

  6. Claude Platform:开发者版本说明(RSS)72

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。

    推荐理由:官方版本说明给出定价、缓存和 API 兼容性变化,开发者可据此评估迁移成本与新特性用法。

9月1日周二
8月29日周六
  1. IT之家(RSS)72

    智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御

    智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。

    推荐理由:许可条款把强制安全审查限定在百亿美元级外部模型服务,自有部署和中小团队实际不受影响,开源可用性比表面限制更宽。

  2. Tibo69

    OpenAI 因 SpaceX 收购 Cursor 后信任问题,决定终止向其提供模型访问,合作于 11 月 12 日结束。开发者仍可通过自有 OpenAI API 密钥及 IDE 扩展继续使用 GPT 模型。OpenAI 表示将继续支持广泛的工具生态与开源计划。

    引用OpenAI@OpenAI

    在Cursor被SpaceX收购后,我们将终止与其的合作关系。根据我们的提议,Cursor对我们模型的直接访问将于11月12日结束。 我们知道,受这一决定影响最大的是那些在Cursor中依赖OpenAI模型的开发者。我们关心他们在此过渡期间的体验,并准备竭尽全力为他们提供支持。 https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/

    推荐理由:终止合作把信任作为前提,依赖 Cursor 内嵌 OpenAI 模型的团队将需要在 11 月 12 日前重新确认编码工作流的模型访问路径。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)69

    OpenAI 决定终止向 Cursor 提供模型,因 SpaceX 收购后合规风险

    OpenAI 已通知 SpaceX,将终止向 Cursor 提供 OpenAI 模型的合同,拟定关停日期为 2026 年 11 月 12 日,并给予合同允许的最长通知期。OpenAI 称此举源于无法确信 SpaceX 会遵守服务条款,并援引马斯克旗下公司此前违反合同及 xAI 违反 OpenAI 服务条款的先例。OpenAI 表示将尽力支持受影响的开发者过渡。

    推荐理由:OpenAI 把合同终止与收购后的控制权变更挂钩,11 月 12 日的关闭日期将直接改变 Cursor 开发者对模型替代和迁移窗口的规划。

8月28日周五
  1. Tessl:产品与工程博客64

    Tessl 实测:token 单价便宜不等于智能体任务成本低

    Tessl 在为 Code Review 工具选模型时发现,按费率卡比较 token 单价会得出错误结论:三种更便宜的开源权重模型中有三种在真实 PR 审查中实际花费更高,一个模型每 token 便宜近 3 倍却在同一 PR 上贵 2.8 倍。

    推荐理由:作者用自家代码审查负载的实测数据说明按 token 单价选模型会算错账,并给出可复用的成本度量公式和三项选型检查。

8月27日周四
  1. Johann Rehberger / Embrace The Red(RSS)77

    Claude Code Opus 5 Auto Mode 被提示注入攻击链攻破,成功率最高 80%

    安全研究员 Johann Rehberger 发布针对 Claude Code Opus 5 Auto Mode 的攻击链,通过诱导 curl 下载 ZIP、Python 模块遮蔽 struct.py 实现代码执行与 C2 回连,小样本下攻击成功率 60% 至 80%。

    推荐理由:作者以第一手攻击链演示 Auto Mode 的绕过路径,并对比厂商评测口径,读者可据此校准对沙箱隔离的必要性认知。

8月26日周三
  1. Fireworks AI(网页)68

    DeepSeek V4 Pro 0813 上线 Fireworks:SWE-Bench Verified 达 95.2%,单任务成本约为 Fable 5 的三分之一

    Fireworks 上线 DeepSeek V4 Pro 0813,提供 serverless、专属部署及 SFT/DPO/RFT 训练支持,模型具备 1M token 上下文窗口和原生工具调用。

    推荐理由:原文用四组基准和逐任务成本数据对比 V4 Pro 与 Fable 5、Kimi K3,并指出 Java 弱项与路由空间,读者可据此选型。