跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 101–120 条 · 共 716 条
8月25日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)59

    GPT-5.6 登陆 Kiro,为开发者提升性价比

    GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。

    推荐理由:在 Terminal-Bench 2.1 上,GPT‑5.6 Terra 在 Kiro 中完成任务的成本约下降 82%,为长周期编码任务的投入产出评估提供了一个量化基准。

  2. Tessl:产品与工程博客66

    Tessl 工程师提出 Harness Engineer 角色:AI 时代工程能力的三个新方向

    Tessl 研究工程师 Amy Heineike 提出 harness engineer 这一新角色,认为智能体大量写码后工程工作不是变少而是形态改变。其自建技能基准测试显示任务完成率高但平均只有约 70% 的技能指令被真正遵守;Tessl 近一周约 90% 代码经内部软件工厂生成,并给出从最近 50 个 PR 提炼不变量、转为 CI 门禁等三项可本周上手的练习。

    推荐理由:作者基于自家软件工厂的实测数据,提出 harness engineer 角色和三个可上手的技能方向,适合想管理 AI 代码质量的工程师参考。

8月21日周五
  1. Claude:Blog(网页)73

    AI 原生 SDLC 实战手册:Anthropic 如何用 Claude 重塑软件开发生命周期

    Anthropic 发布 AI 原生 SDLC 实战手册,提出将传统六阶段软件开发生命周期重构为 AI 嵌入各环节的闭环流程。手册指出,当代码不再是瓶颈时,规划、审查、部署等人速环节成为新约束,需通过 Claude 将需求压缩为 intent.md、以技能编码标准、用持续评测替代阶段门禁,并保留人工对关键代码的审查。

    推荐理由:把各阶段产物固化为可版本化 markdown 并让下一阶段读取,人工审查就从逐行看代码转向在关卡看代理标记,对改造研发流程的团队有直接参考价值。

8月20日周四
  1. Claude:Blog(网页)65

    Claude Code 初创公司指南:五大规则与创始人洞见

    Anthropic 发布面向初创公司的 Claude Code 使用指南,基于对十余家高增长公司的调研,总结出“人人皆可交付、自动化繁琐工作、信任但验证、为重构而构建、原型-自用-产品化”五大规则。

    推荐理由:指南把十几家创业公司实践归纳为五个可操作规则,其中「修复原则而非修复个案」对搭建自改进 agent 流程具有直接参考价值。

8月19日周三
  1. 公众号:百度智能云(文心)64

    百度千帆上架GLM-5.3

    百度千帆今日上架智谱开源旗舰模型GLM-5.3,API定价与智谱官方保持一致。该模型与上代同架构、同参数,依靠后训练Scaling在代码与网络安全能力上表现超预期,AA综合智能指数取得60分,与Kimi K3并列开源模型第一。开发者可通过API调用或订阅Token Plan企业版接入Claude Code等AI工具使用。

    推荐理由:GLM-5.3 与上代同参数却靠后训练 Scaling 进入前沿,单任务成本又是同档最低,这让原本受调用成本限制的长链路智能体和编码任务有了开源可选项。

  2. 公众号:智谱(GLM)79

    GLM-5.3上线:AA智能指数60分并列开源第一,成本更低

    GLM-5.3 API即日上线,擅长复杂编码、防御性网络安全与长程任务,在AA综合智能指数中取得60分,与Claude Fable 5、GPT-5.6 Sol等闭源旗舰同级,并与Kimi K3并列开源模型第一。该模型以更小参数规模和更低调用成本降低前沿智能门槛,单任务成本为旗舰模型中最低。API定价与GLM-5.2持平,模型权重将于下周五开源。

    推荐理由:GLM-5.3 把前沿智能的单任务成本压到同档最低,模型选型时成本与智能可以放在同一优先级比较,而不必默认高价闭源旗舰。

  3. Answer.AI 官方研发博客(RSS)63

    为什么 LLM 无法简化你的代码:Answer.AI 工程师用 Naur 理论解读复杂度

    Answer.AI 工程师借鉴 Peter Naur 的《Programming as Theory building》,指出决定代码复杂度的关键信息存在于工程师头脑中的 Theory,而非代码本身,因此 LoC、圈复杂度等指标无法约束 LLM 造成的复杂度膨胀。

    推荐理由:作者结合 Answer.AI 支付系统重构实例,说明决定代码复杂度的信息不在代码里,解释了为何 LoC 等指标约束不了 LLM 的复杂度膨胀。

  4. Tessl:产品与工程博客66

    Paul Stack 分享人类做架构、AI 写代码的五人团队实践

    Paul Stack 自 1 月底起不再手写代码,团队规定 agent 写每一行代码,不接受人类编写的代码 PR。工作流为状态机加 CLAUDE.md 可执行契约,CI 设五个合并门禁;此前 30 天开启 295 个 issue,ship 217 个,triage 中位数 4.6 小时,triage 到 ship 中位数 1.6 小时。

    推荐理由:作者用自家五人团队全程由 agent 写代码的实践,说明流程、约束和门禁如何设计,是可参考的一手方法论。

8月18日周二
  1. Hacker News 热门(buzzing.cc 中文翻译)81

    Cursor 推出 Origin 代码托管服务,作为 GitHub 的替代方案

    Cursor 今日起向所有付费计划用户开放 Origin 代码托管的早期测试版,提供仓库、拉取请求、代码浏览及 GitHub 同步功能。用户可创建以 cursor.com/codebase/ 为前缀的仓库,或将 GitHub 仓库同步至 Origin,双向同步评论与审查。Vercel、Depot 和 Buildkite 集成已可用,智能体功能即将推出。

    推荐理由:与外部 GitHub 托管相比,Origin 把源码、PR 和 agent 放进同一环境,免去跨工具切换,影响已用 Cursor 做开发的团队对代码审查与 CI 集成的组织方式。

8月17日周一
  1. Together AI 研究与产品博客(RSS)70

    Together AI 实测 DeepSeek V4 Pro 0813 对比 Claude Fable 5 在 DeepSWE 上的成本、编码与路由表现

    Together AI 在 DeepSWE 全部 113 个任务、每任务 4 次试验(共 904 次 rollout)上对比 DeepSeek V4 Pro 0813 与 Claude Fable 5。

    推荐理由:原文基于同一批 904 次 rollout 的实测数据,给出两模型在 DeepSWE 上的成本与互补性对比,以及可复用的级联路由结果。

8月14日周五
  1. Cursor Blog68

    Cursor 正式被 SpaceX 收购

    Cursor 已被 SpaceX 正式收购,完成自 4 月启动的收购流程。合并后 Cursor 将获得全球最大 GPU 集群,以构建更强且运行成本更低的模型,从而以更低价格向客户提供更强大的模型。本周三发布的 Grok 4.6 是双方合作成果的早期体现。

    推荐理由:Cursor 并入 SpaceX 后获得大规模算力,其用户可能直接受益于更经济的强模型,这改变对编程工具后续能力迭代与定价的预期。

  2. SiliconFlow65

    DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

    推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。

  3. Boris Cherny66

    Boris Cherny 尝试让 Claude 接管其应用的日常维护,通过 Slack 频道运行崩溃模糊测试、重复代码统一、死代码移除等日常任务。数周内自动开出 388 个 PR,其中 180 个经 Claude Code Review 和人工审核后合并。Claude 通常一次就能改对,出错时可通过调整例程次日改进。

    推荐理由:这套做法的增量在于把日常维护拆成可复用的定时例程,并通过当日 PR 反馈迭代提示词,使机械性代码改动从逐条审查转向批量合并。

  4. Cursor Blog65

    Cursor 推出 builds:云智能体启动速度提升至 3 倍

    Cursor 推出 builds 功能,在后台持续准备就绪的开发环境副本,让云智能体启动时无需从零搭建,响应速度最高提升 3 倍。内部环境启动快 10 倍,首个 token 生成快 3 倍;智能体始终从最近一次成功的 build 启动,依赖更新或安装脚本出错时不会影响运行。8 月 17 日起所有环境默认启用 builds,无需额外费用。

    推荐理由:把环境准备从每次会话冷启动改为后台持续快照,云代理长任务的启动成本和中断风险降低,为把更多工程流程交给自动代理提供了更可靠的运行基础。

  5. Google DeepMind:Blog(RSS)72

    Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

    Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

    推荐理由:相比 3.6 Flash,价格减半且 FrontierCode 和 DeepSWE 分数提升,让成本敏感型编码智能体团队有了新的性价比基线。

  6. Augment Code 博客(网页)64

    Augment Code 详解 Auggie CLI v2 重构:基于 Pi fork,任务成本比 Claude Code 低 53%

    Augment Code 从零重构 Auggie CLI 的 harness,在 SWE-bench Pro 相同通过率下,Auggie v2 单任务成本 $1.27,Claude Code 为 $2.70,便宜 53%,平均耗时 330s 对 409s。

    推荐理由:作者复盘了从 Vercel AI SDK、Mastra 到 Pi 的三次选型与减法思路,成本结论有 SWE-bench Pro 数据支撑,方法可迁移到类似的重构决策。