跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 641–660 条 · 共 716 条
2月11日周三
  1. Steve Yegge:Medium(RSS)75

    AI 吸血鬼

    AI(如 Claude Code)确实能带来 10 倍生产力提升,但创造的价值大部分被公司捕获,员工可能过度劳累却收获甚微。微软内部已自发大量采用 Claude Code。这种效率加速迫使工作节奏不断加快,导致许多早期采用者(包括作者自己)出现严重的“午睡攻击”和日常疲劳。公司作为资本机器难以放缓脚步,形成一种让从业者无论是否使用 AI 都被持续“抽血”的困境。

    推荐理由:Steve Yegge 提出的 'AI 吸血鬼' 概念精准捕捉了 AI 生产力带来的过劳危机,并给出了对抗资本压榨的实用公式,每个在 AI 浪潮中奔命的开发者都该停下看看。

  2. Modal 官方工程博客(RSS)71

    Modal 上线 Z.ai GLM-5 免费端点并提供自部署代码

    Z.ai 发布开源权重模型 GLM-5(MIT 许可,面向长程 Agent 和系统工程),Modal 与其合作上线免费体验端点,4 月底前可用,限单并发请求。FP8 精度下模型约 700 GB,需多 GPU 部署,Modal 用 8 张 B200 单节点配合 SGLang 运行,内部实测每用户 30-75 tokens/秒。

    推荐理由:Modal 官方给出 GLM-5 的部署细节、免费端点限制和前端接入配置,读者可直接照做在自己常用的 Agent 框架里试用。

2月10日周二
  1. Cognition 模型 / Devin 博客(网页)66

    Cognition 推出 Devin 自动修复 PR 审查评论功能

    Cognition 宣布 Devin 现在可自动修复 Devin Review 及其他审查机器人留下的 PR 评论,包括 linter、CI/CD、安全扫描和依赖管理机器人。用户可在 Settings > Customization > Autofix settings 中配置;该功能大幅增加了内部 token 消耗,但团队称 PR bug 明显减少,并缩小了人类只需处理需判断的工作。

    推荐理由:原文给出具体配置入口和适用范围,读者可以了解如何让 Devin 自动修复 PR 上的机器人评论。

2月6日周五
  1. Cursor Blog

    NVIDIA 3 万开发者使用 Cursor,代码提交量提升 3 倍

    NVIDIA 已向 3 万名开发者部署 Cursor,代码提交量提升 3 倍,缺陷率保持稳定。Cursor 已深度集成至软件开发生命周期全流程,不仅用于代码生成,还通过自定义规则实现代码审查、测试、调试及 git 工作流自动化。新员工可更快熟悉复杂代码库,资深开发者也能跨技术栈工作,代码风格一致性得到改善。

    推荐理由:NVIDIA 3万开发者使用 Cursor,代码提交量提升3倍,展示企业级 AI 编程与 Agent 自动化实践

2月5日周四
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)78

    用并行Claude智能体团队从零构建C编译器

    研究人员采用“智能体团队”方法,让多个Claude实例在无人工干预下并行协作开发代码。为进行压力测试,团队指派16个智能体从零编写一个能编译Linux内核的Rust版C编译器。项目消耗近2000次会话和约2万美元,最终产出10万行代码的编译器,可成功在x86、ARM和RISC-V架构上构建Linux 6.9内核。研究重点在于设计支持长时间自主运行的智能体团队框架,包括如何编写测试以保持智能体不偏离方向,以及如何通过基于文本文件的锁机制协调多智能体并行任务分配。

    推荐理由:Anthropic 研究员用 16 个 Claude 并行写了个能编译 Linux 内核的 C 编译器,2000 次会话花了两万刀。真正值钱的不是编译器本身,而是他总结的 agent 团队协作方法论,做多 agent 系统的人该逐段拆。

  2. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)74

    量化智能体编码评估中的基础设施干扰

    研究发现,在SWE-bench等智能体编码基准测试中,基础设施配置差异对模型评分的影响,可能超过排行榜上顶尖模型之间的微小分差。内部实验显示,在Terminal-Bench 2.0上,最严格与最宽松的资源设置间成功率相差6%。严格限制资源会导致近6%的任务因容器意外终止而失败,而宽松配置下此类错误率可降至0.5%。当资源余量超过基准规格3倍时,智能体甚至能借助额外资源成功完成原本无法解决的任务。这表明评估环境不仅影响测试稳定性,更会改变基准测试实际衡量的能力维度。

    推荐理由:Anthropic 用自家数据证明,agentic coding benchmark 的排行榜差距可能只是硬件配置差异而非模型能力差距,3 个百分点以内的领先都该打问号。做模型选型的人别再迷信那几个百分点了。

2月2日周一
1月21日周三
  1. Cognition 模型 / Devin 博客(网页)66

    Cognition 发布 AI 代码审查工具 Devin Review

    Cognition 发布 Devin Review,一款针对 GitHub PR 的 AI 代码审查工具,称代码审查已成为 AI 编程时代的瓶颈。

    推荐理由:原文给出三项具体能力和免登录试用入口,读者可以直接对照现有 GitHub 审查流程判断是否值得替换。

1月12日周一
  1. Hacker News:AI 热帖

    Agent-of-empires:OpenCode 与 Claude Code 会话管理器

    Agent-of-empires(AoE)是一款支持 Linux 与 macOS 的 AI 编码代理会话管理器,兼容 Claude Code、OpenCode 等 9 种主流 AI 工具。该工具基于 tmux 实现会话持久化,支持在多分支代码库上并行运行多个代理,提供 Docker 沙盒隔离、Git worktrees 管理及实时状态检测,并可通过 Web 仪表板或 Cloudflare 隧道从手机远程访问,解决多代理协作时的状态追踪与工作环境隔离问题。

    推荐理由:同时管理多个AI编码代理,手机远程监控不再乱套

1月10日周六
  1. Nathan Lambert:Interconnects(RSS)

    Claude Code 与众不同

    Claude Code 集成 Opus 4.5 模型实现关键突破,编程智能体跨越重要能力阈值。此次升级标志着编码代理在自主性和工程处理能力上达到新水平,可应对更复杂的开发任务。Opus 4.5 显著提升了代码生成、调试及复杂问题解决的表现,使 AI 辅助编程从基础工具向高效协作伙伴转变,为开发者带来质的不同的使用体验与效率提升。

    推荐理由:编码 Agent 跨越关键门槛,Claude Code 能力跃升将重塑开发者工作流

1月8日周四
  1. PromptArmor:Threat Intelligence66

    PromptArmor 披露 IBM Bob 编码 Agent 可被提示词注入诱导下载并执行恶意软件

    PromptArmor 披露 IBM 编码 Agent Bob(含 Bob CLI 与 Bob IDE,目前 Closed Beta)存在漏洞:若用户对任一已知可信命令选择 always allow,攻击者可通过间接提示词注入触发下载并执行恶意软件。

    推荐理由:原文完整拆解了 Bob CLI 三道防御被绕过的具体机制与攻击链,读者可据此评估编码 Agent 的命令自动审批风险。

12月27日周六
  1. Jim Fan

    2024:AI 是 copilot 2025+:人类是 copilot Copilot 是新的工程技能。离开驾驶座并不容易——我们必须学会用 AI 的方式思考,并适应陌生的工作流。帮助 AI 帮助我们自己。 [引用 @karpathy]:作为程序员,我从未感到如此落后。这个职业正在被剧烈重构,因为程序员贡献的比特越来越稀疏且穿插其间。我感觉如果能恰当地串联起过去大约一年里出现的东西,我可以强大 10 倍,而未能获得这种提升感觉绝对是技能问题。除了下面通常的层之外,还有一个新的可编程抽象层需要掌握,涉及代理、子代理、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,以及需要建立一个全面的心理模型来理解那些本质上随机的、易错的、不可理解的且不断变化的实体的优势和陷阱,这些实体突然与过去那种传统的工程实践交织在一起。显然某种强大的外星工具被传递开来,只是它没有附带说明书,每个人都必须弄清楚如何握持和操作它,而由此产生的 9 级地震正在震撼这个职业。卷起袖子以免落后。

    引用Andrej Karpathy@karpathy

    作为一名程序员,我从未感到如此落后。这个职业正在被剧烈地重构,程序员所贡献的比特越来越稀疏、零散。我有一种感觉,如果我能把过去大约一年里涌现出来的东西妥善地串联起来,我可能会强大 10 倍,而未能抓住这波提升,感觉分明就是能力问题。有一层新的可编程抽象层需要掌握(除了下面那些惯常的层级之外),涉及智能体、子智能体、它们的提示词、上下文、记忆、模式、权限、工具、插件、技能、钩子、MCP、LSP、斜杠命令、工作流、IDE 集成,并且需要为那些从根本上随机、易错、难以理解且不断变化的实体建立起一个包罗万象的心智模型——这些实体突然与过去那种老派良好的工程实践混杂在一起。显然,某个强大的外星工具被传了一圈,但它没有附带说明书,每个人都得自己摸索怎么拿、怎么操作,而由此引发的 9 级地震正在撼动整个职业。卷起袖子干吧,别掉队。

    推荐理由:顶级研究者警示编程职业正被重构,掌握Agent编排成为工程师新必修课

12月9日周二
  1. Claude:Blog(网页)

    Anthropic调研:2026年企业AI智能体应用趋势

    Anthropic与Material调研500余位技术领导者显示,57%企业已将AI智能体用于多阶段工作流,16%实现跨职能部署。编码是核心场景,90%用于开发辅助,86%用于生产代码,平均节省近六成时间。80%受访者称投资已产生可衡量回报,如Thomson Reuters将法律检索从数小时缩短至分钟级。2026年81%企业计划处理更复杂用例,但面临系统集成、数据质量和变革管理三大挑战。

    推荐理由:Anthropic发布企业AI Agent深度调研,揭示2026年应用趋势与头部企业实战案例

12月2日周二
  1. OpenAI:Alignment 研究博客(RSS)60

    大规模验证代码的实用方法

    研究团队训练并部署了一个专为高精度和实际应用优化的AI代码审查智能体。该智能体旨在对自主生成的代码进行有效监督,使代码审查能力能够与自动化代码生成的规模同步扩展。通过优化智能体的精确度,该方法致力于解决大规模代码生成中的质量控制难题,为AI辅助软件开发提供了可落地的规模化监督方案。

    推荐理由:OpenAI 把对齐研究落到了代码审查这个具体场景,不是空谈 alignment 理论,而是训了个高精度 review agent 来给 AI 写的代码做质检。做 coding agent 的团队该看看,这可能是未来安全合规的标配。

11月24日周一
  1. Claude Platform:开发者版本说明(RSS)75

    Claude Opus 4.5 发布:最强模型登场,支持编程工具调用与 effort 参数

    Anthropic 发布 Claude Opus 4.5,定位为最智能模型,在视觉、编程和计算机使用能力上实现阶跃式改进,价格低于前代 Opus 模型。

    推荐理由:Opus 系列首次把价格降到「实用」区间,同时编码和视觉有阶跃提升,这对做软件工程和 Agent 的开发者是实打实的利好,配套的工具调用更新也补上了多步骤工作流的效率短板。

11月14日周五
  1. Cognition 模型 / Devin 博客(网页)69

    Cognition 发布 Devin 2025 年度绩效复盘,总结 18 个月智能体落地经验

    Cognition 发布 Devin 2025 年度绩效复盘。Devin 上线 18 个月来已在数千家公司服役,累计合并数十万个 PR,客户包括 Goldman Sachs、Santander 和 Nubank。

    推荐理由:Devin 官方复盘 18 个月真实部署的强弱项,给出大量客户场景和量化数据,可帮助读者评估智能体在工程团队中的实际落地方式。

11月12日周三
  1. Claude:Blog(网页)

    通过 Skills 改进前端设计

    LLM 生成界面常因"分布收敛"而陷入 Inter 字体配紫色渐变的同质化设计。Anthropic 建议通过 Skills 功能解决:将排版、动画、配色等设计规范存入独立 Markdown 文件,Claude 可在构建页面时动态加载,无需永久占用系统提示词。这种按需加载机制既保持上下文窗口精简以维持模型性能,又能让 AI 生成摆脱默认审美、更具品牌辨识度的定制化界面。

    推荐理由:Claude官方分享通过Skills解决AI生成界面同质化问题的实践技巧,附字体与主题优化Prompt示例。

11月4日周二
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 发布 Windsurf Codemaps:AI 生成的代码结构地图

    Cognition 发布 Windsurf Codemaps,由 SWE-1.5 和 Claude Sonnet 4.5 驱动,生成 AI 标注的代码结构地图,帮助工程师在调试、重构和上手新代码库前理解代码。

    推荐理由:官方介绍了 Codemaps 的入口、模型选择和 Cascade 引用方式,读者可以据此判断它如何用于代码库理解和上下文工程。

10月29日周三
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 SWE-1.5 编码智能体模型,经 Cerebras 推理达 950 tok/s

    Cognition 发布软件工程模型 SWE-1.5,参数达数千亿级,与 Cerebras 合作以最高 950 tok/s 提供推理,速度为 Haiku 4.5 的 6 倍、Sonnet 4.5 的 13 倍。

    推荐理由:原文给出速度基准与模型加推理加智能体框架协同的训练细节,读者可据此评估高速编码智能体方案的可行性。

10月27日周一
  1. MiniMax:Blog(网页)62

    MiniMax M2与AI智能体:简中见巧

    MiniMax正式开源并发布了专为AI智能体(Agent)和代码场景设计的大语言模型MiniMax M2。该模型API定价极具竞争力,仅为Claude Sonnet价格的约8%,且推理速度更快。在关键的智能体能力方面,其工具调用和深度搜索表现接近顶尖模型,编程能力在国内处于领先地位。MiniMax M2旨在解决性能、价格与速度的“不可能三角”,为构建更普及的AI智能体应用提供基础,体现了其“智能平权”的愿景。

    推荐理由:MiniMax M2 把 Agent 模型的价格打到了 Claude 的 8%,速度还翻倍,开源权重直接可用,做 Agent 的开发者值得上手试试。