跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 701–716 条 · 共 716 条
5月6日周二
5月5日周一
  1. Cognition 模型 / Devin 博客(网页)74

    Cognition 发布 DeepWiki,为任意 GitHub 仓库生成免费 AI 文档

    Cognition 推出 DeepWiki,将 Devin Wiki 和 Devin Search 免费公开,把 URL 中的 github.com 换成 deepwiki.com 即可查看任意仓库的 AI 文档。已索引超过 50,000 个热门公开仓库,涵盖 Model Context Protocol、LangChain 等;公开仓库可免费添加,私有仓库需 Devin 账号。

    推荐理由:原文给出了使用方式和已索引规模,读者可以据此判断如何用 DeepWiki 快速理解陌生代码仓库。

4月18日周五
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude Code:智能体编码最佳实践指南

    Claude Code 提供了一套完整的智能体编程工具与框架。其核心遵循“先探索、再计划、后编码”的工作流,并通过配置 CLAUDE.md 文件、管理权限和连接 MCP 服务器来优化环境。最佳实践强调为 Claude 提供工作验证方法、积极管理上下文、使用子代理进行调查,以及利用检查点回退来处理复杂任务。文档还详细介绍了在 VS Code、JetBrains IDE、Slack 及 CI/CD 中的集成使用,并提供了避免常见失败模式的实用建议。

    推荐理由:Anthropic 官方出的 Claude Code 最佳实践,不是泛泛而谈的入门指南,而是从 CLAUDE.md 配置到 subagent 编排的完整工程手册,用 Claude Code 做日常开发的人直接照抄就能少踩一半坑。

4月3日周四
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 发布 Devin 2.0,推出 Agent 原生 IDE 并新增 $20 起的灵活方案

    Cognition 发布 Devin 2.0,带来 Agent 原生 IDE 体验和 $20 起的新方案。用户可并行运行多个 Devin,各自配备云端 IDE,可在 IDE 内用 Cmd+I、Cmd+K 等快捷键审查和修改 Devin 的代码。

    推荐理由:官方公告列出新 IDE 体验、三项新功能和 $20 起的新定价,读者可据此评估 Devin 在编码工作流中的可用性变化。

3月24日周一
  1. DeepSeek:API 更新日志72

    DeepSeek 将 deepseek-chat 升级为 DeepSeek-V3-0324

    DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3-0324,推理能力增强,MMLU-Pro 升至 81.2,AIME 升至 59.4。同时优化了 Web 前端开发、中文写作(对齐 R1 风格)、中文搜索及 Function Calling 准确率,并修复了此前问题。

    推荐理由:这是 DeepSeek V3 发布后的一次重要版本更新,推理和代码能力提升显著,AIME 提升近 20 分,前端和中文写作体验优化,API 用户应该尽快切换。

2月13日周四
  1. Cognition 模型 / Devin 博客(网页)64

    Linktree 复盘用 Devin 一个月写约 300 个 PR 的实践经验

    Linktree 团队分享使用 Cognition 的 AI 智能体 Devin 一个月的成果:Devin 完成约 300 个 PR,其中约 100 个已合并,主要是修复客户报告的 bug、实现小功能和原型验证。

    推荐理由:Linktree 官方复盘 Devin 落地细节,给出任务筛选标准、多 Devin 协作和 API 用法等可直接迁移的经验。

2月10日周一
  1. Sam Altman:Blog(RSS)

    三点观察

    OpenAI 阐述关于 AI 经济学的三点观察:模型智能与训练资源的对数成正比,可预测扩展;AI 使用成本每 12 个月下降约 10 倍,远超摩尔定律速度;智能线性增长将产生超指数级社会经济价值。据此,AI 代理将如虚拟同事般渗透各领域,科学进步将大幅加速,虽然短期内生活照旧,但长期将深刻重塑社会经济结构,个人意志力和适应能力将成为关键价值。

    推荐理由:Sam Altman 提出 AI 经济学三大观察,描绘 AGI 时代 Agent 工作图景

1月21日周二
  1. Modal 官方工程博客(RSS)65

    Modal Sandboxes 正式可用,为不可信代码提供安全执行环境

    Modal 宣布 Sandboxes 正式可用,这是安全运行 LLM、用户或第三方来源不可信代码的隔离执行环境。它提供 exec API,可在运行时用与 Functions 相同的 Image API 动态配置任意语言依赖,支持文件系统快照以持久化和多 Sandbox 扇出,并复用 Functions 基础设施带来快速冷启动、GPU 和全球区域选择。

    推荐理由:Modal 官方宣布 Sandboxes 正式可用,给出 exec API、动态镜像和 SWE-bench 7 分钟跑完 Verified 等实测数字,可据此评估智能体代码执行方案。

1月8日周三
  1. Answer.AI 官方研发博客(RSS)78

    Answer.AI 实测 Devin:20 项任务仅 3 次成功,自主编程能力存疑

    Answer.AI 团队对 AI 软件工程师 Devin 进行了为期一个月的深度测试。尽管早期在 API 集成等简单任务中表现尚可,但在扩展至新项目创建、研究及代码修改等 20 项真实任务时,结果令人失望:仅 3 项成功,14 项失败,且无法预测成败规律。Devin 常陷入技术死胡同、生成过度复杂的“面条代码”,或在面对不可行任务时产生幻觉并浪费大量时间。文章指出其实际表现远低于宣传预期,难以替代人类开发者。

    推荐理由:来自知名 AI 评测机构的详实一手数据,揭示了明星产品 Devin 在真实工作流中的局限性,为评估当前自主编程 Agent 的实际成熟度提供了重要参考。

1月6日周一
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    Claude 3.5 Sonnet 在 SWE-bench Verified 基准测试中刷新纪录

    升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。

    推荐理由:Anthropic 把自家 SWE-bench agent 的 prompt、工具设计和踩坑经验全公开了,做 coding agent 的人可以直接抄作业,比看十篇二手解读都管用。

12月10日周二
  1. Cognition 模型 / Devin 博客(网页)73

    Cognition 宣布 Devin 正式全面开放使用

    Cognition 宣布 Devin 正式全面可用,无席位限制,所有工程团队可在 app.devin.ai 开始使用,并提供 Slack 集成、IDE 扩展(VSCode 及分支,Beta)和 API,以及 Cognition 工程团队的 onboarding 支持。

    推荐理由:官方宣布 Devin 全面开放并给出适用任务、使用建议和多个开源 PR 实例,读者可据此评估如何把 Devin 接入自己的工程流程。

11月22日周五
  1. METR:Research(网页)62

    METR 发布 RE-Bench:对比语言模型智能体与人类专家的 AI 研发能力

    METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。

    推荐理由:原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。

9月5日周四
  1. DeepSeek:API 更新日志78

    DeepSeek V2.5 模型发布:合并升级并提升代码与通用能力

    DeepSeek 将 V2 Chat 与 Coder V2 合并升级为 V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问。新模型在通用与代码能力上显著提升,ArenaHard winrate 升至 76.3%,HumanEval 达 89%。

    推荐理由:DeepSeek 把 coder 和 chat 合并成 V2.5,API 端点不变但性能全线拉高,已有的集成直接受益,代码和通用能力不再是两张皮。

7月24日周三
  1. DeepSeek:API 更新日志63

    DeepSeek-Coder 升级为 DeepSeek-Coder-V2-0724

    DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。此次升级为模型版本更新,具体参数规模、性能基准及可用性细节未在更新日志中披露。

    推荐理由:DeepSeek Coder 升级到 V2-0724,编码能力再进一步,对 API 用户是直接可用的提升,虽然官方没给技术细节,但仍值得关注。

5月12日周日
  1. Eugene Yan:Writing82

    Applied LLMs:一年 LLM 应用开发的经验总结

    Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。

    推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。

12月27日周三
  1. Andrej Karpathy:Blog(网页)

    Licklider 1960《人机共生》评述

    Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。

    推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻