Gemini 2.5 Pro Preview 提前发布:编程性能进一步提升
鉴于开发者反馈积极,Google 提前两周发布 Gemini 2.5 Pro Preview 更新版本,编程性能进一步提升,现已开放获取。
推荐理由:Gemini 2.5 Pro 提前发布更新版本,编码性能显著提升,开发者可即刻体验
AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
鉴于开发者反馈积极,Google 提前两周发布 Gemini 2.5 Pro Preview 更新版本,编程性能进一步提升,现已开放获取。
推荐理由:Gemini 2.5 Pro 提前发布更新版本,编码性能显著提升,开发者可即刻体验
Cognition 推出 DeepWiki,将 Devin Wiki 和 Devin Search 免费公开,把 URL 中的 github.com 换成 deepwiki.com 即可查看任意仓库的 AI 文档。已索引超过 50,000 个热门公开仓库,涵盖 Model Context Protocol、LangChain 等;公开仓库可免费添加,私有仓库需 Devin 账号。
推荐理由:原文给出了使用方式和已索引规模,读者可以据此判断如何用 DeepWiki 快速理解陌生代码仓库。
Claude Code 提供了一套完整的智能体编程工具与框架。其核心遵循“先探索、再计划、后编码”的工作流,并通过配置 CLAUDE.md 文件、管理权限和连接 MCP 服务器来优化环境。最佳实践强调为 Claude 提供工作验证方法、积极管理上下文、使用子代理进行调查,以及利用检查点回退来处理复杂任务。文档还详细介绍了在 VS Code、JetBrains IDE、Slack 及 CI/CD 中的集成使用,并提供了避免常见失败模式的实用建议。
推荐理由:Anthropic 官方出的 Claude Code 最佳实践,不是泛泛而谈的入门指南,而是从 CLAUDE.md 配置到 subagent 编排的完整工程手册,用 Claude Code 做日常开发的人直接照抄就能少踩一半坑。
Cognition 发布 Devin 2.0,带来 Agent 原生 IDE 体验和 $20 起的新方案。用户可并行运行多个 Devin,各自配备云端 IDE,可在 IDE 内用 Cmd+I、Cmd+K 等快捷键审查和修改 Devin 的代码。
推荐理由:官方公告列出新 IDE 体验、三项新功能和 $20 起的新定价,读者可据此评估 Devin 在编码工作流中的可用性变化。
DeepSeek 将 deepseek-chat 模型升级为 DeepSeek-V3-0324,推理能力增强,MMLU-Pro 升至 81.2,AIME 升至 59.4。同时优化了 Web 前端开发、中文写作(对齐 R1 风格)、中文搜索及 Function Calling 准确率,并修复了此前问题。
推荐理由:这是 DeepSeek V3 发布后的一次重要版本更新,推理和代码能力提升显著,AIME 提升近 20 分,前端和中文写作体验优化,API 用户应该尽快切换。
Linktree 团队分享使用 Cognition 的 AI 智能体 Devin 一个月的成果:Devin 完成约 300 个 PR,其中约 100 个已合并,主要是修复客户报告的 bug、实现小功能和原型验证。
推荐理由:Linktree 官方复盘 Devin 落地细节,给出任务筛选标准、多 Devin 协作和 API 用法等可直接迁移的经验。
OpenAI 阐述关于 AI 经济学的三点观察:模型智能与训练资源的对数成正比,可预测扩展;AI 使用成本每 12 个月下降约 10 倍,远超摩尔定律速度;智能线性增长将产生超指数级社会经济价值。据此,AI 代理将如虚拟同事般渗透各领域,科学进步将大幅加速,虽然短期内生活照旧,但长期将深刻重塑社会经济结构,个人意志力和适应能力将成为关键价值。
推荐理由:Sam Altman 提出 AI 经济学三大观察,描绘 AGI 时代 Agent 工作图景
Modal 宣布 Sandboxes 正式可用,这是安全运行 LLM、用户或第三方来源不可信代码的隔离执行环境。它提供 exec API,可在运行时用与 Functions 相同的 Image API 动态配置任意语言依赖,支持文件系统快照以持久化和多 Sandbox 扇出,并复用 Functions 基础设施带来快速冷启动、GPU 和全球区域选择。
推荐理由:Modal 官方宣布 Sandboxes 正式可用,给出 exec API、动态镜像和 SWE-bench 7 分钟跑完 Verified 等实测数字,可据此评估智能体代码执行方案。
Answer.AI 团队对 AI 软件工程师 Devin 进行了为期一个月的深度测试。尽管早期在 API 集成等简单任务中表现尚可,但在扩展至新项目创建、研究及代码修改等 20 项真实任务时,结果令人失望:仅 3 项成功,14 项失败,且无法预测成败规律。Devin 常陷入技术死胡同、生成过度复杂的“面条代码”,或在面对不可行任务时产生幻觉并浪费大量时间。文章指出其实际表现远低于宣传预期,难以替代人类开发者。
推荐理由:来自知名 AI 评测机构的详实一手数据,揭示了明星产品 Devin 在真实工作流中的局限性,为评估当前自主编程 Agent 的实际成熟度提供了重要参考。
升级版 Claude 3.5 Sonnet 在软件工程评估基准 SWE-bench Verified 上取得 49% 的解决率,超越此前最佳模型的 45%。该基准通过真实 GitHub 问题测试 AI 模型完成软件工程任务的能力,要求模型在给定环境中理解、修改并测试代码,最终通过原始单元测试验证。Claude 团队构建的智能体设计简洁,仅包含提示词、Bash 工具和编辑工具,赋予模型充分的自主判断空间,以灵活步骤解决问题。目前尚无模型在该基准上突破 50% 的解决率。
推荐理由:Anthropic 把自家 SWE-bench agent 的 prompt、工具设计和踩坑经验全公开了,做 coding agent 的人可以直接抄作业,比看十篇二手解读都管用。
Cognition 宣布 Devin 正式全面可用,无席位限制,所有工程团队可在 app.devin.ai 开始使用,并提供 Slack 集成、IDE 扩展(VSCode 及分支,Beta)和 API,以及 Cognition 工程团队的 onboarding 支持。
推荐理由:官方宣布 Devin 全面开放并给出适用任务、使用建议和多个开源 PR 实例,读者可据此评估如何把 Devin 接入自己的工程流程。
METR 发布 RE-Bench 基准,用 7 个 ML 研究工程环境衡量人类专家与前沿模型智能体的表现,并公开 71 次人类专家尝试及 Claude 3.5 Sonnet 和 o1-preview 的全部运行转录。
推荐理由:原文在同一环境公平对比人类专家与前沿模型智能体,并给出长短时间预算下得分反转的关键数据和完整开源转录。
DeepSeek 将 V2 Chat 与 Coder V2 合并升级为 V2.5,API 用户通过 deepseek-coder 或 deepseek-chat 均可访问。新模型在通用与代码能力上显著提升,ArenaHard winrate 升至 76.3%,HumanEval 达 89%。
推荐理由:DeepSeek 把 coder 和 chat 合并成 V2.5,API 端点不变但性能全线拉高,已有的集成直接受益,代码和通用能力不再是两张皮。
DeepSeek 将 deepseek-coder 模型升级为 DeepSeek-Coder-V2-0724。此次升级为模型版本更新,具体参数规模、性能基准及可用性细节未在更新日志中披露。
推荐理由:DeepSeek Coder 升级到 V2-0724,编码能力再进一步,对 API 用户是直接可用的提升,虽然官方没给技术细节,但仍值得关注。
Eugene Yan 等六位作者发布长文 Applied LLMs,总结一年 LLM 应用开发经验,分战术、运营、战略三部分。战术层面涵盖 n-shot 与 CoT 提示词技巧、RAG 文档相关性、结构化输出工具 Instructor 和 Outlines、LLM-as-Judge 评测及幻觉防护;战略层面提出 PMF 之前不买 GPU、先提示词后微调、系统比模型更构成护城河等观点。
推荐理由:多位从业者基于一年真实开发经验总结提示词、RAG、评测到团队与战略的实践清单,读者可对照自己的 LLM 项目逐条借鉴。
Licklider 1960年论文《人机共生》提出"智能增强"(IA)是通向AI的过渡阶段,预测人机能力互补——计算机处理机械工作、人类负责思考,这一范式延续64年直至LLM打破界限。他预见云计算雏形,但误判技术路径:当时看好的逻辑推理AI成死胡同,而因缺乏数据被忽视的统计方法(LLM)终成主流。对交互预测也偏离现实:设想的多人协作大屏未普及,键盘鼠标仍是主导;对语音识别"5年实现"的乐观估计,实际耗时64年未成熟。
推荐理由:Karpathy 借 1960 年文献反思人机共生与 AI 发展路径,历史洞察深刻