跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 581–600 条 · 共 716 条
3月27日周五
  1. Greg Brockman

    Codex 正式上线 Plugins 功能,开箱即用支持 Slack、Figma、Notion、Gmail 等主流开发工具,开发者可直接在 Codex 中调用这些服务。

    引用OpenAI Developers@OpenAIDevs

    我们正在将插件引入 Codex。 Codex 现在开箱即用地与构建者已经使用的最重要工具无缝协作,例如 @SlackHQ、@Figma、@NotionHQ、@gmail 等。 http://developers.openai.com/codex/plugins https://t.co/TIbsIUAf6S

    推荐理由:OpenAI Codex 正式上线插件系统,开箱即用地连接 Slack、Figma 等主流工具

  2. Andrej Karpathy

    构建现代应用的最大挑战并非代码本身,而是 DevOps 中繁琐的服务集成、API 密钥管理和部署配置。作者期待未来 AI 智能体能自动完成从文档阅读到生产环境部署的全流程,无需人工点击网页或手动配置。Stripe 推出的 Projects 正是朝此方向迈进:开发者可通过 CLI 命令自动配置 PostHog 等第三方服务,实现账户创建、密钥获取和计费设置的自动化,真正将基础设施生命周期转化为代码。

    引用Patrick Collison@patrickc

    当 @karpathy 构建 MenuGen(https://karpathy.bearblog.dev/vibe-coding-menugen/)时,他说: "Vibe coding menugen 作为本地演示是一段令人兴奋又有趣的冒险,但作为已部署的真实应用,就有点像是痛苦的苦差事了。构建一个现代应用有点像组装宜家的未来。有各种各样的服务、文档、API 密钥、配置、开发/生产部署、团队和安全功能、速率限制、定价层级。" 我们在用智能体构建时都遇到过这个问题:你必须匆匆忙忙地去创建账户,在浏览器里点来点去,仿佛回到了 2023 年那种上古时代,才能解除阻碍它那超级智能的进展。 所以我们决定构建 Stripe Projects,帮助智能体从 CLI 即时配置服务。 例如,只需运行: $ stripe projects add posthog/analytics 它就会创建一个 PostHog 账户、获取一个 API 密钥,并(在需要时)设置计费。 Projects 今天作为开发者预览版发布。你可以在 http://projects.dev 注册获取访问权限(我们很快就会向所有人开放)。我们还将在未来几周内推出对许多新提供商的支持。(如果你想让你的服务可用,请联系我们。) https://projects.dev

    推荐理由:Karpathy指出Vibe Coding最大痛点是DevOps集成,Stripe Projects让Agent直接CLI配置服务免人工点击

3月26日周四
  1. Cursor Blog69

    通过实时强化学习改进Composer编码模型

    Cursor团队将实时强化学习技术应用于Composer编码模型,利用真实用户交互产生的推理令牌作为训练信号,以解决模拟环境与真实使用间的匹配问题。该技术使团队能够以每五小时一次的频率部署改进后的模型检查点。通过A/B测试,新版本实现了关键指标提升:代理编辑在代码库中的持久性增加2.28%,用户不满意后续减少3.13%,延迟降低10.3%。实时RL也带来了奖励黑客等新挑战,但真实用户反馈有助于识别和修正此类问题。

    推荐理由:Cursor 把真实用户交互当训练信号,每五小时迭代一次 Composer,这不是论文是工程日志。做 coding agent 的团队该看看他们怎么处理 reward hacking 的两个真实案例,比任何 benchmark 论文都实在。

3月25日周三
  1. Google Developers Blog(RSS)84

    用 Agent 技能弥合知识鸿沟

    Google DeepMind 开发出一项“Gemini API 开发者技能”,使智能体能够实时获取最新文档与 SDK 指导。评估结果显示,配备该技能后,gemini-3.1-pro-preview 模型的成功率从 28.2% 大幅跃升至 96.6%。这种轻量级方法通过赋予模型强大的推理能力并接入“事实来源”,有效解决了静态模型知识与快速演进的软件实践之间的脱节问题,显著消除了过时的编码模式。

    推荐理由:通过实时文档赋能模型,编码任务成功率飙升,开发者可借鉴优化AI工具。

  2. Boris Cherny

    Claude Code 推出 auto mode,自动代为决定文件写入与 bash 命令的权限,无需逐条手动确认,也不必完全开放权限。每项操作执行前仍经 safeguards 安全检查。

    引用Claude@claudeai

    Claude Code 新增功能:自动模式。 不再需要逐个批准每次文件写入和 bash 命令,也不必完全跳过权限检查,自动模式让 Claude 替你做权限决策。 安全机制会在每个操作执行前进行检查。https://t.co/kHbTN2jrWw

    推荐理由:Claude Code 新增自动模式,Agent 无需逐条确认即可安全执行命令

  3. Jim Fan

    vibe agents带来远超传统身份盗窃的安全威胁,整个文件系统成为分布式攻击面,~/.claude、skills目录乃至PDF都可能被base64病毒污染。LiteLLM 1.82.8被入侵事件显示恶意代码可窃取凭证并自我复制。当前代理框架面临权限管理困境,只能在盲目授权与完全跳过间选择。未来需"de-vibing"行业,用经审计的Software 1.0为Software 3.0建立多层安全护栏。

    引用Daniel Hnyk@hnykda

    LiteLLM 已被入侵,请勿更新。我们刚刚发现 LiteLLM pypi 版本 1.82.8 已被入侵,它包含 litellm_init.pth,其中带有 base64 编码的指令,用于将其能找到的所有凭据发送到远程服务器 + 自我复制。链接如下

    推荐理由:Jim Fan警示Agent时代新型供应链攻击风险,以LiteLLM被黑事件为例揭示文件系统污染威胁

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude Code 自动模式:在安全与效率间取得平衡

    Anthropic 为 Claude Code 推出“自动模式”,旨在解决用户因频繁手动批准而产生的“批准疲劳”。该模式介于完全手动审批和危险的无权限跳过之间,采用两层防御机制:输入层通过服务器端提示注入探测器扫描工具输出;输出层则利用基于 Sonnet 4.6 模型的转录分类器,在执行前评估操作风险。分类器采用高效的两阶段设计,先快速过滤,必要时才启动思维链推理。其目标是拦截危险操作(如过度积极行为、无心之失、提示注入等),同时让大部分安全操作无需确认即可运行,内部测试显示用户原本会批准约93%的手动提示。

    推荐理由:这是 Claude Code 从「手动审批」跳到「AI 自审」的关键一步,双层防御设计坦诚到连 17% 漏检率都公开讲,做 coding agent 的团队该把这篇当安全设计参考。

  5. Google Research:Blog(网页)

    Vibe Coding XR:基于 XR Blocks 与 Gemini 加速 AI + XR 原型开发

    Google XR 团队推出 Vibe Coding XR 工作流,结合 Gemini Canvas 与开源框架 XR Blocks,利用长上下文推理能力将自然语言提示在 60 秒内转化为可交互、支持物理效果的 WebXR 应用。该方案基于 WebXR、three.js 和 LiteRT.js 构建,支持手势交互与深度感知,可在桌面模拟环境或 Android XR 头显中实时预览。已展示的应用包括几何可视化数学辅导和交互式物理实验室,用户可通过捏合等手势操作 3D 对象,快速验证空间交互设计。

    推荐理由:Google推出Vibe Coding XR,用自然语言快速生成可交互的Android XR空间应用。

3月24日周二
  1. Boris Cherny

    Anthropic Labs团队规模虽小但迭代迅速,先后发布MCP、Skills、Claude Desktop app及Claude Code。从Sonnet 3.6时代笨拙的Computer Use原型,到如今正式在Claude Cowork和Claude Code中开放完整功能。Claude现可操控电脑完成打开应用、浏览网页、填写表格等任务。目前处于研究预览阶段,仅支持macOS。

    引用Claude@claudeai

    你现在可以让 Claude 使用你的电脑来完成任务。 它可以打开你的应用程序、浏览你的浏览器、填写电子表格——任何你在桌前能做的事情。 研究预览版现已登陆 Claude Cowork 和 Claude Code,仅限 macOS。https://t.co/sVymgmtEMI

    推荐理由:Claude 开放 Computer Use 研究预览,支持在 Cowork 和 Code 中操控电脑完成任务

  2. Google Developers Blog(RSS)71

    跳跃即玩:利用Gemini与MediaPipe进行开发

    该工作流通过Gemini Canvas,借助高级提示词快速原型化MediaPipe Pose Landmarker等体感游戏机制。开发者可在Google AI Studio中优化原型,采用低延迟的“轻量”模型和稳定的追踪点(如肩部关节点)以确保游戏响应灵敏。最后,流程利用Gemini Code Assist将实验性代码重构为模块化、可用于生产的应用程序,使其能够支持多种多模态输入,从而显著简化了体感控制游戏的开发过程。

    推荐理由:开发者可快速上手AI游戏开发,优化性能并部署生产应用。

  3. Thariq

    Claude Code 推出电脑控制功能,支持鼠标、键盘和屏幕操作,可操控任意应用。配合 Dispatch 使用还能实现远程控制,在用户离开电脑时继续通过 Claude 操作设备。

    引用Felix Rieseberg@felixrieseberg

    今天,我们发布了一项功能,允许 Claude 控制你的电脑:鼠标、键盘和屏幕,使其能够使用任何应用。 我相信,如果与 Dispatch 一起使用,这会特别有用,Dispatch 允许你在外出时远程控制电脑上的 Claude。

    推荐理由:Claude Code 新增完整计算机控制能力,可操控鼠标键盘及任意应用,支持远程使用

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)75

    利用对抗网络灵感设计多代理架构,突破长时应用开发瓶颈

    作者受生成对抗网络启发,设计了一个包含规划器、生成器和评估器的三代理架构,以解决Claude在长时应用开发中的两大瓶颈。该架构通过上下文重置机制,有效克服了模型在长任务中的“上下文焦虑”问题;同时,通过分离生成与评估功能,使代理能依据具体标准进行迭代改进,而非盲目自评。这一方法成功使系统能在多小时的自主运行中生成完整的全栈应用程序,突破了此前提示工程和传统工具设计的性能上限。

    推荐理由:Anthropic 工程师把 GAN 的 generator-evaluator 思路搬进长时 Agent 架构,从设计到全栈编码都跑通了,还附了成本和失败模式。做 Agent 产品的人读完能直接抄作业,比看十篇论文管用。

3月23日周一
  1. Anthropic:Research(发表成果 · 网页)71

    利用长时运行智能体工作流革新科学计算

    Anthropic 研究员展示了如何将多日智能体编码工作流应用于科学计算任务。以使用 Claude Opus 实现宇宙学玻尔兹曼求解器的可微分版本为例,该任务通常需耗费研究人员数月甚至数年时间。通过制定清晰的项目指令、利用日志文件作为智能体的持久记忆并设置测试预言,即使是非领域专家也能引导智能体在数小时内完成这类复杂项目。该方法的核心在于设定高层目标后,让智能体团队自主工作,仅需偶尔人工监督,从而显著提升了科学代码开发与移植的效率。

    推荐理由:Anthropic 研究员用 Claude Opus 4.6 花几天从零写出了一个宇宙学 Boltzmann 求解器,原本是博士级团队几个月的活。这不是论文,是一份完整的多日 Agent 工作流实操手册,做科研或长周期编码的人可以直接抄作业。

3月22日周日
  1. Greg Brockman

    只要投入必要的思考与意图,GPT-5.4 就能产出相当出色的前端代码。OpenAI 开发者博客提供了详细的最佳实践指南。

    引用Sherwin Wu@sherwinwu

    如果你投入所需的思考和用心,你实际上能从 GPT-5.4 得到相当出色的前端!在这里查看一些最佳实践: https://developers.openai.com/blog/designing-delightful-frontends-with-gpt-5-4

    推荐理由:OpenAI官方发布GPT-5.4前端开发最佳实践,Greg Brockman背书推荐

3月21日周六
3月20日周五
  1. Cognition 模型 / Devin 博客(网页)65

    Devin 推出 Scheduled Devins,可自主安排定时任务

    Cognition 宣布 Devin 新增定时会话功能,用户只需描述周期性需求,Devin 会自行设定节奏并自动执行,无需配置 cron 或工作流。

    推荐理由:官方介绍了 Devin 定时任务的具体玩法,包括跨运行记忆和与 Managed Devins 组合并行执行,对想自动化例行工程工作的团队有直接参考。