跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 201–220 条 · 共 716 条
7月12日周日
  1. Tibo75

    用户 Tibo 分享了一种通过 CLIProxyAPI 将 Claude Code 后端模型切换为 GPT-5.6 Sol 的方法。只需三步:安装 CLIProxyAPI、连接认证、设置环境变量别名 `claudex`。该别名配置了子智能体模型、始终启用 Effort、最大并发工具调用数等参数。引用推文作者 Theo 补充,若已配置好代理,仅需约 2 条提示词即可完成设置。Tibo 称整个过程约 5 分钟,若被封锁可重置。

    引用Theo - t3.gg@theo

    @thsottiaux 简而言之: - 用 Claude 和 Codex 认证设置 CLIProxyAPI - 连接到 Claude Code - 创建 "claudex" 别名来设置一些环境变量 大概花了 2 个提示(不过说实话我已经把代理设置好了)

    推荐理由:不装Codex app也能用GPT-5.6-Sol,这个别名技巧解决了Claude Code用户的尝鲜难题,一行命令就搞定,对开发者很友好但算不上突破。

7月11日周六
  1. IT之家(RSS)71

    11天Claude Fable 5写超100万行代码:Rust重构JavaScript运行时Bun

    开发者Jarred Sumner借助Claude Fable 5模型,11天内将Bun从Zig重写为Rust,64个实例并行编写超100万行代码,API费用约16.5万美元。重构主因是Zig频繁内存错误,Rust可在编译时捕获。Bun v1.4.0以Canary版本发布,修复128个错误,速度提高约2%到5%。Bun团队已于2025年12月被Anthropic收购。

    推荐理由:这是我能找到的第一个用真金白银量化AI编程能力的项目,16.5万美元对一年人工,Bun的这次重构给所有还在观望的人一记实锤。

  2. Claude Code:GitHub Releases(RSS)56

    Claude Code v2.1.207 发布

    Claude Code v2.1.207 发布。Auto 模式在 Bedrock、Vertex AI 和 Foundry 上无需 `CLAUDE_CODE_ENABLE_AUTO_MODE` 即可使用,可通过 `disableAutoMode` 设置关闭。修复了流式响应中包含超长列表、表格、段落或代码块时终端冻结和按键延迟的问题;修复了非交互式运行中远程托管设置被永久记录为已同意而未显示安全同意对话框的问题;修复了自动更新程序每次发布时覆盖 `~/.local/bin/claude` 自定义启动脚本或符号链接的问题。Bedrock、Vertex 和 Claude Platform on AWS 默认切换为 Claude Opus 4.8。Auto 模式不再从 `.claude/settings.local.json` 读取 `autoMode`,改为使用 `~/.claude/settings.json`。修复了 Windows 上 AWS 凭证解析卡住时无限挂起的问题,60 秒超时保护现在生效。

    推荐理由:对使用 Bedrock、Vertex 和 Foundry 的开发者来说,自动模式默认开放是最实用的变化,加上模型默认升到 Opus 4.8,是个值得升级的稳定版。

  3. ClaudeDevs70

    Claude Code 桌面版现在有了应用内浏览器。 Claude 可以调出文档、设计稿或任何其他网站。它可以像操作本地开发服务器一样,进行阅读、点击浏览和交互。 该浏览器采用沙盒机制且可配置:你可以自行选择会话是否持久保留。

    推荐理由:Claude Code这次更新把看的能力直接内置了,开发者再也不用另开浏览器复制粘贴,对前端调试和文档查阅的效率提升是立竿见影的。

7月10日周五
  1. Claude Code:GitHub Releases(RSS)62

    Claude Code v2.1.206 发布

    Claude Code v2.1.206 发布,主要更新包括:为 `/cd` 命令添加目录路径建议;新增 `/doctor` 检查以建议修剪 CLAUDE.md 文件中模型可从代码库推导的内容;`/commit-push-pr` 现在自动允许 git push 到仓库配置的推送远程仓库;`/login` 支持 Anthropic 运营的公共网关端点;后台智能体在更新后自动升级。修复了过期登录导致所有模型报错、`claude --resume` 和 `--continue` 在启动时无键盘响应、MCP 服务器忽略 `request_timeout_ms` 配置、OAuth MCP 服务器需手动重新认证、`/model` 选择器价格显示错误、桌面会话卡在“运行中”状态、Windows 上键盘输入被忽略等多项问题。

    推荐理由:Claude Code 这次更新修复了一串体验问题,/doctor 检查能帮团队清理冗余的项目文件,后台静默升级也减少了等待时间,日常使用的开发者更新一下不会亏。

  2. Hacker News 热门(buzzing.cc 中文翻译)71

    Bun 被 Anthropic 收购后用 Rust 重写,月下载超 2200 万

    Bun 于 2025 年 12 月被 Anthropic 收购,作者使用预发布版 Claude Fable 5 进行了大量 Rust 重写。Bun 最初用 Zig 在一年内构建,如今 CLI 月下载超 2200 万,被 Claude Code 等采用。广泛功能带来稳定性挑战,v1.3.14 修复了多项 use-after-free、内存泄漏等 bug。团队通过 ASAN、Fuzzilli 模糊测试等系统性预防,并借助 Rust 的内存安全特性减少此类缺陷。

    推荐理由:Bun 创始人把 54 万行 Zig 用 Claude 11 天重写为 Rust,对抗式审查和动态工作流的细节是近期最值得看的 AI 辅助工程实战复盘,做基础设施的可以认真读。

  3. Tibo65

    GPT 5.6 Sol 是我们迄今为止在几乎所有方面最好的模型。 与GPT-5.5相比,在编码、困难上下文与策略任务、搭建网站……以及任何我需要完成的事情上,差异非常显著。这完全要求你提升自己的尝试目标。

    推荐理由:OpenAI 员工首次透露 GPT 5.6 Sol,宣称全面超越 5.5,但推文无任何技术细节,目前只是预告。若属实,这将是年内最重要的模型升级,但先保持观望。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)85

    GPT-5.6 系列模型发布:Sol、Terra、Luna

    OpenAI 推出 GPT-5.6 系列,包括旗舰 Sol、平衡型 Terra 和成本最优 Luna。在 Agents' Last Exam 上,Sol 以 53.6 分超越 Claude Fable 5(自适应推理)13.1 分;中等推理时以约四分之一成本领先 11.4 分。Terra 和 Luna 以约十六分之一成本超越 Fable 5。在 Artificial Analysis Coding Agent Index 上,Sol 以 80 分创 SOTA,高于 Fable 5 的 2.8 分,使用不到一半输出 token、一半时间,成本低约三分之一。引入 Programmatic Tool Calling 减少中间数据往返,ultra 模式协调多个智能体加速复杂任务。模型配备迄今最强安全防护,经人类红队和自动化测试验证。

    推荐理由:GPT-5.6 在编码、安全、知识工作上全面领先,且 token 效率大幅优化,是我今年见过的真正能改变 agent 开发成本结构的发布。程序化工具调用和 ultra 模式值得立即试用。

7月9日周四
  1. AI at Meta65

    来自 @finkd 的消息 — Muse Spark 1.1 已上线。

    引用Mark Zuckerberg@finkd

    (1) 今天我们发布 Muse Spark 1.1——这是一款性能强劲的智能体与编程模型,价格非常低廉。它已通过我们全新的 Meta Model API 上线,并集成在 Meta AI 中。

    推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。

  2. 公众号:龙猫LongCat(美团)74

    美团正式开源 LongCat-2.0,同步开放国产卡推理代码

    美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,为真实 Agentic Coding 任务而生,并作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型。

    推荐理由:LongCat-2.0 把针对国产卡的模型、芯片适配与部署优化作为完整开源栈发布,为存量算力部署万亿模型提供了可复现的协同方案。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)70

    OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷

    OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。

    推荐理由:OpenAI 自己审计了 SWE-Bench Pro,发现三成任务有缺陷,这个基准给出来的分数可能要打问号,做模型评测和选型的人该认真看看。

  4. xAI:News(网页)85

    xAI 发布 Grok 4.5

    xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

    推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。

  5. ClaudeDevs73

    Claude Code 的 model 和 effort 两种设置都旨在提升输出,但机制不同。model 越大,模型能力越强(基于行业标准基准测试)。effort 控制 Claude 在请求上的总工作量,包括思考时间、读取文件数、验证程度、多步任务推进深度等。高 effort 时 Claude 会执行更多操作(读文件、跑测试、再检查);低 effort 时更倾向询问上下文。模型选择本质是切换不同的冻结权重集——权重在训练时固定,prompt 和上下文只能引导(steering)而不能改变权重。模型幻觉是权重产生看似合理但错误的 token 序列。

    推荐理由:Claude Code 官方这篇把 model 和 effort 的取舍讲得比他处都透,读完就知道什么任务该堆算力、什么任务该降模型省钱。

7月8日周三
  1. Replit ⠕68

    本周新功能 🚀 Replit 社区档案——vibe coders 的工作证明。 你的档案,你的展示。获取你的智能体使用和检查点的活跃度图表,外加面向专业用户的 Replit 力量排名。 登录,认领你的档案,挑选你最棒的项目,与朋友分享你的数据。 立即查看 → http://replit.com/community

    推荐理由:Replit 给 vibe coders 加上了个人主页和工作证明,用活动图和排名展示 agent 使用,让 AI 编程社区有了社交层,但实质还是功能小更新,对非重度用户意义有限。

  2. Hacker News 热门(buzzing.cc 中文翻译)71

    AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞

    zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。

    推荐理由:zkSecurity用AI扫了Cloudflare的密码学库,挖出7个真实漏洞,从浮点数精度损失到访问控制完全破防。这是AI在密码学审计里第一次证明自己能找到能用的漏洞,不是纸上谈兵。虽然后面发现AI对严重性的判断还很瞎,但整体值得安全从业者一读。

  3. Hacker News 热门(buzzing.cc 中文翻译)73

    YC CEO声称每日用AI部署3.7万行代码,开发者审查发现前端代码大量臃肿低效

    Y Combinator CEO Garry Tan在X上宣称,他与AI编码代理每天在五个项目中部署37000行代码,并保持连续72天发布记录。波兰开发者Gregorein深入审查Tan网站前端代码,发现大量臃肿与低效问题:页面加载169次请求、总计6.42MB数据(对比Hacker News仅7次12KB);包含28个测试文件、78个未使用的JavaScript控制器、八种格式Logo(含空文件)、未压缩的旧PNG等。Gregorein指出,AI虽能快速生成代码,但质量仍应优先于数量。

    推荐理由:Garry Tan 日行三万七千行的神话被代码审查拆穿,这不是节奏问题,是 AI 编码‘有量无质’的典型病征。认为 AI 编码能光速开发的人该冷静一下了。

  4. Cognition 模型 / Devin 博客(网页)67

    Cognition 发布 SWE-1.7 模型并详解 RL 训练方法

    Cognition 发布 SWE-1.7,称其以更低成本达到前沿智能水平。模型基于 Kimi K2.7 底座训练,FrontierCode 1.1 Main 通过率 42.3%,Terminal-Bench 2.1 为 81.5%,已在 Devin(Web、Desktop 和 CLI)中经 Cerebras 以 1000 TPS 提供。

    推荐理由:官方既公布基准成绩也详解训练方法,读者可以了解多集群 RL 训练、熵稳定和自压缩等具体做法。

7月7日周二
  1. ClaudeDevs70

    Claude Code 团队将“设计循环”定义为智能体重复工作直到满足停止条件,划分四种类型:1)回合循环——手动提示触发,Claude 自判完成,适合短任务,可通过 SKILL.md 提升验证;2)目标循环——`/goal` 手动触发,达成目标或达最大轮数停止,需确定性完成标准(如测试通过数);3)时间循环——`/loop` 和 `/schedule` 按间隔触发,适合同步消息、检查 PR 等重复任务,可云端运行;4)主动循环——事件或计划触发,无人实时参与,每个子任务独立退出。建议从最简单方案开始,选择性使用复杂循环。

    推荐理由:Claude Code 团队官方的循环设计指南,把 `/goal`、`/loop` 这些原语讲得很清楚,想从单次提示转向自主代理工作流的开发者可以直接照着搭。

  2. Claude:Blog(网页)70

    Claude Fable实地指南:发现你的未知

    Claude Fable是第一款要求用户主动澄清未知才能获得高质量工作的模型。与Claude Fable协作是一个在实现前后迭代发现未知的过程。通过将问题分解为已知的已知、已知的未知、未知的已知和未知的未知四类,用户可以借助Claude Fable和Claude Code进行盲点检查、头脑风暴、原型设计、实现笔记记录以及答辩解释,从而高效挖掘并解决深藏于代码库和设计与实现中的潜在问题。

    推荐理由:Anthropic 官方分享的 Claude Fable 协作方法论,把「发现未知」拆成盲点扫描、原型、面试等可操作步骤,如果你用 Claude Code 但常觉得代理跑偏,这篇是必读实践指南。