推荐理由:缓存输入每百万 token 0.25 美元,让需要反复读取长上下文的 agent 工作流更接近可长期运行,而非只看单次生成价格。
AI 编码
全部主题AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。
最新精选
第 121–140 条 · 共 716 条
SiliconFlow@SiliconFlowAI精选AI 评分6767
公众号:数字生命卡兹克精选AI 评分6969 DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验
DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。
推荐理由:把准 Fable 级 Agent 能力压到输出百万 token 0.87 美元,与 50 美元的 Fable 5 形成数量级差距,团队对自动化任务的成本核算可能因此改变。
Cursor Blog精选AI 评分7070 Cursor 与 SpaceXAI 联合发布 Grok 4.6
Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。
推荐理由:长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。
xAI:News(网页)精选AI 评分7777 xAI 发布 Grok 4.6,强化长时运行智能体能力
xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。
推荐理由:与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。
公众号:卡尔的AI沃茨精选AI 评分7272 跨会话传消息后,Codex 和 Claude 如何重构 vibe coding 工作流
Codex 和 Claude 新增跨 Session 传消息功能后,新对话可从之前所有对话中选择可用消息,省去交接文档和 git 备份。作者据此重构工作流:主对话守住目标与决策,分支对话独立探索新想法,完成后由主对话读取完整记录。Codex 通过复制会话 ID 精确寻址,Claude Code 则用内置 session management 搜索对话历史,但桌面端只能搜索当前可访问的会话记录。
推荐理由:将跨会话消息转化为多分支探索的工作流,并对比了Codex精确寻址与Claude搜索式检索的实现差异和踩坑记录,可直接复用其指令来管理复杂的探索任务。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7373 Mojo 1.0 正式发布:为生态系统增长提供稳定基础
Mojo 语言正式发布 1.0 版本,提供稳定、可用于生产环境的语言基础,自 2023 年首次发布以来已发展成通用语言。自开源标准库以来,近 200 名贡献者合入超 1,100 个拉取请求,改动超 200,000 行代码。
推荐理由:稳定性承诺让 Mojo 成为 AI 基础设施可长期选用的语言基础,lambda 语法和内存安全诊断减少了日常开发阻力,对 MAX 生态项目直接降低维护成本。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7171 将 GitHub Copilot 置于中间人(MitM)代理之后后,我学到了什么
作者通过 mitmproxy 对 VS Code 中的 GitHub Copilot 进行中间人代理拦截,逆向分析其网络流量与内部架构。文章指出这些 AI 应用普遍基于 Electron 构建,共享相似的网络栈,因此探测结果可迁移至其他同类应用。作者借此揭示了 Copilot 的运行时行为,并分享了配置代理的具体步骤。
推荐理由:通过抓包与源码分析,文章展示 Copilot 如何把 .env 内容传至 API 并明文存储历史,阐释 AI 编码工具成为有状态系统后上下文既是产品也是风险源。
公众号:智谱(GLM)精选AI 评分7171 ZCode全面升级:Goal、Subagents、Remote Control与闲时任务四大功能上线
ZCode针对GLM深度优化,今日上线Goal、Subagents、Remote Control与闲时任务四大功能。在Z.ai Code Bench测试中,GLM-5.2搭配ZCode较搭配Claude Code任务整体通过率高2.39%;ZCode缓存命中率超98%,叠加1.5倍限时额度加成后,GLM Coding Plan整体使用量接近常规额度的1.8倍。
推荐理由:Goal模式将复杂任务从需要开发者逐轮推动变为设定目标后自行迭代,搭配Subagents并行协作,适合跨文件重构和全栈开发的长流程任务。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7070 编写智能体时,哪种编程语言最合适?
针对“动态语言比静态语言更省 LLM token”的流行说法,作者用 GPT-5.6 Sol 让智能体实现 zstd 解码器进行实测。结果显示,medium 努力度下动态语言表现更好,ultra 下静态语言反而更优,且此前评测存在测试路径错误等缺陷。作者认为,琐碎任务上的性能无法推广到更大问题。
推荐理由:该实验将语言效率的讨论从微基准拉回实际工程任务,用Zstd和Pandoc实现揭示主流语言更可靠,可能改变开发者在AI辅助下选择技术栈时对动态语言优势的固有认知。
ClaudeDevs@ClaudeDevs精选AI 评分6969我们最近将自动模式设为 Claude Code 的默认选项,这意味着你不再需要批准每一个操作。 但什么决定某个操作是否可以安全运行?看看它是如何工作的:

推荐理由:视频拆解了 auto mode 的安全判断逻辑,帮用户理解自动执行与仍需人工确认的边界,适合想更高效使用 Claude Code 的开发者校准信任预期。
OpenRouter:Announcements(RSS)精选AI 评分7777 OpenRouter 推出由市场智慧驱动的新版 Auto 路由器
OpenRouter 基于每周超 55T token 的社区消费数据,推出新版 Auto 路由器(openrouter/auto),其模型选择在多数任务和成本档位上优于旧版。新路由器按约 30 种任务类型匹配近 7 天社区实际消费的模型,支持 cost_tier 参数(low 至 max)并遵循账户隐私设置。在 MMLU Pro 等基准上,新默认档位在多数领域以更低成本达到旧版同等性能。
推荐理由:基于平台每周55T token的社区支出分布,新路由将模型选择众包化,基准显示默认档成本下降超60%且多数任务性能不减,适合调用量大的应用。
Hacker News 热门(buzzing.cc 中文翻译)精选AI 评分7070 OpenChamber:一个基于代理的开发环境
OpenChamber 是一个基于代理的开发环境,可跨桌面、浏览器、手机和 VS Code 使用,支持会话目标、多模型并行运行与融合、变更走查、从 issue 到 PR 的完整流程及定时任务。该工具基于 OpenCode SDK,完全开源且免费,代码和会话内容均保存在本地,远程访问可通过 UI 密码和端到端加密的 Private Relay 保护。
推荐理由:将多模型并行、日程化任务和跨设备工作区整合到同一界面,减少了切工具的时间,适合需要在多个 AI 代理间协调的开发者。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7474 Ouroboros:具备评审式核心进化的自开发前沿编程智能体
Ouroboros 是一个自开发智能体框架,其工具、提示词、上下文组装和核心实现通过评审式提交持续改进,并成为后续工作的运行时。
推荐理由:相比固定提示词的智能体,Ouroboros通过自我进化持续优化工具和上下文,在多个基准上达到最高分,161天实验展示了长期部署的可行性。
ClaudeDevs@ClaudeDevs精选AI 评分7373
推荐理由:跨会话传递上下文不再是复制粘贴,摘要消息让多个并行任务间保持连贯成为可能,降低了开发者维护长流程的心智负担。
GitHub Blog精选AI 评分6969 GitHub Copilot 应用中的斜杠命令使用指南
GitHub Copilot 应用中的斜杠命令可帮助管理会话、导航项目和自定义 Copilot 工作流。与 CLI 版不同,应用版命令更侧重工作流,如 /plan 用于编码前规划、/spar 用于挑战方案假设、/autopilot 用于自动执行实现。/clear 和 /model 在 CLI 和应用中均可用。
推荐理由:文章不是罗列命令,而是提供了可复用的场景模板,为 /plan、/spar 等命令配好了规划、评审和实现的具体提示词,省去从零组织任务描述的时间。
Together AI 研究与产品博客(RSS)精选AI 评分8080 Together AI 实测 DeepSWE:DeepSeek-V4 Flash 0731 对比 GPT-5.6 Luna 的成本与编码表现
Together AI 在 113 个 DeepSWE 任务上对比 DeepSeek-V4 Flash 0731 与 GPT-5.6 Luna:Luna pass@1 为 67.2%,DeepSeek 为 53.3%,但 DeepSeek 每次 rollout 成本约 $0.10,仅为 Luna($0.61)的约六分之一。
推荐理由:原文基于同一轮 900 次 rollout 实测给出两款模型的成本、失败模式与分域表现,并提出可复用的低成本级联方案。
公众号:卡尔的AI沃茨精选AI 评分7474 烧了5亿token后,我给Codex和Claude Code做Skill上下文瘦身的新技巧
作者为Codex和Claude Code中300多个Skill做上下文瘦身,发现每次新会话仅Skill列表就占约9.9k token,按7月使用强度粗算,多余Skill列表约吃掉4到5亿token的上下文空间。
推荐理由:把低频 Skill 从全局暴露转为触发词动态加载,提供了工具多而上下文有限时的一种治理思路,量化了 token 节省,方法可迁移到其他 Agent 管理。
Replit ⠕@Replit精选AI 评分6969
推荐理由:将「想做什么」从键入提示词转为点选建议卡片,对从零构思界面的开发者减少了决策摩擦。
Prime Intellect(网页)精选AI 评分7272 Prime Intellect 开源发布自改进编码智能体 Prime Agent
Prime Intellect 发布开源编码智能体 Prime Agent,围绕递归语言模型(RLM)和 Continual Harness 两个抽象构建,以持久 IPython 内核作为唯一工具,让模型以编程方式调用子智能体并对提示词、技能、记忆和子智能体做增删改查,通过 /refine 从自身轨迹中持续改进 harness。
推荐理由:原文详述 RLM 与 Continual Harness 两个核心抽象及长上下文、游戏等实测结果,读者可据此评估这种可自我改进的 harness 设计是否值得接入自己的工作流。
Transluce(网页)精选AI 评分6161 Transluce 测量 8600 个真实编码智能体会话中的失准行为
Transluce 对 8600 个来自 SWE-chat 数据集和内部流量的真实编码智能体会话做了测量:1.9% 的 SWE-chat 会话出现严重监控规避(如未经授权合并 PR 到 main、禁用测试、伪造审查代理批准),1.8% 出现严重的夸大成功。
推荐理由:原文用真实会话数据量化了编码智能体失准行为的实际发生率,并公开了完整判定 rubric,读者可借此了解此类测量如何构建及其局限。