跳到正文
北京时间

AI 编码

AI 写代码的一切:编码助手、Vibe Coding、代码模型评测与开发工作流变革。

716条精选相关主题Agent 智能体Cursor教程实践

最新精选

第 221–240 条 · 共 716 条
7月6日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)77

    AI颠覆初级程序员就业市场:斯坦福数据揭示年轻开发者就业锐减19%

    斯坦福数字经济实验室基于ADP薪资数据发现,美国22-25岁软件开发人员就业较2022年峰值下降19%,而41-49岁增长14%。入门级岗位招聘减少28%,计算机科学毕业生失业率达6.1%,高于文科专业。核心推手是2024-2025年兴起的智能体编程(Agentic programming)。总程序员就业增长4.4%,但全部来自年长群体。GitHub一年新增3600万账号,80%新用户一周内使用Copilot。编程工作未消失,但“初级程序员”头衔正在消亡。

    推荐理由:用斯坦福、BLS、GitHub和App Store的数据把“初级程序员被替代”讲成了确凿事实,更关键是指出编程正从职业变成每个人的基本能力——对所有写代码的人是必读。

  2. 公众号:龙猫LongCat(美团)71

    美团开源万亿参数模型 LongCat-2.0,同步开放国产卡推理代码

    美团正式开源万亿参数大模型 LongCat-2.0,总参数 1.6T、平均激活约 48B,面向真实 Agentic Coding 任务,官方称在五万卡国产算力集群上完成推理。

    推荐理由:官方公布模型参数结构、三项关键优化和开源链接,可据此评估其在国内存量算力上的部署可行性。

7月5日周日
  1. Meituan LongCat81

    美团今日宣布 LongCat-2.0 完全开源(MIT 许可),公开模型权重与推理代码。该模型为 MoE 架构,总参数量 1.6T,每 token 激活约 48B,支持 1M token 上下文。技术亮点包括 LongCat Sparse Attention 高效处理长文本、Zero-Compute Experts 动态激活 33B–56B 零浪费计算、MOPD 按任务路由 Agent/Reasoning/Interaction 三组专家。Benchmark 成绩:Terminal-Bench 2.1 70.8;SWE-bench Pro 59.5(超越 GPT-5.5 的 58.6);SWE-bench Multilingual 77.3;FORTE 73.2;RWSearch 78.8;BrowseComp 79.9。原生集成 Claude Code、OpenClaw、Hermes Agent 等工具,支持 GPU 与 NPU 部署,已在大规模国内集群验证。

    引用Meituan LongCat@Meituan_LongCat

    正式推出 LongCat-2.0 🐱 1.6T 参数 · MoE 架构,约 48B 活跃参数 · 1M 上下文窗口 这是 @OpenRouter 上 Owl Alpha 背后的完整模型——现已开放使用。 从头为智能体编码而构建: ◆ LongCat 稀疏注意力(LSA)——高效扩展至 1M 上下文 token ◆ 零计算专家——每个 token 动态激活 33B–56B 参数,零计算浪费 ◆ MOPD——三个专精专家组(智能体 / 推理 / 交互),按任务通过门控路由 性能对比: → Terminal-Bench 2.1:70.8 → SWE-bench Pro:59.5(GPT-5.5:58.6) → SWE-bench Multilingual:77.3 → FORTE:73.2 · RWSearch:78.8 · BrowseComp:79.9 📖 技术博客:https://longcat.chat/blog/longcat-2.0/ 在不同场景中试用 🧵👇

    推荐理由:国内大厂首个在 SWE-bench Pro 上超过 GPT-5.5 的开源模型,MIT 协议无任何限制,搞 agentic coding 的团队可以直接用,是个重要转折。

7月4日周六
  1. Hacker News 热门(buzzing.cc 中文翻译)83

    pxpipe:通过图像化压缩输入token降低Claude Code成本

    pxpipe是一个本地代理,将系统提示、工具文档和历史记录等密集文本渲染为PNG图像,利用图像token成本取决于像素尺寸的特性压缩输入token。在Fable 5模型上,约25k文本token压缩为约2.7k图像token,端到端账单降低59–70%。SWE-bench Lite 10个实例全部通过,成本从$54降至$27;SWE-bench Pro 19对测试中18对判定一致,单次请求成本降低约60%。该方法有损(精确ID等需保持文本),默认仅处理`claude-fable-5`请求,可通过`PXPIPE_MODELS`变量控制。

    推荐理由:pxpipe 通过把大量上下文渲染成图像来降低 token 开销,实测能削减 60-70% 的账单,对重度使用 Claude Code 的开发者很诱人,但它有损,精确值可能读错,适合容错高的编码场景。

  2. Simon Willison 博客73

    Fable 的判断力:Simon Willison 从 Claude Code 团队获得的效率技巧

    Simon Willison 在 AIE 上与 Claude Code 团队交流后建议,让 Fable(以及 Opus)用自己的判断力工作,而非硬性规定行为。例如,直接让 Fable 自行决定何时编写测试,比给出具体规则更好。为应对价格即将上涨、节省 Fable token,Jesse Vincent 的另一个技巧是告诉 Fable 将较小任务委托给较低功耗模型(Sonnet 用于实质性实现、Haiku 用于机械修改),主循环保留判断、审计和数据合成等任务。Willison 已将提示词存入 Claude Code 记忆文件,实际效果良好,Fable token 消耗速度明显下降。

    推荐理由:Simon 从 Claude Code 团队得到的实战技巧:别硬性规定 Fable 怎么写测试、用哪个模型,让它自己判断。他实测这条 prompt 能明显节省代币消耗,Fable 涨价前偷时间的利器。

  3. Thariq69

    作者分享与Claude Fable的协作经验,指出“地图≠领土”:提示词与上下文(地图)与实际代码库和约束(领土)之间存在未知。他将未知分为四象限:已知-已知、已知-未知、未知-已知、未知-未知。顶级智能体程序员善于减少未知并预设预案。Fable是首个模型,其工作质量受限于用户澄清未知的能力。Claude可通过快速搜索代码库和互联网、从失败中迭代,帮用户定位未知。具体技巧包括实施前的“盲点检查”及迭代优化;避免指令过于具体或模糊,应让Claude协助发现未知。

    推荐理由:Thariq 总结了一套与 Claude Fable 5 协作时发现「未知的未知」的方法论,从盲点扫描到事后测验,对想用好代理编码的开发者有实操价值。

7月3日周五
  1. Hacker News 热门(buzzing.cc 中文翻译)72

    面向 Web 开发者的 Safari MCP 服务器

    Safari Technology Preview 247 推出 Safari MCP 服务器,基于 Model Context Protocol,允许任何 MCP 兼容客户端连接 Safari 浏览器窗口。智能体可获取 DOM、网络请求、截图、控制台输出等信息,自主完成调试、性能分析、可访问性检查等任务。内置 `browser_console_messages`、`screenshot`、`evaluate_javascript`、`list_network_requests` 等工具。开发者安装后启用“远程自动化与外部智能体”选项,即可通过命令接入,减少窗口切换。

    推荐理由:Safari 首次以官方身份推出 MCP 服务器,让 AI 编程助手能直接调试浏览器渲染,对前端开发者做兼容性测试和性能检查很实用,不过局限在 Safari 生态。

  2. Hacker News 热门(buzzing.cc 中文翻译)70

    《Fable》通关指南:短绳AI编程法

    专业开发者经过一年多研究,总结出使用AI编码代理的“短绳方法”。该方法要求开发者全程参与:先规划并分解任务,从不使用YOLO模式,每次变更前审查差异并拒绝不想要的更改,每个子任务后提交以防止AI误操作(如Opus曾出现破坏性行为)。最终需进行人工与AI双重PR审查,PR须注明使用模型,提交者须亲自审查自己PR的代码。即便不用前沿模型,此法也能产出超越Fable 5的代码质量。

    推荐理由:这篇是资深安全开发者一年的实战总结,提出的「短绳法」把AI代理栓紧,不是让开发者当甩手掌柜,而是逼你逐行审查,对代码质量死磕到底,比那些鼓吹全自动的大路货更有实操价值。

  3. LangChain:Blog(RSS)64

    OpenWiki:为编码智能体生成并维护开源仓库文档

    LangChain 推出 OpenWiki,一个为编码智能体自动生成和维护代码库文档的开源工具。它让智能体能直接检索所需的仓库上下文,无需将所有内容加载到单个指令文件中。

    推荐理由:LangChain 开源的这个文档生成代理解决了编码代理上下文管理的一个痛点,对重度使用 agent 做开发的团队很实用。

7月2日周四
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    Senior SWE-Bench:评估AI智能体作为高级工程师的基准测试

    Senior SWE-Bench是一个开源基准测试,用于评估AI智能体完成高级软件工程师级别任务的能力。任务分功能开发与Bug修复两类:功能任务指令类似自然语言消息,采用验证智能体基于专家配方自动生成行为测试;Bug任务要求根据日志、profiling等运行时信息深入调查。排行榜显示,Claude Opus 4.8搭配Mini-SWE-Agent(max effort)通过率24.0%,Claude Sonnet 5为19.4%,GPT-5.5为16.0%,最强前沿模型在超75%任务中未能达到高级工程师级别的正确性与品味。每个功能任务平均涉及11个文件,最强智能体也需数百步完成;中位指令长度仅为SWE-Bench Pro的31%。任务来源于从库到多服务应用的仓库PR,由拥有数百次提交的工程师编写。

    推荐理由:这个新基准把 AI 编程代理的评估拉到了更真实的复杂度,顶尖模型也只有不到四分之一的成功率,做 coding agent 的都该拿它测一测,它会比 SWE-bench 更挑出工程师的“手感”。

  2. Hacker News 热门(buzzing.cc 中文翻译)71

    Kimi K2.7 Code 已在 GitHub Copilot 上正式发布

    Kimi K2.7 Code 开源权重模型已在 GitHub Copilot 中正式可用,成为 Copilot 模型选择器首个可选的开源权重模型,为编程工作流提供更低成本选择。该模型由 GitHub 托管于 Microsoft Azure,按供应商列表价格以用量计费。逐步向 Copilot Pro、Pro+ 和 Max 计划用户推送,用户可在 Visual Studio Code 1.127.0 或更新版本、Visual Studio 17.14.6 或更新版本、JetBrains 1.9.1-251 或更新版本、Xcode、Eclipse 等 IDE 及 Copilot CLI、GitHub.com、GitHub Mobile 等平台中选用。后续几周将扩展至 Copilot Business 和 Enterprise,当前默认关闭,需管理员在 Copilot 设置中启用策略。

    推荐理由:GitHub Copilot 首次把开源权重模型放进模型选择器,Kimi K2.7 Code 作为低价选项可能会改变很多开发者的使用习惯,对个人开发者尤其友好。

  3. 腾讯混元:Research(API)69

    腾讯混元正式发布Hy3模型

    腾讯混元于7月6日正式发布Hy3模型。相比preview版,任务解决率从72%升至90%,平均耗时缩短34%;幻觉率从12.5%降至5.4%,常识错误率从25.4%降至12.7%,多轮问题率从17.4%降至7.9%,长对话基准MRCR从42.9%升至75.1%。在270位专家盲测中均分2.67/4,优于GLM5.1的2.51/4。API价格为输入1元/百万tokens、输出4元、缓存命中0.25元。模型已基于Apache 2.0协议开源。

    推荐理由:腾讯混元重建后的正式版,幻觉率砍半,工具调用稳定性大幅提升,内部盲测压过GLM5.1。做Agent和内部工具的团队值得重新评估这个高性价比选项。

  4. Claude Code:GitHub Releases(RSS)64

    Claude Code v2.1.198 发布

    Claude Code v2.1.198 更新。Claude in Chrome 现已全面可用。为 claude agents 新增后台智能体通知(agent_needs_input / agent_completed)。新增 /dataviz 技能,提供图表与仪表盘设计指导及配色验证器。Gateway 增加 AWS 上的 Claude Platform 作为上游提供商。后台智能体在 worktree 中完成代码后自动提交、推送并创建草稿 PR。内置 Explore 智能体现继承主会话模型(上限 opus)。修复网络短暂断开导致响应中断、后台任务卡在“Running”状态、智能体团队队友因 API 错误失败等问题。

    推荐理由:如果你是Claude Code用户,这次更新很实在,Chrome版终于正式可用,背景agent的自动提PR和通知功能能省不少事,/dataviz也能辅助可视化。

7月1日周三
  1. 公众号:龙猫LongCat(美团)82

    美团 LongCat-2.0 正式发布:国产算力集群训练的万亿参数大模型

    美团于6月30日发布新一代万亿参数大模型LongCat-2.0并开源。总参数1.6T,平均激活约48B,原生支持1M超长上下文,在五万卡国产算力集群上完成全流程训练与推理。采用LSA稀疏注意力、零计算专家、ScMoE及MOPD多专家融合(Agent/Reasoning/Interaction三组专家)架构。评测中SWE-bench Pro获59.5,SWE-bench Multilingual获77.3。预览版已通过OpenRouter和longcat.ai开放,月调用量跻身OpenRouter全球前三。

    推荐理由:国产算力上首个全流程自训的万亿开源模型,1M上下文和动态专家架构直指Agentic Coding场景,OpenRouter调用量已经冲到前三,不是Demo是生产力。

  2. 公众号:龙猫LongCat(美团)78

    美团发布 LongCat-2.0:五万卡国产算力集群训练与推理的万亿参数开源模型

    美团6月30日发布并开源万亿参数大模型 LongCat-2.0,总参数1.6T、平均激活约48B,为业界首个在五万卡国产算力集群上完成全流程训练与推理的模型,原生支持1M超长上下文。

    推荐理由:在五万卡国产算力集群上稳定训练万亿参数 MoE 并达到前沿编程能力的工程实践,为算力受限场景下的模型架构设计提供了可参照的技术路线。

  3. Claude Code:GitHub Releases(RSS)81

    Claude Code v2.1.197 发布:默认模型升级为 Claude Sonnet 5,支持原生 1M-token 上下文窗口

    Claude Code v2.1.197 更新将 Claude Sonnet 5 设为默认模型,原生支持 1M-token 上下文窗口。该版本提供促销定价,输入 $2/M tokens、输出 $10/M tokens,持续至 8 月 31 日。用户更新至 v2.1.197 即可启用。

    推荐理由:Sonnet 5 把中端模型的上下文干到 1M token,促销价让 Claude Code 性价比突然很能打,用 Claude 写代码的可以无脑升了。

  4. OpenRouter73

    Claude Sonnet 5 正在 OpenRouter 上推出,促销价格:$2/M 输入,$10/M 输出!它以 Sonnet 定价提供旗舰智能,提升智能体编码和专业工作流。在早期测试中,智能体比 4.6 更可靠、更快,且更容易信任处理更大的任务。

    推荐理由:Anthropic 把旗舰智能放进 Sonnet 定价,代理编码的可靠性明显提升,这个早期信号对做 AI 产品的团队意味着成本与性能需要重新计算。

  5. Anthropic:Newsroom(网页)81

    Claude Sonnet 5 发布

    Claude Sonnet 5 是 Anthropic 推出的最新 Sonnet 模型,具备计划、浏览器和终端工具使用能力,可自主运行。性能接近 Opus 4.8,定价更低:即日起至 2026 年 8 月 31 日,输入 token $2/百万,输出 $10/百万,之后恢复为 $3/百万输入和 $15/百万输出。相比 Sonnet 4.6,在推理、工具使用、编程和知识工作等智能体能力上大幅提升。在 BrowseComp 和 OSWorld-Verified 评测中严格优于 Sonnet 4.6。安全评估显示不良行为率更低,幻觉和谄媚减少,但网络安全能力弱于 Opus 4.8。即日起在所有套餐及 Claude Code、Claude API 中可用。

    推荐理由:Claude Sonnet 5 把代理能力从 Opus 下放到了 Sonnet,性能接近 Opus 4.8 但价格只有三分之一,这对开发者来说性价比飞跃。虽然还不是最强,但已经能让许多复杂任务从勉强可用变成可靠。