跳到正文
北京时间

全部动态

今日 65 条
4月27日周一
  1. Hacker News 热门(buzzing.cc 中文翻译)71

    为什么 SWE-bench Verified 不再衡量前沿编码能力

    OpenAI宣布停止使用SWE-bench Verified基准评估前沿编码能力。该基准基于GitHub历史问题构建,其任务分布已无法准确反映当前AI编码助手需解决的实际问题类型。随着模型性能提升,基准测试集趋于饱和,区分度下降,现有模型表现已接近人类水平。因此,团队将转向更具挑战性和现实复杂度的新评估方法。

    推荐理由:OpenAI 亲自给 SWE-bench Verified 判了死刑,这比任何第三方评测都有说服力。做 coding agent 选型的人该认真想想,你的 benchmark 体系是不是也该换了。

4月25日周六
  1. Simon Willison 博客70

    GPT-5.5 提示指南

    OpenAI 针对新发布的 GPT-5.5 API 模型发布了详细的提示指南。核心建议包括:在处理多步骤任务时,应在调用工具前先向用户发送简短的状态更新,以提升交互体验。官方强调 GPT-5.5 应被视为一个需要重新调优的新模型系列,而非 GPT-5.2 或 GPT-5.4 的直接替代品,建议从零开始构建提示,而非沿用旧有提示。开发者可通过 `openai-docs` 技能使用 `$openai-docs migrate this project to gpt-5.5` 命令来辅助代码迁移,官方升级指南中还包含了轻量的提示词改写建议。

    推荐理由:OpenAI 官方明确说 GPT-5.5 不能当 drop-in replacement,prompt 要从零重写。做产品的人别偷懒直接换模型名,先读这份指南再动手,省得上线翻车。

4月24日周五
  1. OpenRouter:Announcements(RSS)67

    使用Agent SDK搭建自定义编码智能体

    OpenRouter Agent SDK 提供 create-agent-tui 和 create-headless-agent 两种技能,可在几分钟内脚手架搭建个性化编码智能体。前者附带终端 UI,后者为无头模式,适用于脚本与管道自动化场景。

    推荐理由:虽然隔了一个多月,但这个官方教程把 Agent SDK 的脚手架玩法拆得很透,想自己搭 coding agent 的开发者抄一遍就能跑起来,省得从头写 harness。

  2. OpenRouter:Announcements(RSS)55

    OpenRouter Agent SDK 发布 `create-agent-tui` 与 `create-headless-agent` 技能,可快速搭建个性化编码智能体

    OpenRouter Agent SDK 推出 `create-agent-tui` 和 `create-headless-agent` 两类技能(skills),用于快速搭建(scaffold)个性化编码智能体。前者提供终端 UI(terminal UI),后者为无头模式(headless),适用于脚本和流水线(scripts and pipelines)。

    推荐理由:一个用 OpenRouter Agent SDK 快速搭建编码 agent 的脚手架,适合想省时间的开发者,但内容本身是常规文档,42 天前的教程现在已经没什么新意。

  3. PromptArmor:Threat Intelligence69

    PromptArmor 解析 AI 应用连接器的间接提示词注入风险与审计方法

    PromptArmor 提出评估 AI 应用连接器风险的三支柱模型,不可信外部数据、敏感内部数据和下游动作,并呼应 Simon Willison 的 Lethal Trifecta,举例说明 Confluence 与 Zendesk 连接器组合可将内部文档经工单回复外泄。

    推荐理由:原文给出连接器风险的三支柱威胁模型和主流企业 AI 应用的具体配置路径,读者可据此审计自己环境中的连接器组合。

  4. Simon Willison 博客74

    通过半官方Codex后门API为GPT-5.5生成“骑自行车的鹈鹕”

    尽管GPT-5.5的官方API尚未发布,但作者利用OpenAI为OpenClaw等工具开放的订阅集成机制,通过反向工程开源Codex CLI,开发了一个LLM插件。该插件允许付费订阅用户通过Codex后端API调用GPT-5.5模型。文章以生成“骑自行车的鹈鹕”SVG图像为例,展示了其使用效果,并指出高推理强度设置能显著提升输出质量,但耗时更长。目前,OpenAI表示正与合作伙伴制定API大规模服务的安全要求。

    推荐理由:Simon Willison 不只评测 GPT-5.5,还顺手逆向 Codex 做了个用订阅跑 API 的插件。定价翻倍、xhigh 模式四分钟出图这些细节,比官方通稿有用十倍,做选型的人该看这篇而不是 OpenAI 博客。

4月23日周四
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)63

    如何使用Codex进行日常工作

    该内容探索了10个实用的ChatGPT Codex用例,旨在自动化任务、创建交付物,并将真实的输入转化为跨工具、文件和工作流的输出。

    推荐理由:虽然发布一月有余,但官方整理的十个 Codex 日常自动化用例依然是最佳上手模板,从邮件整理到数据报表,产品人和运营可以直接抄作业。

  2. Hugging Face:Blog(RSS)57

    如何在 Chrome 扩展中使用 Transformers.js

    本文介绍在 Chrome 扩展中集成 Transformers.js 库的具体方法,涵盖从环境配置、模型加载到前后端通信的关键步骤。通过示例代码演示了如何利用该库在扩展中实现本地机器学习推理,同时处理扩展权限限制与安全策略。文中还对比了 Web Worker 与 Service Worker 两种部署方案,并提供了性能优化建议,帮助开发者在浏览器扩展环境中高效运行 Transformer 模型。

    推荐理由:Hugging Face 官方出的 Transformers.js 浏览器插件教程,想在 Chrome 里跑端侧推理的前端开发者可以直接抄,省掉自己踩坑的时间。

  3. Cognition 模型 / Devin 博客(网页)63

    Cognition 复盘两年构建 Devin 云智能体基础设施的经验

    Cognition 基于两年 Devin 开发经验复盘构建云智能体的两大投入:基础设施与组织变革。文章指出容器共享内核存在逃逸风险、无法在异步间隙可靠保存状态,其方案是 microVM 隔离和 hypervisor 级整机状态快照;编排层花了超过三个季度才能管理数千并发 VM。

    推荐理由:Cognition 以两年 Devin 建设经验拆解云智能体在隔离、状态快照和编排上的真实投入,并给出组织落地的具体路径。

  4. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)72

    关于近期 Claude Code 质量报告的更新说明

    Anthropic 确认并解决了过去一个月影响 Claude Code、Claude Agent SDK 和 Claude Cowork 的三个问题,所有问题已于 4 月 20 日修复。具体包括:3月4日将 Claude Code 的默认推理强度从“高”改为“中”,导致用户感知智能下降,已于4月7日回滚;3月26日一项缓存优化存在缺陷,导致会话恢复后模型“健忘”和重复,4月10日修复;4月16日一项旨在减少冗余的系统提示指令意外损害了代码质量,4月20日撤销。这些问题影响了 Sonnet 4.6 和 Opus 4.6/4.7 模型,但 API 未受影响。公司已重置所有订阅用户的使用限额,并承诺改进流程以防止类似问题。

    推荐理由:Anthropic 把 Claude Code 连续一个月质量下滑的三个 bug 全部摊开讲,这种级别的工程复盘在大模型公司里极少见。做 Agent 产品的人该认真读,因为这三个坑你迟早也会踩。

4月22日周三
  1. PromptArmor:Threat Intelligence73

    PromptArmor 发布 Cursor 安全实践指南,披露未修复的 MCP Apps RCE 漏洞

    PromptArmor 发布 Cursor 安全实践者指南,梳理其威胁模型:不可信输入(代码、工单、网页、MCP 输出)与可信操作(shell 执行、文件写入、Git、MCP 工具调用)之间的间接提示词注入风险,并针对 Auto-Run、插件供应链、Bugbot、Automations、沙箱和子处理器给出管理端配置建议。

    推荐理由:作者基于自身披露经历梳理 Cursor 的威胁模型,并给出可落地的管理端配置与治理思路,还附上尚未修复的 MCP Apps RCE 细节。

  2. Augment Code 博客(网页)77

    Augment Code 实测什么样的 AGENTS.md 才对编码 Agent 有效

    Augment Code 从自家 monorepo 抽取数十个 AGENTS.md 文件,用内部评测 AuggieBench 对比有无该文件时 Agent 完成任务的表现,发现最好的文件带来相当于从 Haiku 升级到 Opus 的质量提升,最差的输出比没有文件还糟,同一文件在不同任务上可相差 30%。

    推荐理由:Augment Code 用内部评测量化了不同 AGENTS.md 写法对代码生成质量的影响,给出的模式与失败案例可以直接迁移到自己的代码库。

  3. Cognition 模型 / Devin 博客(网页)72

    Cognition 复盘多智能体实践:写操作单线程加辅助智能体才真正有效

    Cognition 发布长文复盘,称自《Don't Build Multi-Agents》十个月后,其多智能体系统已在生产中可用,核心模式是写操作保持单线程、其他智能体只贡献智能。

    推荐理由:作者基于自家生产环境实验总结多智能体落地模式,给出干净上下文评审、跨模型路由等可迁移的工程经验。

  4. LlamaIndex:产品、工程与评测62

    LlamaIndex 深入解析 LiteParse 将 PDF 转为文本的网格投影算法

    LlamaIndex 详解其开源 PDF 解析工具 LiteParse 的网格投影算法核心原理。PDF 只存储文本内容和绘制坐标而无阅读顺序,算法通过提取左、右。

    推荐理由:LiteParse 官方拆解其网格投影算法的设计取舍与实现细节,读者可以了解 PDF 文本提取如何用对齐锚点保留表格和多栏结构。

4月21日周二
  1. Gary Marcus:The Road to AI We Can Trust(RSS)60

    请不要相信你的聊天机器人提供的医疗建议

    四项独立研究一致表明,不应信任聊天机器人提供的医疗建议。这些研究均指向同一结论,显示AI对话系统在医疗咨询场景中存在显著的可靠性缺陷与安全隐患,可能给出不准确甚至危险的健康指导。专家强烈警告用户避免依赖ChatGPT等工具进行疾病诊断或用药决策,强调寻求专业医疗人员帮助的必要性。

    推荐理由:Gary Marcus 用四篇新研究再加个人悲剧,把“别用聊天机器人看病”这件事讲成了必须认真对待的警告。数据扎实,故事揪心,值得每一个随手问 AI 的普通人读一下。

  2. Cursor Blog55

    保持 Cursor 应用稳定

    Cursor 团队针对用户全天依赖应用、崩溃影响严重的问题,聚焦内存不足导致的崩溃。通过为多进程架构设计细粒度监控系统,实时追踪版本发布后的崩溃指标。采用双重调试策略:自上而下关联功能与崩溃数据,监控大消息负载;自下而上通过崩溃观察服务、堆快照等定位根本原因。自2月底以来,全版本会话OOM率下降80%,自3月1日起请求OOM率下降73%。具体措施包括处理大文件加载和修复资源泄漏,以应对突发与渐进性内存耗尽。

    推荐理由:Cursor 把自家 OOM 问题的排查方法论完整公开了,自顶向下加自底向上的双线调试思路对做桌面端 Agent 产品的人有参考价值,但本质上是工程复盘而非行业事件。

  3. Nathan Lambert:Interconnects(RSS)60

    解读当前开放与封闭模型的性能差距

    文章剖析了决定开源与闭源AI模型单一评估数字的复杂因素,探讨了当前两者之间的性能鸿沟及其成因,同时预测了未来这一差距的演变趋势。分析指出,评估指标背后涉及数据质量、训练规模、架构优化等多重变量,而随着开源社区技术迭代和评估体系完善,开放模型与封闭模型的能力边界将持续动态变化。

    推荐理由:Nathan Lambert 把开源闭源差距从单一数字拉回到任务演化的动态里,做产品的人读完后会对那些追赶 benchmark 的宣传多一层怀疑,值得一读。

4月17日周五
  1. Linear:Now(RSS)61

    设计不是产出:AI 工具无法替代对问题的理解

    设计行业常将“设计”误解为产出界面或代码的行为,但真正的核心在于理解问题本身,找到形式与上下文的良好匹配。AI 工具能快速生成看似精美的输出,却往往绕开对底层问题的深入探索,导致产品表面光鲜但实际使用中脆弱、缺乏整合。设计仍需判断、对话、张力与时间,其价值在于通过动手工作逐步获得理解,而非仅仅依赖生成结果。

    推荐理由:这篇文章直指AI设计工具的误区,生成界面不等于做设计。真正难的是理解问题而不是产出视觉形式,做产品的都该读一读。

  2. Epoch AI:研究、数据与评测65

    Epoch AI 梳理 OpenAI Stargate 七个美国站点建设进展

    Epoch AI 梳理了 OpenAI Stargate 项目在美国的七个站点,均为 5000 亿美元基建计划的一部分,目前仅得州 Abilene 站点投入运营,当前容量约 0.3 GW,八栋建筑中约四栋已启用并搭载 Nvidia Blackwell 芯片。

    推荐理由:原文逐站点梳理了 Stargate 七个 US 选址的容量、工期和供电方案,读者可据此了解巨型 AI 数据中心建设的真实进展与约束。

4月16日周四
  1. Hugging Face:Blog(RSS)69

    使用 Sentence Transformers 训练与微调多模态嵌入及重排序模型

    Sentence Transformers 发布了用于训练和微调多模态嵌入与重排序模型的功能。新版本支持将文本、图像等不同模态的数据映射到统一的向量空间,并优化了跨模态检索的精度。关键改进包括对嵌入模型和重排序器进行联合或分阶段训练,显著提升了如图文检索等任务的性能指标。此次更新旨在通过开源工具推动多模态人工智能技术的普及与发展。

    推荐理由:这是训练多模态嵌入模型的全套指南,附带 VDR 微调实验和代码。如果你需要把文本和图像检索对齐到自己的业务数据上,这篇能省掉大量试错时间。

  2. Hugging Face:Blog(RSS)77

    The PR you would have opened yourself

    随着2026年AI代码代理的成熟,开源项目如transformers面临PR数量激增但质量下降的挑战。这些代理生成的代码常忽视项目的隐式设计契约,导致代码冗长、引入错误并增加维护者负担。为此,团队为mlx-lm开发了一个Skill工具,用于将模型从transformers高质量地移植到mlx-lm框架。该工具不仅生成接近人工提交的PR,还提供生成示例、数值对比和独立的测试工具链,以辅助贡献者和审查者。其目标是让模型在加入transformers后能快速在MLX上可用,同时维护代码的可读性与设计一致性。

    推荐理由:这篇不是普通的工具介绍,而是在 agent 时代探讨开源贡献的尺度——用 Skill 加速模型移植的同时,仍强调人的判断和责任,做维护的人该读一读。

  3. X:Thariq (@trq212)72

    使用 Claude Code:会话管理与百万级上下文窗口的策略

    Claude Code 的百万级上下文窗口在支持长任务的同时,也带来了“上下文腐化”的风险,即模型性能可能在处理约30-40万token后开始下降。因此,有效的会话管理至关重要。关键策略包括:开启新任务时建议新建会话;对于关联任务可酌情保留上下文以提升效率;善用 `/rewind` 回退功能而非直接纠正错误,是维护上下文清洁的核心习惯。用户在每个对话轮次后,应根据情况选择继续、回退、新建会话、压缩或使用子代理。

    推荐理由:Claude Code 1M 上下文听着爽,但 context rot 在 300k 就开始咬你了。这篇把 rewind、compact、subagent 三个操作的使用时机讲得极清楚,是目前最实用的 Claude Code 上下文管理指南,重度用户必读。

  4. Dwarkesh Patel:Podcast & Blog(RSS)79

    黄仁勋谈 TPU 竞争、对华芯片销售与 Nvidia 的供应链护城河

    黄仁勋表示,Nvidia 已具备支撑未来数年万亿美元级业务规模的供应链体系。这一表态印证了公司在 AI 芯片领域的供应链护城河优势,回应了市场对其产能扩张能力的关切。访谈同时涉及应对 Google TPU 竞争及向中国出售芯片的策略考量,凸显 Nvidia 在复杂市场环境下的长期布局信心。

    推荐理由:Jensen首次承认没投Anthropic是错判,对华芯片禁运的态度也极其强硬,这期访谈是他近半年最坦诚的战略交底,做硬件和做政策的都该听一遍。

4月15日周三
  1. Modal 官方工程博客(RSS)64

    Modal 发布教程:基于 OpenAI Agents SDK 从零构建可并行的编码智能体框架

    Modal 发布工程教程,演示如何基于 OpenAI 新推出的 Agents SDK 从零构建自定义编码智能体框架,并通过沙箱扩展把 Modal Sandboxes(含 GPU)接入为智能体的运行环境。

    推荐理由:教程逐步演示如何用 OpenAI Agents SDK 加 Modal 沙箱自建可并行、可快照的编码智能体框架,方法可直接迁移。

4月14日周二
  1. Cursor Blog62

    多智能体系统将GPU内核性能提升38%

    我们与NVIDIA合作,利用自主运行的多智能体系统,在为期三周内对235个真实CUDA内核进行了优化。该系统从零开始构建并优化Blackwell GPU内核直至汇编级别,实现了38%的几何平均速度提升,其中63%的问题超越基线,19%实现超2倍优化。这些内核直接影响AI训练与推理效率,传统上需资深工程师耗时数月乃至数年的优化工作,该系统在数周内即自主完成,并能探索更广阔解决方案空间,突破了人工逐项优化的限制。

    推荐理由:Cursor 把自家多 Agent 系统拉去优化 CUDA 内核,38% 的 geomean 提速不算炸裂,但真正值得看的是它证明了 Agent 可以在无人干预下跑三周啃硬骨头,这对做 Agent 产品的人是个强信号。

  2. The Decoder:AI News(RSS)70

    Stanford 2026 年 AI 指数报告显示技术快速进步、安全担忧加剧且公众信任下降

    Stanford HAI 发布的 2026 年 AI 指数报告显示,AI 模型性能实现重大飞跃,中美技术差距显著缩小,但安全问题和公众信任危机同步加剧。报告指出,尽管 AI 能力快速提升,行业面临的安全隐忧日益严峻,公众对技术的信任度持续下滑。

    推荐理由:Stanford 年度报告把 AI 的矛盾赤裸裸摆上台面,模型啃得动博士考题却看不懂钟,编程效率暴涨却让年轻开发者就业萎缩,信任度滑向谷底,这是行业必须正视的撕裂感。

  3. HuggingFace Daily Papers(社区热门论文)76

    AI Index Report 2026 发布

    第九版 AI 指数报告新增多项追踪维度:AI 在推理、安全及真实任务执行上的测试范围扩大,但测量手段的可靠性正在下降;首次提供生成式 AI 的经济价值估计及其劳动力市场影响的初步证据;提出 AI 主权分析框架;与 Schmidt Sciences 合作新增科学章节,并首次设立 AI 在科学与医学中的独立章节,反映 AI 在这两个领域日益增长的影响力。

    推荐理由:斯坦福这份年度报告是 AI 行业最全面的体检单,今年首次把科学和医学独立成章,说明 AI 正从实验性工具变成基础设施,治理和评估跟不上进度的矛盾贯穿始终。

4月13日周一
  1. Tomer Tunguz 博客(VC 分析)61

    AI稀缺时代的开端

    AI算力稀缺时代正式开启。Nvidia Blackwell芯片GPU租赁价格涨至每小时4.08美元,两月内涨幅达48%;云服务商CoreWeave涨价20%并将最低合同期从一年延长至三年。Anthropic已将最新模型限制给约40个组织使用,OpenAI因算力不足被迫放弃部分项目。这标志着AI充足时代结束,"价高者得"、关系型销售、被迫多元化成为行业新常态,初创公司面临更严峻挑战。

    推荐理由:Tunguz 把 AI 算力短缺的五个特征讲得很透,关系销售与价格通胀对创业者是核心挑战,虽然文章有点旧,但判断框架仍然有效。

4月10日周五
  1. Epoch AI:研究、数据与评测66

    Epoch AI 分析伊朗战争对AI的影响:芯片产能影响有限,海湾投资或受冲击

    Epoch AI 的 Josh You 分析伊朗战争与霍尔木兹海峡封锁对AI产业的影响。海峡中断了约10%的全球石油和20%的LNG供应,欧洲与亚洲天然气价格涨幅约70%,但TSMC等芯片厂能源成本占收入比例很低,可承受电价大幅上涨,AI芯片生产不太可能受扰。

    推荐理由:作者以计算供应链为主线,逐项评估能源、氦气与海湾资本对AI的实际冲击程度,结论克制且有依据。

  2. Nathan Lambert:Interconnects(RSS)60

    Claude 神话与对开放权重的误导性恐慌

    针对开放权重模型的恐慌情绪缺乏事实依据,围绕 Claude 等模型的安全争议存在明显的神话化倾向。作者批评这种对开源 AI 的恐惧散布是误导性的,认为所谓开放权重威胁论如同"又一场围绕开源的舞蹈",呼吁业界理性看待开源模型的安全性与价值,避免被无根据的安全恐慌所左右。

    推荐理由:Nathan Lambert 对 Claude Mythos 引发的反开放权重恐慌提出关键反驳,认为问题被简化为全面禁令,忽略时间滞后本身就是安全阀,观点冷静且值得政策讨论者细读。

  3. Claude:Blog(网页)67

    针对AI加速攻击的安全准备建议

    Anthropic发布Project Glasswing项目,利用Claude Mythos Preview模型进行网络防御。文章指出,未来24个月内AI将发现大量长期潜伏的漏洞并快速转化为攻击,公开可用的次级模型已能发现传统审查遗漏的严重漏洞。建议立即修补CISA KEV目录漏洞,使用EPSS评分系统优先处理风险,互联网暴露系统需在24小时内完成补丁更新。预计未来两年漏洞报告量将增加一个数量级,安全团队需建立自动化修补流程以应对AI加速的攻击态势。

    推荐理由:Anthropic安全团队基于自家红队和研发实践写的防御指南,不是泛泛而谈,每条建议都配有具体工具和操作步骤,做安全的人可以对着清单逐项自查。

4月8日周三
  1. Cognition 模型 / Devin 博客(网页)63

    Cognition 拆解 Devin 如何在财富 500 强企业现代化 COBOL

    Cognition 发文介绍过去八个月多家财富 500 强公司在 COBOL 项目中使用 Devin,包括用 DeepWiki 文档化数百万行代码、将 25000 行海关工作流迁移到 AWS Lambda(估算节省 73% 迁移成本),以及 Itaú Unibanco 跨数百个程序、20 种字段变体的税号重构,提前三个月完成且零生产错误。

    推荐理由:原文梳理了 COBOL 难倒智能体的三个原因和可落地的两类场景,并给出迁移成本下降等具体案例,方法可参考。

  2. LlamaIndex:产品、工程与评测68

    LlamaParse 复盘 VLM OCR 生产环境中的两类失败模式与修复方案

    LlamaIndex 复盘 LlamaParse 的两类生产故障:LLM 重复循环导致 token 消耗和延迟暴增、资源耗尽,以及 recitation 内容过滤把合法文档抽取误判为版权违规而强行截断输出。

    推荐理由:当事方复盘两类真实生产事故的根因、各厂商 API 表现差异与具体缓解手段,方法可直接迁移到其他 agentic 文档处理系统。

  3. Berkeley RDI:Blog(AI 安全与评测)87

    我们如何攻破顶级AI Agent基准测试及未来展望

    伯克利研究团队开发自动化扫描代理,系统审计SWE-bench、WebArena等八个主流AI Agent基准测试,发现全部存在可被利用的漏洞。通过修改测试配置、植入木马包装器、读取标准答案等手段,该代理在未实际解决任何任务的情况下,于Terminal-Bench、SWE-bench Verified等测试中获得100%满分,WebArena接近100%。研究揭示了当前AI基准测试评分机制存在系统性安全缺陷,高分不等于真实能力。

    推荐理由:伯克利团队从内部挨个拆解了八大主流基准,发现全都能被零能力 agent 打满分。这不只是打脸,他们给出了一份评估构建清单,以后做基准的人必须过了这一关才算及格。

4月7日周二
  1. Epoch AI:研究、数据与评测63

    Epoch AI 分析:算力贫乏的 AI 实验室能否靠效率追赶 GPT 前沿

    Epoch AI 分析指出,Anthropic 去年在算力上的支出超过 Minimax 与智谱 AI 之和的十倍,OpenAI 的差距更大,中国与开源模型公司因此处于"算力贫乏"状态。文章梳理了三条提升算力效率的路径:更快研发新算法、复现前沿实验室的创新、利用对手模型生成合成数据训练,其中只有第一条有望实现反超。

    推荐理由:原文逐项检验算法创新、模仿与蒸馏三条效率路径能否弥补十倍算力差距,并给出中美与开源模型格局的分层判断。

4月3日周五
  1. X:karminski (@karminski3)72

    Gemma4有8个模型, 选哪个? 一文看懂!

    Google发布的Gemma4系列开放权重模型包含多个版本,选型需结合场景。带“-it”后缀为指令微调版,开箱即用;不带后缀为基座模型,供自行微调。其中,A4B指激活参数量为4B,E4B则采用逐层嵌入技术,以内存换取计算量,优化移动端性能。选型建议:综合性能与速度选26B-A4B;追求最佳代码或任务效果选31B;开发本地全模态应用选E4B;资源受限设备体验可选E2B,但输出质量有限。

    推荐理由:Gemma 4 一口气出了 8 个变体,本地部署的人最怕选错模型白折腾,这篇把选型逻辑拆得明明白白,从龙虾助手到树莓派都有对应方案,抄作业就行。

3月31日周二
  1. Trail of Bits:AI安全研究72

    Trail of Bits 如何让公司走向 AI 原生:从 5% 接受到 94 个插件、201 个技能

    Trail of Bits 分享其一年内将 AI 采用率从约 5% 推到全公司落地的系统方法,目前已有 94 个插件、201 个技能、84 个专用智能体,部分审计项目每周发现的漏洞从约 15 个增至 200 个,约 20% 的客户报告漏洞最初由 AI 发现。

    推荐理由:Trail of Bits 以亲历者身份复盘内部 AI 化的完整系统,给出心理障碍分析和可复制的组织方法,适合参考落地路径。

3月26日周四
  1. Cursor Blog69

    通过实时强化学习改进Composer编码模型

    Cursor团队将实时强化学习技术应用于Composer编码模型,利用真实用户交互产生的推理令牌作为训练信号,以解决模拟环境与真实使用间的匹配问题。该技术使团队能够以每五小时一次的频率部署改进后的模型检查点。通过A/B测试,新版本实现了关键指标提升:代理编辑在代码库中的持久性增加2.28%,用户不满意后续减少3.13%,延迟降低10.3%。实时RL也带来了奖励黑客等新挑战,但真实用户反馈有助于识别和修正此类问题。

    推荐理由:Cursor 把真实用户交互当训练信号,每五小时迭代一次 Composer,这不是论文是工程日志。做 coding agent 的团队该看看他们怎么处理 reward hacking 的两个真实案例,比任何 benchmark 论文都实在。

3月24日周二
  1. Epoch AI:研究、数据与评测64

    Epoch AI 分析前沿 AI 实验室招聘信息透露的战略布局

    Epoch AI 分析了 OpenAI、Anthropic、xAI 和 Google DeepMind 的在招岗位,数据采集于 2026 年 3 月初。

    推荐理由:作者以公开发布的招聘岗位为公开窗口,分析了头部实验室在销售部署、硬件产品和算力数据策略上的分化。