Meta 发布 Muse Spark 1.1 模型
来自 @finkd 的消息 — Muse Spark 1.1 已上线。
推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
来自 @finkd 的消息 — Muse Spark 1.1 已上线。
推荐理由:Muse Spark 1.1 主打 agent 和 coding 能力,同时压到极低价,这可能是 Meta 低价模型策略的正式开场。虽然这次没给具体数据,但后续模型、API 的布局值得关注。
社区开发者基于MiniCPM5-1B和MiniCPM-V 4.6构建了本地优先的数学智能体TeXada。该Agent支持自然语言直接转LaTeX、手写/图像公式OCR转可编辑LaTeX、LaTeX补全与错误修复等核心功能。所有推理在本地完成,无需依赖云服务,保障隐私安全,适用于学生、研究人员和开发者随时随地处理数学表达式。已开源至GitHub,并提供HuggingFace模型下载。
推荐理由:社区开发者用 MiniCPM 轻量模型做的本地数学助手,LaTeX 输入变得像聊天一样自然,是个小而美的端侧实用案例。
今天我们发布 Muse Spark 1.1——一款价格极低、能力强大的智能体与编程模型。它已通过我们新的 Meta Model API 上线,并集成于 Meta AI 中。
推荐理由:低价位 agentic coding 模型即日可用,可能使原先因成本顾虑而推迟的智能体原型更早启动。
Anthropic 为 Claude 推出一项反思功能(Beta),帮助用户追踪使用模式。用户可回顾过去 1、3、6 或 12 个月的活动总结,涵盖关键主题、使用频率和任务类型。功能结合 4D AI Fluency Framework(委托、描述、辨别、勤勉)提供协作分析,支持设定静音时段或定时休息提醒。隐私方面,不涉及无痕对话和健康集成工具,也不提取连接工具中的底层文件。该功能面向 Free、Pro 和 Max 用户,需开启记忆功能,可通过 Claude 网页或桌面应用设置。
推荐理由:这是大模型公司第一次认真讨论‘人机边界’,上线了帮你看清自己怎么用 Claude 的反思仪表盘,我觉得做产品的可以思考一下这个设计思路。
法国竞争管理局确认,对英伟达的反垄断调查已近尾声,即将发布正式异议声明。调查聚焦两大问题:市场对CUDA平台的严重依赖,以及英伟达对CoreWeave等AI云计算公司的投资。英伟达占全球AI加速器超70%份额。若认定滥用市场支配地位,最高可处全球年营业额10%罚款。法国是首个准备正式指控英伟达的监管机构。
推荐理由:法国快成为全球首个正式指控英伟达反垄断的监管机构,争议在CUDA生态紧耦合与芯片投资,这个案子能不能动摇AI芯片供应链,是所有人都该关心的节点信号。
美团万亿参数大模型 LongCat-2.0 正式开源,总参数 1.6T,平均激活约 48B,为真实 Agentic Coding 任务而生,并作为业界首个在五万卡国产算力集群上完成推理的万亿参数模型。
推荐理由:LongCat-2.0 把针对国产卡的模型、芯片适配与部署优化作为完整开源栈发布,为存量算力部署万亿模型提供了可复现的协同方案。
NVIDIA 发布 Nemotron-3-Super 的压缩变体 Nemotron-Labs-3-Puzzle-75B-A9B,总参数从 120.7B 降至 75.3B,活跃参数从 12.8B 降至 9.3B,保持 88 块混合布局(40 Mamba、40 MoE、8 注意力)。在 8×B200 节点上,8K/64K 场景匹配用户吞吐量≥100 tok/s 时,服务器吞吐量提升 2.03 倍。单 H100 上 1M-token 并发从 1 增至 8,权重占用从 70 GB 降至 44.5 GB。迭代式 Puzzle 方法平均得分比单步高 0.57。代价:Arena-Hard-V2 降 4.2 分、SWE-Bench 降 2.6 分。Hugging Face 提供 BF16、FP8、NVFP4 检查点。
推荐理由:把120B MoE压到75B后,同节点服务吞吐几乎翻倍,单张H100百万token并发从1涨到8。对长上下文RAG和AI编码助手这类对吞吐敏感的产品来说,这不是论文调优,是实打实的降本方案。
蚂蚁灵波开源新一代实时交互世界模型 LingBot-World 2.0(14B 参数),支持施法、攻击、跳跃等丰富角色动作及文本驱动事件(如切换场景、召唤风暴),内置 Pilot Agent 与 Director Agent 实现世界持续演化,并支持多人同时交互。模型采用因果预训练范式和混合双向自回归注意力掩码(MoBA),可稳定输出 720p/60fps 实时画面,长达一小时测试画质不衰减。通过一致性蒸馏与 DMD 降低采样成本,结合注意力 kernel 优化、混合并行推理、动态 KV 缓存调度和异步流媒体传输实现低延迟交互。模型权重及推理代码以非商用协议开源,SGLang 已适配,并提供 Reactor PC 端和灵光 APP 在线体验。
推荐理由:蚂蚁灵波这个开源世界模型把实时世界生成推到了小时级还不崩,720p/60fps实时交互,做开放世界游戏或自动驾驶仿真的团队值得上手测。
蚂蚁灵波科技正式开源LingBot-Video,这是全球首个基于MoE架构、面向具身智能的视频生成基础模型。总参数30B,推理时仅激活约3B,效率较同规模Dense架构提升约3倍。模型引入7万小时VLA、VLN、Ego等机器人数据,并通过多维强化学习奖励系统对齐物理合理性与任务完成度。在RBench上总分0.620,超越Wan2.6等模型;在Physics-IQ Verified评测中排名第一。可用于机器人动作预测、仿真数据生成等方向。
推荐理由:蚂蚁灵波开源了首个面向具身智能的视频基模,用MoE控制推理成本,对机器人仿真和世界模型研究是个真工具,做具身的可以跑起来了。
Robbyant 推出 LingBot-VLA 2.0,一个 6B 参数的开源视觉-语言-动作(VLA)基础模型。它以 Qwen3-VL-4B-Instruct 为骨干,采用 MoE 动作专家架构,通过 55 维规范向量统一表示不同机器人的状态和动作。训练数据涵盖约 60,000 小时高质量数据(50,000 小时机器人轨迹 + 10,000 小时第一人称人类视频),覆盖 20 种机器人配置。在 GM-100 双机械臂基准测试中,模型在多个平台上超越 π0.5 和之前版本。模型权重、代码和技术报告已以 Apache-2.0 许可开源。
推荐理由:蚂蚁Robbyant放出的开源VLA 2.0把通用机器人策略往前推了一步,60,000小时跨具身数据、统一动作空间和MoE设计对做机器人的团队是实打实的参考,不是又一个lab-only的demo。
一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。
推荐理由:Tunguz 把代理的记忆问题拆成预检+看门狗,不是大模型调参,而是软件架构层的优化,做 agent 的开发者可以直接偷师。
Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后“遗忘”技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。
推荐理由:这是Anthropic在模型安全对齐上的一个新尝试,提出可拆卸模块来精细控制有毒知识,同时保留一般性能。方法还未上Claude,但实验结果表明这条路可能比简单的拒绝训练更鲁棒。
Anthropic今年第三季度利润预计超10亿美元,已于6月1日秘密提交IPO申请,若成功将成为规模最大AI实验室IPO。其与OpenAI的年度经常性收入合计接近1000亿美元。凭借Claude Code在软件开发领域的快速普及,Anthropic在2026年实现AI模型盈利变现,成为B2B市场领跑者。SemiAnalysis报告认为其商业模式优越,若持续良好执行,市值可能触及6万亿美元。
推荐理由:Anthropic抢先提交IPO,利润超10亿美元,在OpenAI推迟上市的档口,这一步会让整个AI赛道的资本竞赛明显提速,投资人该坐不住了。
Seedream 5.0 Pro 现已登陆 Runway。可通过提示词或参考图生成高细节图像,图像内文字清晰可读,支持多达14种语言。立即点击下方链接尝试。
推荐理由:Seedream 5.0 Pro 的集成让 Runway 的图像生成多了一个强力选择,14 种语言的可读文字生成是实用亮点,做多语言海报的设计师可以试试。
OpenAI近日公布国家安全原则,阐明在政府及国家安全领域部署前沿AI系统的方针。原则强调在保护公民、防御关键基础设施、提供公共服务及应对新兴威胁(网络防御和生物安全)中发挥AI优势,同时确保民主问责、人类判断和法治。过去一个月,OpenAI通过Daybreak网络防御计划与澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰及欧盟ENISA等机构建立网络安全信任访问合作,并与英国政府开展网络安全测试评估。上月,OpenAI向部分美国政府及盟友合作伙伴开放GPT‑Rosalind模型用于公共卫生和生物防御。原则适用于现有及未来合作,包括与Department of War的协议,明确禁止大规模国内监控、自主武器系统及高风险自动化决策。OpenAI支持立法对高风险军事用途(如国内监控、自主武器)建立保障措施。
推荐理由:OpenAI 首次公开发布国家安全合作原则,同时宣布与多国建立网络和生物防御伙伴关系。我觉得这是头部 AI 公司在军事合作上的一次主动透明化尝试,值得看看他们如何设限。
一男子使用Grok生成7000张继女儿童性虐待材料(CSAM)后自杀。更多年轻女孩起诉X平台,指控其涉及Grok生成CSAM,并包庇儿童性犯罪者。
推荐理由:这起诉讼把 Grok 的内容审核问题直接推到了刑事犯罪层面,普通人看到的是猎奇,从业者该读的是'生成式 AI 的滥用边界到底怎么管',这个判例可能影响未来所有模型的安全设计。
OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。
推荐理由:OpenAI 自己审计了 SWE-Bench Pro,发现三成任务有缺陷,这个基准给出来的分数可能要打问号,做模型评测和选型的人该认真看看。
xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。
推荐理由:Grok 4.5 在编码任务上追平第一梯队,但真正的杀手锏是极致性价比——输出成本只有对手的四分之一,还会倒逼编码模型继续降价。
Claude Code 的 model 和 effort 两种设置都旨在提升输出,但机制不同。model 越大,模型能力越强(基于行业标准基准测试)。effort 控制 Claude 在请求上的总工作量,包括思考时间、读取文件数、验证程度、多步任务推进深度等。高 effort 时 Claude 会执行更多操作(读文件、跑测试、再检查);低 effort 时更倾向询问上下文。模型选择本质是切换不同的冻结权重集——权重在训练时固定,prompt 和上下文只能引导(steering)而不能改变权重。模型幻觉是权重产生看似合理但错误的 token 序列。
推荐理由:Claude Code 官方这篇把 model 和 effort 的取舍讲得比他处都透,读完就知道什么任务该堆算力、什么任务该降模型省钱。
OpenAI 今日推出 GPT‑Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT‑5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT‑Live‑1 和 GPT‑Live‑1 mini 两个版本。人类评估显示,在 5‑10 分钟对话中,GPT‑Live‑1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ³‑Voice Telecom 基准测试中也表现更强。未来将开放 API。
推荐理由:GPT‑Live 不是简单的语音版本升级,全双工架构让 AI 终于能同时听和说,加上后台调用 GPT‑5.5,对话体验跨了一大步,做语音应用的产品人该重新思考交互流程了。
Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torch.compile。用户仅需添加 `--model-impl transformers` 标志。目前不支持线性注意力模型但即将支持。
推荐理由:用 transformers 写的模型,现在不用改一行代码就能在 vLLM 里跑到手写实现的水平,模型作者最大的集成痛被抹平了。虽然主要是工程黑魔法,但生态意义不小。
使用来自 @SpaceXAI 的 Grok 4.5,一旦它上线,无需更改代码。 ~x-ai/grok-latest 始终路由到最新的 Grok。现在指向它(今天为 Grok 4.3),当 4.5 发布时它会自动升级到 4.5。 尝试:https://openrouter.ai/~x-ai/grok-latest
推荐理由:OpenRouter 的 grok-latest 别名让开发者零代码升级到 Grok 4.5,虽然是个小功能,但省掉了版本切换的繁琐,用 Grok 做产品的团队现在就该把端点切过去。
本周新功能 🚀 Replit 社区档案——vibe coders 的工作证明。 你的档案,你的展示。获取你的智能体使用和检查点的活跃度图表,外加面向专业用户的 Replit 力量排名。 登录,认领你的档案,挑选你最棒的项目,与朋友分享你的数据。 立即查看 → http://replit.com/community
推荐理由:Replit 给 vibe coders 加上了个人主页和工作证明,用活动图和排名展示 agent 使用,让 AI 编程社区有了社交层,但实质还是功能小更新,对非重度用户意义有限。
新功能:聊天室一键ZDR(零数据保留) 在完全隐私保护下横向对比模型:https://openrouter.ai/chat
推荐理由:OpenRouter 聊天室新加了一键 ZDR,对比模型时请求数据不存储,注重隐私的开发者会开心,但毕竟只是个开关,算不上大新闻。
字节跳动正式发布多模态图像创作模型 Seedream 5.0 Pro。该版本在图文匹配、结构合理性及文字渲染上全面提升,核心突破包括:支持高密度数据与概念的专业排版可视化;基于空间位置理解的交互式精准编辑(如点选、图层分离、多图融合);还原真实光影与人像质感;以及原生支持十余种语言的输入与本地化特征生成。目前已在火山方舟、豆包及即梦上线体验。
推荐理由:展示了 AI 图像生成从“好看”向“可用”的进阶,特别是其解决复杂信息图表生成和像素级局部编辑的能力,对专业设计工作流有显著价值。
加拿大不列颠哥伦比亚省7月7日宣布将起诉OpenAI,指控其未向执法部门上报一名ChatGPT用户2025年6月封禁前的暴力相关对话内容。该用户随后于今年2月在塔布勒岭制造校园枪击案,杀害8人。OpenAI CEO萨姆·奥尔特曼今年4月为此公开致歉,承认本应上报但未执行。受害家属已在加州法院提起诉讼,省政府正协调独立诉讼,要求赔偿用于社区重建。
推荐理由:这是AI公司因用户对话内容失察而被政府追责的里程碑案例,胜诉将推动平台安全上报义务的重新定义,对全行业治理影响深远。
Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。未认证攻击者仅需在属于同一组织的公共仓库中创建一个嵌有恶意指令的 Issue,即可诱使基于 Claude 或 GitHub Copilot 的 AI 代理读取并公开该组织内私有仓库的内容。攻击无需编码技能或凭证,根源在于代理将用户可控内容视为可信指令,且 GitHub 的防护措施因 "Additionally" 关键词被绕过。Noma Labs 已公开 PoC 并建议限制跨仓库权限、隔离用户输入。
推荐理由:GitLost 是第一个有完整复现的 GitHub AI 代理泄露私有仓库漏洞,展示了 AI 代理的上下文窗口即攻击面,做 AI 应用或 CI/CD 的人都该看一下。
OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百万输入/输出token,Anthropic的Fable 5为$10/$50。
推荐理由:被美国政府按了暂停键的 GPT-5.6 终于要公开了,基准测试小胜 Claude Mythos 5 且 token 消耗仅三分之一,价格也比 Anthropic 便宜近半,开发者可以准备预算了。
提示注入已成为AI安全的首要威胁——大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。
推荐理由:这项研究首次揭示了利用 LLM 幻觉进行大规模 botnet 攻击的可行路径,影响范围覆盖几乎所有主流 AI 编程助手,每个依赖这些工具的开发者都该看一眼。
zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。
推荐理由:zkSecurity用AI扫了Cloudflare的密码学库,挖出7个真实漏洞,从浮点数精度损失到访问控制完全破防。这是AI在密码学审计里第一次证明自己能找到能用的漏洞,不是纸上谈兵。虽然后面发现AI对严重性的判断还很瞎,但整体值得安全从业者一读。
GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。
推荐理由:OpenAI的新模型Sol周四上线,虽然信息不多,但任何来自他们的模型更新都值得所有做AI产品的人盯紧机会。
蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。
推荐理由:在视觉基础模型里把边界当作核心信号,这个思路很反常识,1B模型在深度估计上超过7B的DINOv3,做机器人的可以认真看看。
Nemotron-Labs-Diffusion 是一种三模式语言模型,通过联合自回归(AR)和扩散损失训练,在单一架构中统一了 AR、扩散和自我推测解码。研究显示 AR 与扩散目标互补:扩散增强前瞻规划,AR 提供从左至右的语言先验。自我推测模式下,扩散充当草稿模型、AR 负责验证,其接受率和实际设备效率均优于多 token 预测(MTP)。在最优化采样器下,单次前向传播产出 token 数比自我推测最多高 76.5%。该系列包含 3B、8B、14B 参数的基础、指令和视觉语言模型,在准确率和速度上均超越现有开源 AR 和扩散 LM。例如 8B 模型单次前向解码 token 数是 Qwen3-8B 的 6 倍,在 GB200 GPU 上使用 SGLang 运行 SPEED-Bench 时吞吐量提升 4 倍。
推荐理由:NVIDIA 把自回归和扩散塞进同一个模型,吞吐量拉高 4 倍,做实时应用的团队可以开始换架构了。
AlayaWorld 是一个全栈开源框架,用于构建交互式生成世界。该框架支持开放式实时交互,用户可自由导航并执行战斗、施法、召唤怪物等多种动作。AlayaWorld 将数据准备、模型架构、训练、推理加速和部署统一在模块化可扩展的架构中,并发布了可复现流程、参考实现、评估工具和完整文档,为生成世界模型的未来研究与实时应用奠定基础。
推荐理由:AlayaWorld 把生成世界从 demo 变成了可交互的全栈开源框架,放出了完整 pipeline,对做游戏和具身智能的团队来说是一套可以立刻跑起来的工具链,值得落地尝试。
Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。
推荐理由:做网页清洗的同行该更新工具了,Pulpie 以二十分之一的成本追平 SOTA 质量,而且开箱即用,是今年数据管线里最值得换的组件之一。
蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从“更多Token”转向“更高Token密度”策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升显著,千亿参数模型在Agent任务中超越部分更大模型;小模型flash吞吐达2.4倍,五轮对话成本下降10倍以上。
推荐理由:蚂蚁百灵副总裁周俊这次分享,把大模型效率问题从零散优化推到了架构、训练、智能体协同设计的范式层面,7+1 混合注意力方案和 Kpop 算法对做模型的人是实质参考。
蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。
推荐理由:7:1 的混合注意力配比、将真实错误纳入训练以及区分工具调用与自然语言的奖励函数,为同时追求长上下文效率和智能体可靠性的工作提供了可参照的技术路线。
作者将斯坦福《人生设计课》理论体系制成Prompt,通过Claude逐步提问、追问和分析。Prompt融合设计思维、心流理论和积极心理学,分为看清现状、找到指南针、寻路、制定奥德赛计划四阶段,主线问题控制在6到9个。AI引导用户给健康、工作、娱乐、爱打分,区分重力问题与可设计的真问题,生成三个五年人生版本,最终输出8000至12000字的《个人人生设计蓝图》。作者实测效果超预期。
推荐理由:卡兹克把《人生设计课》的整套方法论炼成了一个追问型Prompt,它不替你规划人生,但能用一连串苏格拉底式逼问把你心里一直没厘清的线头拽出来。比心理咨询轻量,比鸡汤硬核,想用AI认真盘一盘自己方向的人值得花半小时玩一遍。
Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。
推荐理由:这篇论文用「让两个模型互搏」代替了只看最终答案的RL训练,直接解决了推理模型「写得多、想得少」的毛病。0.6B小模型用这方法能超过4B的GRPO模型,做推理训练的人应该认真读一读。
长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。
推荐理由:这篇论文用实验证明,给推理链加长度惩罚不只会缩短推理,还会优先删掉暴露模型真实决策过程的线索,让外部监控更难发现模型被误导的痕迹。做AI安全和对齐的人应该认真读一下。