跳到正文
北京时间

今天,值得关注的 AI

行业动态、实用产品与开源项目,一站看懂。

今日 AI 日报2026-09-29

Anthropic IPO 招股书曝光:2025 年净亏损 420 亿美元

约 10 分钟,读懂本期重点。

阅读日报

精选动态

全部资讯
今天9月29日周二
  1. Arena.ai77

    Arena 公布 GPT-6 Luna (Max) 在 Agent Arena 排名第 23,基于 8K 真实智能体会话,净提升 +1.6%,比 GPT-5.6 Luna (xHigh) 上升 6 位。

    引用OpenAI@OpenAI

    欢迎 GPT-6 Sol 和 GPT-6 Luna 加入 GPT-6 宇宙。 GPT-6 Sol 和 Luna 建立在 GPT-6 Astra 背后的技术进展之上,将其大部分优势带入更快、更实惠的模型,以支持大规模工作。 我们还提升了缓存和推理效率,并将节省下来的成本直接让利给你:与 GPT-5.6 促销价格相比,Sol 和 Luna 的 API 价格降低了 50%。

    推荐理由:Arena 用 8K 真实智能体会话数据给出 GPT-6 Luna (Max) 的排名与成本对比,读者可据此权衡其性价比定位。

  2. Artificial Analysis82

    Anthropic 发布 Claude Sonnet 5.5,在 Artificial Analysis Intelligence Index 得 56 分,仅比 Opus 5.5(max)低 2 分,max effort 下比 Sonnet 5 高 18 分。

    最新进展9月29日 03:25Claude Sonnet 5.5 达到 Artificial Analysis 智能指数第 2 名

    推荐理由:Artificial Analysis 用自家基准拆解了性能与 token 成本的权衡,为选型提供了可对比的量化参考。

  3. Anthropic:Newsroom(网页)91

    Anthropic 发布 Claude Opus 5.5,成本较 Opus 5 降低 40%

    Anthropic 发布 Claude 5.5 系列首个模型 Claude Opus 5.5,官方称多数工作表现与 Claude Fable 5.1 相当,运行成本较 Opus 5 降低 40%,输入和输出 token 定价为每百万 $4 和 $20,输出速度快 30% 以上。

    最新进展9月29日 01:01Claude Opus 5.5 在 Agent Arena 排名第2

    推荐理由:官方公告同时给出基准分数、完整定价表和防护措施细节,读者可以据此比较它相对 Opus 5 的成本与能力变化。

9月28日周一
  1. Hugging Face:Blog(RSS)71

    H Company 发布 Holo4 智能体模型系列,含 27B 与 35B-A3B 两个版本

    H Company 发布通用计算机使用智能体模型系列 Holo4,含 27B dense 和 35B-A3B MoE 两个尺寸,并基于 Nemotron 3 Nano Omni 推出 Holotron4 Nano。

    推荐理由:原文给出跨 GUI、代码、MCP 和 API 的统一智能体模型设计、基准分数和成本对比,并开源权重与轨迹数据,读者可评估其实际可用性。

9月24日周四
  1. Fireworks AI(网页)66

    Fireworks 发布 Ember-1,以约四成更少 token 达到 Kimi K3 质量

    Fireworks Research 发布基于 Kimi K3 训练的专用模型 Ember-1,通过学习精简不必要的推理,在保持质量的同时减少约 35-50% 的 reasoning token。

    推荐理由:官方给出了多组基准、A/B 测试和成本数据,读者可以据此评估用 Ember-1 替代 Kimi K3 降低推理 token 开销的可行性。

9月23日周三
  1. Google DeepMind:Blog(RSS)74

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS 语音生成模型

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示词从零设计声音、30 秒样本复刻声音,并提供逐行表演指导、长时音频生成和双说话人场景编排,覆盖 100 多种语言。

    推荐理由:官方介绍了两款 TTS 模型的能力细节、评测名次和开放入口,开发者可以据此评估语音生成工作流的选型。

  2. Qwen67

    Qwen 发布 Qwen-Audio-3.1,ASR、TTS 与 Realtime 全面升级,并新增音频创作模型 TTS-Next 和音频理解模型 ASR-Next,共五个模型覆盖理解、生成、交互与创作。全线降价,TTS 约 70% off、Realtime 约 85% off、ASR 最高 95% off;Realtime 可边说边听、随时打断,检测到低落情绪时会放慢语速并共情回应。

    推荐理由:官方一次性给出五个音频模型的能力细节和三档降价幅度,读者可对照自身场景评估替换成本。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,API 价格较 GPT-5.6 降 50%

    OpenAI 发布 GPT-6 Sol 和 GPT-6 Luna,将 GPT-6 Astra 的训练方法用于更快更便宜的模型,API 价格较 GPT-5.6 促销价下调 50%(Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50,每百万 token)。

    最新进展9月23日 03:51Arena 上线 GPT-6 Sol 与 GPT-6 Luna 测试,评分即将公布

    推荐理由:官方发布给出各档模型的具体基准分数、API 价格降幅和缓存改进数据,可以用来对比 GPT-6 家族在成本与能力之间的取舍。

  4. 公众号:蚂蚁百灵(Ling)67

    蚂蚁开源 Ming-Image-0.1-Design 系列:两个 6B 模型打通设计生成与图层编辑

    蚂蚁百灵开源 Ming-Image-0.1-Design 系列模型,包含两个 6B 模型:Design 从文字需求生成 UI、信息图、海报等完整设计,Layer 将设计图拆成 2 至 9 个可独立编辑的 RGBA 图层,并同步开源 Design Skill 和 PPT Skill。

    推荐理由:原文给出两个 6B 模型的能力划分、评测成绩和实际接入效果,读者可以据此评估设计生成加图层编辑链路的部署价值。

9月22日周二
  1. 腾讯混元:Research(API)60

    腾讯混元发布 Hy Image3.5 preview 图像生成模型

    腾讯混元发布 Hy Image3.5 preview,支持文生图与图生图、最多 5 张参考图、多轮编辑和最高 2K 分辨率输出,经上百名专业设计师 GSB 盲测对上一代胜率综合提升 30% 以上。

    推荐理由:原文给出了文本渲染、编辑一致性与定价等具体能力细节,以及多家腾讯内部产品的实测反馈,便于评估适用场景。

  2. Xiaomi MiMo73

    小米 MiMo 发布 MiMo-V2.6 Pro 与 Flash 两个全模态模型,通过规模化强化学习训练。Pro 在多数 Agent 基准上与 Claude Opus 5 和 GPT-5.6 Sol 表现相当,在 Artificial Analysis Intelligence Index 得分 46,为开源模型中最高;能力覆盖编码、computer use、3D 推理和创作。

    推荐理由:官方发布全模态模型并开放权重、技术报告和训练代码,附与 Claude Opus 5、GPT-5.6 Sol 的 Agent 基准对比数据。

9月21日周一
  1. xAI:News(网页)74

    xAI 发布 Grok 4.7,主打编码与知识工作

    xAI 发布 Grok 4.7,定位为其最强编码与知识工作模型,定价 $2/百万输入 token、$6/百万输出 token,与 Grok 4.6 同价同速,另有速度和价格加倍的快速变体。

    推荐理由:官方给出了完整定价、速度和多项基准对比,读者可以据此把 Grok 4.7 放进现有模型选型里横向比较。

9月20日周日
  1. Qwen:Blog Retrieval(API)72

    Qwen 开源 Qwen-Image-2.1:7B 统一生成与编辑并原生支持透明图像

    Qwen 团队开源 Qwen-Image-2.1,将文生图与图像编辑统一到一个模型中,视觉生成组件仅 7B 参数,并原生支持生成和编辑透明图像。模型支持最多 10 张参考图、圆形/涂鸦/独立蒙版指定局部编辑,通过混合粒度注意力架构和 KV cache 复用提升推理效率,同时改进文字渲染、人像光照与人物产品保真度,并覆盖全景图、信息图和分镜等任务。

    推荐理由:官方详解了 7B 统一图像模型的透明图像生成、10 图参考编辑与推理优化,读者可据此评估在设计等场景的可用性。

  2. 公众号:阶跃星辰(Step)66

    阶跃星辰发布旗舰模型 Step 5 Preview,10 月 15 日开源权重

    阶跃星辰发布旗舰基座模型 Step 5 Preview,采用稀疏 MoE 架构,总参数量 600B、激活 27B,支持 100 万 Token 上下文和文本与视觉输入,在 Artificial Analysis Intelligence Index 得 44 分,居全球开源模型前三,单任务成本为 Claude Opus 5 的 1/8。

    推荐理由:官方完整公布架构参数、基准成绩和权重开放时间,读者可据此评估其在开源主力模型中的成本能力位置。

9月18日周五
  1. Qwen:Blog Retrieval(API)69

    Qwen 发布 Qwen3.8-LiveTranslate 实时同传模型,LAAL 降至 2.3 秒

    Qwen 发布 Qwen3.8-LiveTranslate,采用 Interleave 架构与 Hybrid-MoE Thinker–Talker 设计重构实时同声传译,平均滞后(LAAL)从上一代的 2.8 秒降至 2.3 秒。

    推荐理由:官方给出了架构设计、LAAL 从 2.8 秒到 2.3 秒的数字和多语言评测结果,读者可以据此评估其实时翻译能力的实际变化。

  2. MarkTechPost(RSS)87

    DeepSeek AI 发布 DeepSeek-V4.1-Flash:1M 上下文、FP4 KV 缓存与跨层注意力复用

    DeepSeek AI 发布多模态 MoE 模型 DeepSeek-V4.1-Flash,552B 主干加 196B Engram 参数,上下文窗口 1M,prefill 激活 8B 参数、decode 激活 16B,全局 KV 缓存降至每 token 890 字节,约为 DeepSeek-V4-Flash 的 1/4、DeepSeek-V1 的 1/437。

    最新进展9月18日 11:10DeepSeek 发布 DeepSeek-V4.1-Flash:以 CSA2 与 FP4 KV 缓存压缩推进长上下文智能体部署效率

    推荐理由:文章拆解了 KV 缓存压缩和预精简架构的具体做法,读者可以对照其工程路径评估长上下文部署成本。

  3. Qwen:Blog Retrieval(API)78

    Qwen 发布原生全模态模型 Qwen3.8-Omni-Flash,主打音视频智能体任务交付

    Qwen 发布下一代原生全模态模型 Qwen3.8-Omni-Flash,支持文本、图像、音频和视频输入及 1M token 上下文窗口,29 项评测平均分较 Qwen3.5-Omni-Plus 提升超过 25%,音频输入每小时价格下降超过 98%,音视频输入每小时价格下降超过 93%。

    推荐理由:官方发布同时开放 API 和开源插件与运行时,读者可以据此评估音视频智能体在剪辑、会议、实时交互等工作流中的落地方式。

9月16日周三
  1. Google DeepMind:Blog(RSS)70

    Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking

    Google DeepMind 发布 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking 两个近实时语音对话模型,主打语音智能体和复杂任务执行。

    推荐理由:原文给出两个语音对话模型的定位分工和多项基准数字,读者可以据此评估其推理、成本与工具调用能力。

9月15日周二
  1. 公众号:生数科技(Vidu·视频)67

    生数科技发布 Vidu S2:含 Avatar 与 Editing 双模型,探索空间视频

    生数科技正式发布 Vidu S2,包含面向数字角色实时交互的 Vidu S2-Avatar 和面向视频流实时编辑的 Vidu S2-Editing,并探索面向 VR 头显的实时空间视频生成与编辑。

    推荐理由:官方发布 Vidu S2 双模型,给出实时交互、编辑与空间视频的技术路线和评测数字,读者可对照判断其流式生成思路。