跳到正文
北京时间

全部动态

今日 40 条
6月4日周四
  1. X:Demis Hassabis (@demishassabis)74

    Gemma 4 12B 发布:150M+ 下载量里程碑,16GB VRAM 本地运行

    Demis Hassabis 宣布 Gemma 4 系列下载量突破 1.5 亿,并正式发布新版 Gemma 4 12B 模型。该模型是一个统一的、无编码器的多模态模型,兼具边缘端效率与高级推理能力。尽管参数规模仅为 12B,但性能强劲,且足够小巧,可在仅需 16GB VRAM 的笔记本上本地运行。采用 Apache 2.0 开源许可证,方便开发者自由构建。

    推荐理由:Gemma 4 12B 用 Apache 2.0 许可把多模态模型压进笔记本,16GB 显存就能跑,端侧智能的性价比又一次被 Google 拉高,做本地推理的可以马上试试。

  2. X:Krea AI (@krea_ai)74

    Ideogram v4.0 发布:2K 分辨率和 JSON 提示支持

    介绍 Ideogram v4.0。 原生 2K 分辨率,出色的文字渲染,支持 JSON 提示词。 立即在 Krea 中体验。

    推荐理由:图像生成模型的军备竞赛又添一员,Ideogram v4.0的2k原生分辨率和JSON prompt对接工作流,做设计生成的同学可以直接上手试试。

  3. Hacker News 热门(buzzing.cc 中文翻译)78

    Gemma 4 12B:一种统一的、无需编码器的多模态模型

    Gemma 4 12B 是 Google 发布的一款统一架构、无需独立视觉编码器的多模态大语言模型(LLM)。该模型直接处理图像与文本输入,无需传统视觉编码器,简化了多模态推理流程。基于 12B 参数规模,Gemma 4 12B 面向开发者工具生态开放。目前其具体 benchmark 分数、上下文窗口、价格及开源/API 可用性等细节尚未披露。

    推荐理由:我觉得Gemma 4 12B最大的变化不是参数大小,而是第一次在开源模型里把多模态直接交给LLM主干处理,没有单独的视觉编码器,这意味着本地多模态应用的延迟和内存占用都会大幅下降,对于在笔记本上做Agent的开发者,这是一个必试的版本。

  4. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月3日周三
  1. X:商汤 SenseTime (@SenseTime_AI)73

    商汤开源SenseNova U1:视觉理解推理生成一体模型

    商汤(SenseTime)开源SenseNova U1模型,宣称实现“看、思考、创作”一体——从一张普通运动鞋图片直接生成营销视觉效果。该模型代表了架构上的范式转变。用户可通过SenseNova Studio、HuggingFace和GitHub尝试使用。

    推荐理由:商汤把理解、推理、创作塞进一个模型,而且直接开源,做视觉营销的可以不用再拼凑工具链了。

  2. X:MiniMax (@MiniMax_AI)80

    MiniMax-M3 多模态模型发布,开源权重新SOTA

    MiniMax-M3 在 @ValsAI 排名中位列第六 新的开源权重 SOTA 🚀

    推荐理由:MiniMax 闷声干大事,第一个多模态模型就拿下 open-weight SOTA 和总榜第 6,做多模态应用的可以蹲一下权重。

  3. The Verge:AI(RSS)78

    微软首款高级推理AI模型MAI-Thinking-1发布

    微软在Build 2026上发布了其首款高级推理AI模型MAI-Thinking-1。该模型被定位为“中等规模”,能在“关键”软件工程基准测试中达到领先模型的水平。微软称其完全从头使用干净数据进行训练,未涉及从第三方模型进行知识蒸馏。这标志着微软在自研AI模型上迈出重要一步,此前其主要依赖OpenAI。近期两家公司已重新协商合作协议,关系有所松绑。

    推荐理由:微软自己从头训练的推理模型,不用任何第三方蒸馏数据,这可能是微软系 Agent 和 Copilot 底座更换的信号,值得盯着看。

  4. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Voice-2 语音合成模型,支持 15 种语言与零样本声音克隆

    Microsoft 发布文本转语音模型 MAI-Voice-2,官方称在保真度、语言覆盖、说话人一致性和情感范围上较前代显著提升,并列对比偏好测试中 72% 的场景优于 MAI-Voice-1。

    推荐理由:原文给出语言扩展、情感控制、零样本克隆与偏好测试数据,读者可以据此评估它在语音产品里的实际可用性。

  5. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

    推荐理由:统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。

6月2日周二
  1. Microsoft AI:官方博客(网页)63

    Microsoft 发布 MAI-Image-2.5,登 Arena 图像编辑榜第 2

    Microsoft Superintelligence 团队发布 MAI-Image-2.5 和 MAI-Image-2.5-Flash 两款图像模型,MAI-Image-2.5 在 Arena 图像编辑榜排第 2(超过 Nano Banana 2),文本生成图像排第 3,比 MAI-Image-2 总分提升 75 分。

    推荐理由:官方给出 Arena 排名、编辑能力细节和 Foundry 定价,开发者可据此评估其在生产图像工作流中的性价比。

  2. Hugging Face:Blog(RSS)73

    Holo3.1:快速本地计算机使用智能体

    Holo3.1 是基于 Qwen 模型家族的计算机使用智能体系列,旨在提升在桌面、网页和移动环境中的鲁棒性。新模型提供 0.8B、4B、9B 和 35B-A3B 四种尺寸,并首次发布量化检查点,包括 FP8、Q4 GGUF 和 NVFP4,以优化本地推理。在 AndroidWorld 基准测试中,35B-A3B 模型得分从 67% 提升至 79.3%。在 DGX Spark 上,NVFP4 量化相比 BF16 实现 1.74 倍 token 吞吐量提升,并将平均步骤时间从 6.8 秒缩短至 3.3 秒。模型支持函数调用协议,可在第三方智能体框架中部署。

    推荐理由:Holo3.1 把计算机使用代理从桌面扩展到了移动端,还首次放出了量化版,让本地运行真正快了起来。想做 GUI 自动化的开发者可以立刻跑起来了。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型61

    蚂蚁 inclusionAI 开源万亿参数 MoE 基座模型 Ling-2.6-1T-base

    Ling-2.6-1T-base 是蚂蚁 inclusionAI 开源的万亿参数 MoE 基座模型(总参约 1T,激活 63B)。它由 Ling-2.0-1T-base 升级而来,采用 Lightning Attention 与 MLA 以 7:1 混合的线性注意力架构,经约 9.6T token 的迁移预训练、持续预训练和中训练,上下文窗口从 4K 分阶段扩展至 256K。在 MMLU(86.82)、SimpleQA、LongBenchv2(43.54)等基准上超越前代。该模型仅供研究(继续预训练、微调、蒸馏等),不直接提供对话功能。

    推荐理由:Ling-2.6 用混合线性注意力把万亿 MoE 基座模型的上下文能力推到了 256K,对于研究长上下文和 MoE 的团队是个有价值的基座,但它是未对齐的预训练模型,不能直接当对话助手用。

  4. Microsoft AI:官方博客(网页)75

    Microsoft 发布七款新 MAI 模型并推出 Frontier Tuning 微调方案

    微软 MAI 团队发布七款新 MAI 模型,将通过 OpenRouter、Fireworks、Baseten 向开发者开放,并首次允许开发者自行调整模型权重。官方称基于强化学习环境(RLEs)的 Microsoft Frontier Tuning 可让模型学习企业自身工作流,其针对 Excel 微调的 MAI 模型可匹敌 GPT 5.4 且效率最高提升 10 倍。

    推荐理由:微软官方发布七款新 MAI 模型,并给出 Frontier Tuning 微调方案与具体效率数字,读者可据此评估其对企业和开发者工作流的影响。

  5. Microsoft AI:官方博客(网页)61

    Microsoft 发布 MAI-Code-1-Flash 编码模型,基准全面超越 Claude Haiku 4.5

    Microsoft 发布编码模型 MAI-Code-1-Flash,直接用生产环境 GitHub Copilot harness 训练,主打真实开发工作流而非仅优化基准。

    推荐理由:官方说明了用生产环境 Copilot harness 训练和评测的思路,并给出与 Claude Haiku 4.5 的基准对比数据,可据此评估其在真实编码工作流中的价值。

  6. X:商汤 SenseTime (@SenseTime_AI)73

    商汤 SenseNova U1 发布信息图专用模型

    感谢使用我们的模型来创建这些复杂的图表和图表。 看到具有挑战性的信息被转化为清晰、准确和可读的视觉效果真是太棒了。这就是我们的目标。😄

    推荐理由:SenseNova U1 这波信息图特化不是刷分,+18.2 Q-ACC 证明模型真的懂了排版,做汇报、做图表的可以直接上 Hugging Face 扒下来用。

  7. X:MiniMax (@MiniMax_AI)81

    MiniMax M3 模型上线 Cloudflare AI Gateway

    M3 on Cloudflare AI Gateway, day one ⚡ 前沿编码能力,1M 上下文,原生多模态,现在一次 fetch 即可调用。 是时候构建些东西了。 🦞

    推荐理由:MiniMax的M3把开源编码模型拉到新高度,1M上下文加原生多模态是惊喜,上线首周5折,值得跑一下看是不是真能干翻闭源。

  8. xAI:News(网页)78

    xAI发布Composer 2.5

    xAI的最新编程模型Composer 2.5现已在Grok Build中可用,用户可通过`/models`菜单选择使用。这是一款快速、先进的模型,擅长处理长时间运行的任务和复杂指令。该模型面向SuperGrok和X Premium+用户开放。

    推荐理由:xAI 的 Composer 2.5 主攻长任务和复杂指令,如果你在用 Grok 搭 Agent,这模型值得切过去试试,可能比之前的编码模型更稳。

  9. 公众号:通义实验室(千问)64

    Qwen3.7-Plus 多模态智能体模型发布

    Qwen3.7-Plus 深度融合视觉与语言,实现“看、想、写、做、验”端到端闭环,在 12 项核心基准测试中表现提升。实测中,基于该模型的智能体连续运行超 11 小时,自动完成英语学习 APP 开发,生成代码超 10000 行、触发调用超 1000 次;复刻 macOS Stocks 应用并通过 10 项功能验证。支持图像/视频转 SVG、视觉驱动网页设计及浏览器自动化。已在阿里云百炼上线,提供 OpenAI 兼容 API 与 Anthropic 协议。

    推荐理由:Qwen3.7-Plus 把视觉智能体推到了‘能看、能想、能动手’的端到端闭环,从写代码到操作浏览器一条龙,做自动化 Agent 的团队可以直接拿来用。

  10. Qwen:Blog Retrieval(API)81

    Qwen3.7-Plus:多模态智能体模型发布

    阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenWorldBench 62.1,GPQA Diamond 90.3,MMLU-Pro 88.5。通过阿里云 Model Studio API 提供。

    推荐理由:Qwen3.7-Plus 把视觉感知、GUI 操作和编码能力整合进同一个 agent 模型,在 ScreenSpot 和浏览器操作上的提升很实在,做自动化的开发者值得上手试试。

  11. Hacker News 热门(buzzing.cc 中文翻译)75

    英伟达 Cosmos 3

    英伟达发布了 Cosmos 3,这是一个用于物理 AI 推理的世界和行动模型。该信息来源于英伟达开发者博客,发布日期为 2026 年 6 月 1 日。

    推荐理由:Cosmos 3 把物理推理、世界生成和行动生成塞进一个开源模型,从机器人到自动驾驶都能用,英伟达这次是真的想定义物理 AI 的训练范式。

  12. Hugging Face:Blog(RSS)71

    JetBrains 发布 Mellum2:12B 参数混合专家模型

    Mellum2 是 JetBrains 从头训练的 12B 参数混合专家(MoE)模型,专注于自然语言与代码。每个 token 仅激活 2.5B 参数,推理速度可达同类模型的 2 倍以上,适合高吞吐、低延迟场景。该模型支持路由、RAG、摘要、子智能体及私有部署,以 Apache 2.0 许可证开源。在代码生成、推理、科学和数学基准测试中,Mellum2 与同等规模的开放模型竞争力相当。

    推荐理由:JetBrains 开源了 Mellum2,一个激活参数仅 2.5B 的 12B MoE 模型,专为代码和问答管道设计的快模型。做实时 RAG 或子代理时,终于不用硬扛大模型了。

6月1日周一
  1. X:商汤 SenseTime (@SenseTime_AI)67

    SenseNova新模型解决AI图表生成难题

    大多数AI模型在生成图表时存在数值错误(如负值显示为正)、柱状图位置偏移、元素关系混乱等问题。SenseNova-U1-8B-MoT-Infographic(SenseNova-U1)专为解决此类图表生成问题而设计,能够生成准确的图表,并支持实时调整设计和布局。项目在Hugging Face提供了模型,并在GitHub展示了效果案例。

    推荐理由:大部分AI生成的图表都有标注错误或比例失调,商汤这个模型专攻信息图准确性,对常做图表的产品人和分析师来说值得一试。

  2. IT之家(RSS)81

    黄仁勋:英伟达下一代 AI 超级芯片平台 Vera Rubin 全面投产

    英伟达 CEO 黄仁勋在 2026 台北电脑展宣布,下一代 AI 超级芯片平台 Vera Rubin 全面投产。该平台是 POD 级基础架构,与上一代 Grace Blackwell 平台相比,其大规模智能体吞吐量提高了 10 倍。凭借开源 MGX 设计,其供应链规模是 Grace Blackwell 的两倍,产品预计于今年秋季开始发货。

    推荐理由:Vera Rubin 全面投产,智能体吞吐量提升 10 倍,供应链规模翻倍,这是英伟达给 AI 算力瓶颈的一记重拳,做智能体应用的同行该开始计划升级硬件了。

  3. MiniMax:Blog(网页)83

    MiniMax M3:前沿编码、100万token上下文与原生多模态一体模型

    MiniMax M3 是一个开源前沿模型,具备先进的编码与AI智能体能力。它支持100万token的超长上下文窗口,并采用名为MSA(MiniMax Sparse Attention)的新型稀疏注意力架构。该架构使模型在100万token上下文下的每token计算成本降至前代的1/20,预填充速度提升9倍以上,解码速度提升15倍以上。在SWE-Bench Pro编码基准上,MiniMax M3得分59.0%,超越GPT-5.5和Gemini 3.1 Pro,性能接近Opus 4.7。该模型可通过MiniMax Code、Token Plan和API服务使用。

    推荐理由:MiniMax M3 把开源模型的编码能力推到了 GPT-5.5 和 Opus 4.7 这条线上,还附带 1M 上下文和原生多模态,这是开源社区真正能打的前沿选项,做 Agent 的值得立刻跑一下。

  4. 公众号:MiniMax(稀宇科技)78

    MiniMax M3 发布:前沿 Coding、1M 上下文与原生多模态集于一身

    MiniMax 发布 M3 模型,采用全新稀疏注意力架构 MSA,支持 1M 上下文窗口,并原生支持图片、视频输入及电脑桌面操作,是国内首个齐备这些要素的开源模型。

    推荐理由:M3在复现论文和CUDA优化中的长程自主迭代,将模型评估从单轮得分推进到真实协作场景,为衡量Agent Coding能力提供了更具参考价值的维度。

  5. Hacker News 热门(buzzing.cc 中文翻译)72

    本地设备 AI 图像生成模型 1-Bit Bonsai Image 4B 发布

    1-Bit Bonsai Image 4B 是一款新的 AI 图像生成模型,其主要特点是面向本地设备进行优化,可以在用户的本地硬件上运行。这是一款专注于端侧部署的图像生成解决方案。

    推荐理由:端侧图像生成终于进入可用阶段,把 4B 模型压到 iPhone 能跑而且性能保留 95%,做本地 AI 应用的产品人应该认真看一眼。

5月30日周六
  1. X:Google AI for Developers (@googleaidevs)71

    Nano Banana Pro与Nano Banana 2正式发布

    ICYMI:Nano Banana Pro [gemini-3-pro-image] 和 Nano Banana 2 [gemini-3.1-flash-image] 现已正式发布,可通过 Gemini API 投入生产使用。 查看这些优秀的社区示例,了解两个模型的实际能力 🧵

    推荐理由:Gemini 图像模型 GA 了,生成式视觉正式进入 Google 时间,做设计工具和内容生成的开发者可以直接接入测试,看看能不能成为下一个 Midjourney。

  2. X:Greg Brockman (@gdb)76

    OpenAI推出实时翻译模型,支持70+语言输入

    OpenAI 实时翻译功能——使用70多种输入语言说话,翻译成13种输出语言: gpt-realtime-translate 接收任意语言的语音输入,并输出目标语言的语音。 大语言模型很棒,但特定用例需要专用模型。 我们正在智能眼镜上运行此功能。

    推荐理由:OpenAI悄悄推出一个专门做实时语音翻译的模型,不是通用LLM,而是专用模型。这标志着AI交互从文字转向语音的第一步,做翻译硬件或AR眼镜的团队要睡不着了。

  3. Google Blog:AI(RSS)74

    Gemini Omni 与 Gemini 3.5 的 11 个实战展示

    Google 在 2026 年 Google I/O 大会上发布了新一代多模态模型 Gemini Omni 与 Gemini 3.5,并同步提供了 11 个视频,集中演示了这两款模型在实际场景中的能力。

    推荐理由:Google 官方放出的这组视频演示,直接展示了 Gemini Omni 和 3.5 的实际表现,比参数和 benchmark 更直观,做多模态应用的可以逐帧研究。

  4. X:SpaceXAI (@SpaceXAI)73

    xAI 发布 Grok Build 0.1 公测版

    grok-build-0.1 现已通过 xAI API 提供公开测试版。 这是驱动 Grok Build CLI 的同一模型,擅长智能体编码。 定价为输入 $1/m,输出 $2/m,极具成本效益、智能且快速。

    推荐理由:xAI 把 Grok Build 底层模型开放 API 了,定价比竞品便宜一个量级,做 agentic coding 的可以低成本试一下,速度也不错。

5月29日周五
  1. Qwen:Blog Retrieval(API)66

    Qwen-VLA:从理解世界到付诸行动

    通义千问推出通用视觉-语言-动作模型Qwen-VLA,基于Qwen多模态骨干,将视觉感知、语言理解与空间推理扩展至连续动作生成和轨迹预测。训练分四阶段:文本到动作预训练(T2A)、持续预训练(CPT)、监督微调(SFT)和强化学习(RL)。在LIBERO上达97.9%,Simpler-WidowX达73.7%,RoboTwin-Easy/Hard达86.1%/87.2%,匹配或超越专精模型。数据涵盖超10,000小时公共机器人轨迹、1,000+小时内部真实轨迹及800万+合成仿真轨迹。

    推荐理由:Qwen-VLA 把机器人操作、导航和跨实体控制统一进一个模型,在多个基准上打平甚至超越专用模型,这是通用具身智能的一个重要信号,但离实际可用还有距离。

  2. 公众号:通义实验室(千问)61

    Qwen-VLA:迈向通用具身智能的统一动作框架

    通义实验室提出Qwen-VLA,以Qwen3.5-4B视觉语言主干与1.15B参数DiT动作解码器构建统一视觉-语言-动作模型。通过文本到动作DiT预训练和本体感知提示,将操作、导航与轨迹预测统一在同一框架下,支持11种机器人平台。在5个仿真基准中,单一通用模型在3个上超越最佳专用模型;ALOHA真机in-domain成功率83.6%,OOD泛化76.9%,分别超越π₀.₅超35和40个百分点;DOMINO动态操作零样本达26.6%;VLN-CE导航R2R和RxR分别达57.5%和59.6%,均超越专用模型。

    推荐理由:通义把操作、导航和轨迹预测塞进一个脑子,在11种机器人上通用,这是具身智能从'专家'走向'通才'的关键一步,做机器人的值得翻翻论文。

  3. X:Greg Brockman (@gdb)69

    ChatGPT上线GPT-5.5 Instant新版本

    ChatGPT 新增 GPT-5.5 instant 模型: 我们今天发布了 GPT-5.5 instant 的新版本。之前的模型过于“子弹化”。新版本在其他一些重要维度上有所改进:谄媚性、事实性和多语言性能。希望你喜欢!我们始终对反馈感兴趣。

    推荐理由:GPT-5.5 instant 的小升级,直接针对用户吐槽的「太爱 bullet point」和谄媚问题,多语言和事实性也有改善,如果你在用 instant 模式可以动手切过去试试。

  4. IT之家(RSS)74

    小米开源可控视频音效生成模型 ControlFoley,让声音“按你想要的来”

    小米大模型应用团队发布开源可控视频音效生成模型 ControlFoley,旨在解决创作中的可控性难题。该模型统一支持文本引导视频配音、文本控制视频配音和参考音频控制视频配音三类任务。ControlFoley 在 VGGSound-Test 等多个 benchmark 上取得开源 SOTA 表现,其代码、模型权重和在线 Demo 均已开放。

    推荐理由:小米开源的 ControlFoley 把视频音效生成从“看画面配声音”推进到“按意图来”,开源 SOTA 且直接提供 Skill,做视频创作的可以上手试试。

  5. 公众号:阶跃星辰(Step)61

    阶跃发布 Step 3.7 Flash,面向生产级 Agent 的高效率 Flash 模型

    阶跃星辰发布并开源 Step 3.7 Flash,采用稀疏 MoE 架构(总参数 196B+1.8B,激活 11B),最高生成速度 400 Tokens/s。围绕原生多模态理解与执行、联网与视觉搜索增强、高可靠工具调用与编排、Agent 生态兼容优化四大能力优化。在 Toolathlon 达 49.5%,ClawEval-1.1 达 67.1%,GDPval 达 45.8%,τ²-bench Telecom 通过率超 98%。兼容 Claude Code、KiloCode 等主流架构及 MCP/Skills 协议,支持云端与本地部署,已在 Kilo Code 等生态中完成接入验证。

    推荐理由:Step 3.7 Flash 用激活仅 11B 的 MoE 架构把 Agent 工作流稳定性做透了,兼容主流框架还开源,对需要低延迟、高可靠性的生产环境 Agent 是真正可用的选择。

  6. xAI:News(网页)82

    Grok Build 0.1 on API

    xAI 的最新编码模型 Grok Build 0.1 已通过 xAI API 进入公开测试阶段。该模型专为智能体编码任务训练,支持网页开发、调试和 MCP,同时也是驱动 Grok Build CLI 的同一模型。其推理速度超过 100 tokens/秒,定价为输入 $1/m tokens,输出 $2/m tokens。除编码外,它也适用于通用智能体及工具调用场景,并可通过 OpenRouter 和 Vercel AI Gateway 获取。

    推荐理由:xAI 把编码模型卷到了 100+ t/s 和 $2/M 输出,专攻 agentic coding,这是直接在叫板 Claude Code 和 Cursor,做开发工具的同行该重新算账了。

  7. X:Google AI for Developers (@googleaidevs)71

    Nano Banana Pro与Nano Banana 2正式发布

    🍌 Nano Banana Pro [gemini-3-pro-image] 和 Nano Banana 2 [gemini-3.1-flash-image] 现已正式发布,可通过 Gemini API 投入生产使用。查看这些优秀的社区示例,了解两个模型的实际能力 🧵↓

    推荐理由:Google 把 Gemini 图像生成能力打包进 Nano Banana 系列并正式 GA,开发者现在可以稳定调用 Pro 和 Flash 级别的生图 API,对做图像应用的团队是个实在利好。

  8. TechCrunch:AI(RSS)72

    Anthropic 发布 Opus 4.8 并推出新型“动态工作流”工具

    Anthropic 发布了最新的 Opus 4.8 大语言模型,并为该模型引入了一个名为“Dynamic Workflows”的新工具。该工具旨在协调由多个子代理组成的群组,以执行复杂任务。

    推荐理由:Opus 4.8 是 Anthropic 对 Opus 4.7 失望反应的快速回应,亮点不在跑分而在模型能主动标记不确定性,这比正确率更实用。动态工作流让跨子 agent 的代码迁移成为现实,开发团队值得关注。

  9. Anthropic:Newsroom(网页)85

    Claude Opus 4.8 发布:在编码、智能体技能与推理方面实现全面升级

    Anthropic 发布了新一代模型 Claude Opus 4.8,作为 Opus 4.7 的升级版本,其在编码、智能体技能、推理和实用知识工作等各项基准测试中均取得进步。Claude Opus 4.8 现已可用,价格与前代相同。同步推出的新功能包括:用户可控制任务投入程度、Claude Code 新增“动态工作流”特性,以及 Opus 4.8 的 2.5 倍速模式价格降低为以往的三分之一。早期测试者反馈其在智能体任务中的判断力更可靠、工具调用更高效。该模型在 Online-Mind2Web 测评中得分 84%,超越了 Opus 4.7 和 GPT-5.5。此外,其诚实度与对齐表现也得到提升,代码错误漏检率降低了约 75%。

    推荐理由:Opus 4.8看着是常规升级,但动态工作流让Claude Code能啃下跨十万行代码迁移这种硬骨头,快速模式降价三倍更是直接拉低了实时场景的入场券。