跳到正文
北京时间

全部动态

今日 39 条
8月21日周五
  1. X:面壁智能 OpenBMB (@OpenBMB)69

    面壁智能 OpenBMB 推出 MathForm,面向 Lean 4 数学自动形式化的开源框架、数据集与模型

    面壁智能 OpenBMB 推出 MathForm,一个面向 Lean 4 数学自动形式化的开源框架、数据集与模型。其 FormalVerse 数据集含 367K+ 已验证示例;在匹配 100K 预算下,基于其训练的模型 Consistency Check 达 60.32%,优于 FineLeanCorpus(46.53%)与 NuminaMath-LEAN(41.49%)。

    推荐理由:数学形式化的难点是编译通过但语义漂移,该框架用检索规划和语义一致性反馈迭代修正,并开源数据集和 8B 模型,给小模型做形式化提供了可复用路径。

  2. DeepSeek:API 更新日志67

    DeepSeek-V4-Flash-Vision-Exp 发布

    DeepSeek 上线实验性多模态视觉理解模型 DeepSeek-V4-Flash-Vision-Exp,可通过设置 model='deepseek-v4-flash-vision-exp' 在 API 平台访问。

    推荐理由:实验版在纯文本能力与正式版持平的基础上补齐视觉,多模态 Agent 基准接近 Opus-4.8,让依赖视觉的 DeepSeek 工作流无需切换后端即可评估更强感知能力。

  3. 公众号:DeepSeek(深度求索)73

    DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp

    DeepSeek 上线多模态视觉理解模型 V4-Flash-Vision-Exp,纯文本能力与 V4-Flash 正式版持平,多模态 Agent 能力接近 Opus-4.8。该模型通过 API 提供,图片按 token 计费,一张最多占 384 tokens,价格与 V4-Flash 一致。同期上线的 Files API 免费,支持图片上传后通过 file_id 复用。

    推荐理由:比文本能力持平更实际的是多模态 Agent 能力接近 Opus-4.8,同时图片按 token 计费与 V4-Flash 一致,原先依赖外部视觉模型的 Agent 流程可能改用单一 API 且成本更低。

  4. Hugging Face:Blog(RSS)61

    Hugging Face 发布 LFM2.5 系列 DSpark 草稿模型,推理速度最高提升 3.18 倍

    Hugging Face 发布 LFM2.5 系列三款模型的 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下,GPU 吞吐最高提升 3.18 倍,端侧最高 2.87 倍。草稿模型约 300M 参数,LFM2.5-2.6B 函数调用延迟平均降低 57%,已开源支持 llama.cpp 和 SGLang。

    推荐理由:约300M参数的draft模型换最高3.18倍吞吐,贪心输出不变,LFM2.5-2.6B在M4 Max达139 tok/s,本地agent门槛被拉低。

8月20日周四
  1. IT之家(RSS)72

    阿里发布 Qwen-UI-Agent,主打让模型真正“会用”每一块屏幕

    阿里巴巴正式推出 Qwen-UI-Agent,一个以真实世界为中心的 GUI 智能体基座模型,覆盖移动端、电脑端、网页端及深度搜索(DeepSearch)环境。

    推荐理由:它把 GUI 智能体评测从模拟分数推向真实手机操作,自建 MobileWorld-Real 基准和百台真机环境,使落地型团队能按真机成功率而非仅看模拟榜单做选型。

  2. 公众号:蚂蚁百灵(Ling)68

    Ling-3.0 tiny & flash Base Models 正式开源

    蚂蚁百灵开源 Ling-3.0-tiny-base 与 Ling-3.0-flash-base,并同步开放预训练、中期训练及 WSM 合并等共 6 个 checkpoints。tiny-base 总参数 7.9B、激活参数 1.3B,flash-base 总参数 124B、激活参数 5.1B,均采用统一训练方案,适合持续预训练、监督微调、偏好优化及强化学习后训练等场景。

    推荐理由:Ling-3.0 开放中间 checkpoint 和 WSM 合并策略,研究者可比较各训练阶段增益,并在自己数据上从合适节点继续预训练或后训练,而不只是拿到最终权重。

8月19日周三
  1. Hugging Face:Blog(RSS)64

    Liquid AI 发布 LFM2.5 系列 QAD Q4_0 量化检查点,恢复 97% 精度损失

    Liquid AI 发布基于量化感知蒸馏(QAD)训练的 LFM2.5-230M、350M、1.2B-Instruct 和 2.6B 四款 Q4_0 GGUF 检查点,在保持原生 Q4_0 内存与速度的同时,恢复 BF16 平均精度损失的 97%。

    推荐理由:QAD 量化蒸馏恢复 Q4_0 模型九成六以上 BF16 精度,对应树莓派和手机等边缘设备,在保持低内存与高吞吐的同时缩小与全精度模型的差距。

8月15日周六
  1. HuggingFace Daily Papers(社区热门论文)72

    MOSS-VL技术报告:将实时交互作为一等能力的开源视觉语言模型家族

    MOSS-VL是一个将实时交互(边感知边说话)作为一等能力的开源视觉语言模型家族,通过门控交叉注意力让语言解码器在生成时同步处理视觉输入。MOSS-VL-Realtime在四个流式基准中平均成绩居开源模型之首(三项第一、一项第二),在OmniMMI Proactive Alerting上以66.0分大幅领先最佳基线(37.5分)。

    推荐理由:把视觉 token 放在解码序列之外,并用门控交叉注意力让模型边生成边接收画面,给低延迟多模态交互提供了一个具体架构参考。

  2. X:Gemini (@GeminiApp)66

    Gemini 3.7 Flash 全面上线 Pro 与 Ultra 用户

    Gemini 3.7 Flash 现已向 Gemini 聊天中的 Pro 和 Ultra 用户开放。该模型更新提升了多步骤任务的推理与准确性,如智能整合数十个文件和邮件为一份主文档。同时,Gemini Spark 也已运行于 3.7 Flash,通过改进对 Google Workspace 应用的工具调用,让个人 AI 智能体更精准。

    推荐理由:Gemini 3.7 Flash 把多步推理与跨文件整合能力下放到轻量模型,对经常需要合并数十份文件或邮件的用户来说,是一个成本更低的处理选项。

8月14日周五
  1. X:智谱 Z.ai (@Zai_org)66

    GLM-5.3 开放前安全评估:网络防御能力显著提升

    智谱发布 GLM-5.3,为网络安全任务最强模型,在漏洞发现、利用分析和多步安全任务上大幅提升。CyberGym 得分 84.5%(GLM-5.2 为 77.2%),ExploitBench 达 54.4%(此前 24.4%),ExploitGym 两小时完成 105 项任务(此前 29 项)。因双重用途风险,将先由安全伙伴受控评估,再开放 API 和完整权重。

    推荐理由:比单点漏洞发现更值得关注的是 GLM-5.3 在多步利用任务上的提升,这细分了安全团队能够交给模型的工作类型,从定位缺陷到验证攻击路径。

  2. X:通义千问 / Qwen (@Alibaba_Qwen)71

    通义千问开源 Qwen3.8 系列模型

    通义千问兑现承诺,开源 Qwen3.8 系列模型。其中 Qwen3.8-27B 为原生多模态稠密模型,仅 27B 参数即全面超越 Qwen3.7-Plus,原生支持 262K 上下文,可通过 YaRN 扩展至 1M tokens,采用 Apache 2.0 许可。Max 级 Qwen3.8-2.4T-A95B 的开放权重也已同步发布。

    推荐理由:官方称 27B 稠密多模态模型整体表现超过 Qwen3.7-Plus,262K 原生上下文可扩至 1M,Apache 2.0 协议下本地部署轻量应用多了一个更高效的选择。

  3. X:Unsloth (@UnslothAI)76

    Unsloth 发布 Qwen3.8-27B 动态 GGUF 量化,17GB 内存即可本地运行

    Unsloth 发布 Qwen3.8-27B 的 Dynamic GGUF 量化版本,4-bit 量化可在 17-19GB 内存设备上本地运行,并同时上传 NVFP4 量化。

    推荐理由:原文给出了本地运行的具体内存门槛、量化版本和硬件对照表,读者可以据此判断能否在自己的设备上跑通这个 27B 模型。

  4. 公众号:小红书技术(dots.llm)79

    dots3-note Preview 开源:280B 参数轻量模型,主打长程智能体与多模态推理

    小红书技术开源 dots3-note Preview,这是 dots3 系列最轻量模型,总参数 280B、激活参数 16B,支持 512K 上下文及文本、视觉、语音多模态理解,并针对复杂推理和长程 Agent 任务优化。

    推荐理由:除开源模型外,TEMPO 让同一智能体在每个宏观步骤切换为 critic,用测试时推理估计回报,给稀疏奖励长程任务的强化学习训练提供了可借鉴的结构。

  5. X:硅基流动 SiliconFlow (@SiliconFlowAI)65

    DeepSeek V4 Pro 登陆硅基流动,1M 上下文

    DeepSeek-V4-Pro-0813 正式上线硅基流动 SiliconFlow,提供 Day-0 支持,具备 1M 上下文窗口及低/高/最大三档推理强度,更侧重编码、工具调用与智能体工作流,仍保持 MIT 开源协议。定价为输入 $1.32/M、输出 $3.96/M、缓存命中 $0.44/M。同系列 DeepSeek-V4-Flash-0731 则面向追求速度与成本效益的日常生产场景。

    推荐理由:每百万缓存命中 0.44 美元与 1M 上下文组合,使 Agent 工作流在长上下文成本测算上有了更具体参照。

  6. Google DeepMind:Blog(RSS)72

    Google DeepMind 推出 Gemini 3.7 Flash:面向编程与智能体的最强工作模型

    Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,主打编程与智能体任务,输入/输出价格分别为每百万 token $0.75 和 $3.75,为原 3.6 Flash 的一半。

    推荐理由:相比 3.6 Flash,价格减半且 FrontierCode 和 DeepSWE 分数提升,让成本敏感型编码智能体团队有了新的性价比基线。

  7. MiniMax:Blog(网页)63

    MiniMax Music 3.0 发布:新一代开源权重、生产级全能音乐模型

    MiniMax 推出 Music 3.0,新一代音乐生成模型,可根据创意概念和可选歌词一次性完成整首歌的作曲、编曲、演奏与制作,最长支持五分钟。

    推荐理由:把简单描述扩展成包含配器进出、情绪曲线和演唱方式的专业模板,降低了非专业创作者控制音乐生成细节的门槛。

8月13日周四
  1. FireRedTeam:原创语音与多模态项目65

    FireRedTeam 开源 FireRedTTS3 语音生成与编辑模型

    FireRedTeam 发布 FireRedTTS3,包含 Base 和 Instruct 两个变体,基于语义增强连续语音表征实现统一语音生成与编辑。

    推荐理由:原文给出两个模型变体、语言覆盖和多项评测对比数据,读者可以据此评估它的克隆与编辑能力。

  2. DeepSeek:API 更新日志81

    DeepSeek-V4-Pro 正式版上线,Agent 能力大幅增强

    DeepSeek-V4-Pro 正式版已在 APP、网页端和 API 同步上线,模型名设为 deepseek-v4-pro 即可使用。其 Agent 能力显著提升,HLE (wo/w tools) 达 42.7/60.0,Terminal Bench 2.1 为 87.9。

    推荐理由:峰谷定价把闲时成本降至高峰一半,适合批量推理、评估任务等可延迟工作负载调整执行时间,为降低 API 支出提供空间。

  3. 公众号:小红书技术(dots.llm)75

    小红书开源连续自回归语音合成模型 dots.tts:打造可持续扩展的 TTS 基座

    小红书 dots 团队开源 20 亿参数全连续端到端自回归语音合成模型 dots.tts,在 Seed-TTS-Eval 三个子集上取得最佳平均内容准确度和平均说话人相似度。

    推荐理由:连续自回归跳过离散 Token 的信息损失,又用语义编码器回灌历史抑制累积误差,为音色克隆和低步数流式共用同一基座提供了路径。

  4. Cursor Blog70

    Cursor 与 SpaceXAI 联合发布 Grok 4.6

    Cursor 与 SpaceXAI 今日发布 Grok 4.6,重点强化长时运行智能体与交互式视觉任务,在多项智能体编程与知识工作基准上达到前沿水平,并在 Artificial Analysis Intelligence Index 上追平 GPT-5.6 Sol。

    推荐理由:长程轨迹中出现自检与验证,对需要模型持续执行多步项目的团队,可能减少中途人工纠偏,比单纯基准分更有参考价值。

  5. X:Mustafa Suleyman(Microsoft AI CEO) (@mustafasuleyman)66

    微软首发自研推理模型MAI-Thinking-1

    我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。

    推荐理由:微软首个自研推理模型进入 Foundry,使用 Azure 的团队在推理模型选型上多了一个自研选项,来源可完全在微软体系内验证。

  6. xAI:News(网页)77

    xAI 发布 Grok 4.6,强化长时运行智能体能力

    xAI 今日发布 Grok 4.6,在 Grok 4.5 基础上重点强化长时运行智能体及更复杂的交互式与视觉工作能力。该模型在多项智能体编码与知识工作基准上达到前沿水平,在 Artificial Analysis Intelligence Index(九项基准综合分)上追平 GPT-5.6 Sol。

    推荐理由:与 GPT-5.6 Sol 在智能体综合基准上持平,同时把输入 token 价格定在 2 美元,长任务应用的试错成本可能重新计算。

8月12日周三
  1. X:Elon Musk (@elonmusk, xAI)56

    Grok 4.6 发布:智能、快速且性价比高

    Grok 4.6 现已推出 🚀🚀🚀 智能、快速,性价比惊人!

    推荐理由:与 4.5 同价意味着升级带来的能力提升不必重新核算成本,对按量付费的使用者可能简化升级决策。

  2. IT之家(RSS)71

    LTX-2.5 模型登场:AI 生成 10 秒 720P 视频仅需 6.8 秒,原生集成 ComfyUI

    LTX 推出 LTX-2.5 模型,原生集成 ComfyUI,在 2 张英伟达 GB200 配置下生成 10 秒 720P 视频仅需 6.8 秒。LTX-2.5 Fast 以每秒 0.09 美元生成带音频 720p 视频,10 秒片段成本 0.90 美元;年度经常性收入低于 1,000 万美元的组织可免费使用。

    推荐理由:生成速度比同类快数倍,且开放权重允许微调,对需要高频出片或自定义视觉风格的应用,其自托管成本可能低于调用闭源API。

  3. vLLM 官方博客(RSS)72

    vLLM 提供 Qwen3.8-2.4T-A95B Day-0 支持

    vLLM 宣布对 Qwen3.8-2.4T-A95B 提供 Day-0 支持,该模型是基于 Qwen 3.5 架构的 2.4 万亿参数稀疏 MoE 模型,含 512 个专家,92 层混合骨干中每 4 层使用一次 full attention,其余 69 层为线性注意力。

    推荐理由:原文给出架构细节、量化方案和硬件要求,读者可以据此评估部署这个 2.4T 参数开源权重模型的成本与配置。

  4. Liquid AI 模型与工程博客(网页)67

    Liquid AI 发布 LFM2.5-VL-3B 边缘端视觉语言模型

    Liquid AI 发布 LFM2.5-VL-3B 视觉语言模型,屏幕理解 ScreenSpot-v2 平均 80.7,ToolSandbox 从 26.4 升至 59.5,RefCOCO 从 57.1 升至 87.9。

    推荐理由:官方给出与更大模型对比的基准数据和端侧、GPU 实测速度,读者可据此评估它在边缘部署场景的适用性。

8月11日周二
  1. LMSYS:Blog(Chatbot Arena 团队)74

    SGLang 宣布 Day-0 支持 NVIDIA Nemotron 3.5 Lightning

    SGLang 宣布对 NVIDIA Nemotron 3.5 Lightning 提供 Day-0 支持,该开源模型为 30B 总参数、3B 激活参数的混合专家架构,支持最长 1M token 上下文,可从 Hugging Face 下载 BF16 和 NVFP4 权重。模型支持 MTP、DFlash、DSpark 三种投机解码技术,并可通过 OpenAI 兼容 API 接入智能体工作流。

    推荐理由:Nemotron 3.5 Lightning以3B活跃参数提供前沿agent能力,SGLang的即刻支持让开发者能用单命令启动高性能推理,将agent部署成本大幅压缩。

  2. NVIDIA Blog(RSS)76

    NVIDIA 推出 Nemotron 3.5 Lightning,加速本地智能体任务

    NVIDIA 发布 Nemotron 3.5 Lightning,一款可定制的开源 30B 混合专家(MoE)模型,专为常驻智能体设计。相比同类开源模型,其 token 生成速度最高提升 4 倍,任务完成时间缩短 30%。该模型采用开放权重,支持用户微调以匹配特定任务,并可在 RTX PC、DGX Spark 及 Jetson 等设备上运行。

    推荐理由:本地运行 30B MoE 模型并声称 4 倍加速,与开源路由器结合可自动分配任务到最合适模型,给控制推理成本提供了新路径。

  3. 蚂蚁 inclusionAI:HuggingFace 新模型65

    蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型

    蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,含 tiny 与 flash 两个尺寸及预训练、中期训练、合并(WSM)等阶段检查点。该系列采用混合线性注意力与稀疏 MoE 架构,总参数 7.9B,每 token 仅激活 1.3B 参数(128 个路由专家中激活 8 个)。

    推荐理由:用加权检查点合并替代学习率衰减,让基座模型更适合持续预训练,也为验证不同衰减曲线省去重复实验。

  4. 蚂蚁 inclusionAI:HuggingFace 新模型63

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中期训练及合并(WSM)等阶段的检查点,支持继续预训练、微调与研究。Ling-3.0-tiny-base 采用稀疏 MoE 架构,含 128 个路由专家,每 token 仅激活 1.3B 参数,总参数量 7.9B,并原生混合线性注意力以高效处理长上下文。

    推荐理由:它把学习率衰减替换为加权检查点合并,基座模型更适合持续预训练和数据扩展,做继续预训练或领域微调时可复用这一训练策略做离线探索。

  5. 蚂蚁 inclusionAI:HuggingFace 新模型64

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

    蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,含 512 个路由专家,每个 token 仅激活 8 个路由专家和 1 个共享专家,激活参数仅 5.1B(Non-emb)。

    推荐理由:WSM 合并替代学习率衰减,让持续预训练和动态数据扩展不必为每种衰减策略重跑训练,降低实验成本。

  6. 蚂蚁 inclusionAI:HuggingFace 新模型68

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型

    蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基础模型,并发布预训练、中期训练及合并(WSM)等多个阶段检查点。该系列采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,激活参数仅 5.1B(Non-emb),总参数 124B,并原生结合 KDA 与 Gated MLA 混合线性注意力以高效处理长上下文。

    推荐理由:把学习率衰减替换为权重合并并发布训练各阶段检查点,使持续预训练与不同衰减策略的离线比较不必逐次重跑,降低实验成本。

  7. 蚂蚁 inclusionAI:HuggingFace 新模型64

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基座模型

    蚂蚁 inclusionAI 开源 Ling-3.0 系列语言基座模型,采用高度稀疏(1/64)MoE 架构,512 个路由专家中每 token 仅激活 8 个,总参数量 124B,激活参数仅 5.1B。该系列原生融合线性注意力,并以加权检查点合并替代传统学习率衰减。此次发布包含预训练、中期训练及合并(WSM)等多个训练阶段的检查点,支持继续预训练与微调,模型采用 MIT 许可证。

    推荐理由:把训练中间态作为可下载 checkpoint 开放,配合 WSM 合并替代学习率衰减,做继续预训练或 MoE 研究时可从中间阶段开始,省去重复前置训练成本。

  8. 蚂蚁 inclusionAI:HuggingFace 新模型63

    蚂蚁 inclusionAI 开源 Ling-3.0 系列中间训练检查点

    蚂蚁 inclusionAI 开源 Ling-3.0 系列高效语言基础模型,并发布预训练、中间训练及合并(WSM)等多个训练阶段检查点,支持继续预训练、微调与研究。

    推荐理由:训练检查点分层开放,且用加权合并替代学习率衰减,为持续预训练和动态数据扩展提供了可复用的实验基座,减少不同策略的重复训练成本。

  9. 公众号:蚂蚁百灵(Ling)75

    Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

    蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、每 Token 仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

    推荐理由:1.3B 激活参数在 Mac 上实测首 Token 低于 100 毫秒,比只看参数量的轻量叙事更有参考价值,端侧 Agent 的落地边界因此更具体。

  10. 公众号:蚂蚁百灵(Ling)72

    Ling-3.0-tiny 正式开源:1.3B 激活参数如何进入真实任务

    蚂蚁百灵开源 Ling-3.0-tiny,一款总参数 7.9B、推理时仅激活 1.3B 参数的原生混合推理模型,同步提供 BF16、FP8 和 INT4 三个版本。

    推荐理由:以1.3B激活参数取得接近4B激活模型的综合能力,同时Agent分数超越部分30B+模型,多精度开源和本地部署方案让轻量Agent应用更易落地。

  11. Microsoft AI:官方博客(网页)64

    Microsoft 发布 MAI-Image-2.6,Arena 文生图榜排名第二

    Microsoft 发布 MAI-Image-2.6,在 Arena 文生图排行榜上位列第二,超过 Meta、Google 和 xAI 的模型。该模型相较 MAI-Image-2.5 整体提升 +79 Elo,文本渲染单项提升 +91 Elo,各测量类别均有改进;现已可在 Arena 体验,本周后续登陆 MAI Playground,并将逐步推广到 Microsoft Foundry 等产品。

    推荐理由:官方给出 Arena 排名、Elo 提升幅度和上线入口,读者可据此对比各家用图像生成模型的表现。

  12. X:Artificial Analysis (@ArtificialAnlys)78

    Meta 开源 Muse Glimmer,Apache 2.0 首秀

    Meta 发布开源模型 Muse Glimmer,这是其自 Llama 4 以来首个开源权重模型,30B 参数,在 Artificial Analysis 智能指数上得分 35,也是 Meta 首个采用 Apache 2.0 许可的模型。

    推荐理由:Apache 2.0 许可和单 GPU 可运行的设计,使团队能在自有硬件上运行与更大模型接近的性能,部署成本与合规风险同时下降。

  13. OpenAI:官网动态(RSS · 排除企业/客户案例)55

    OpenAI 推出 GPT-5.6-Cyber,面向授权漏洞研究的网络安全专用模型

    OpenAI 发布网络安全专用模型 GPT-5.6-Cyber,可通过 Daybreak Red 获取,用于授权的漏洞研究、漏洞验证和安全测试。该模型旨在应对网络防御窗口不断收窄的挑战,为安全研究人员提供专门工具。

    推荐理由:GPT-5.6-Cyber 将大模型能力引入授权的漏洞研究与验证流程,安全团队可借助模型自动化分析,缩短从漏洞发现到修复的窗口。

8月10日周一
  1. LMSYS:Blog(Chatbot Arena 团队)72

    SGLang 为 Muse Glimmer 提供 Day-0 支持,针对本地智能体工作流优化推理

    SGLang 与 Meta Superintelligence Labs 合作,为 30B 参数多模态模型 Muse Glimmer 提供 Day-0 支持,该模型拥有 128k+ token 上下文窗口。

    推荐理由:SGLang对Muse Glimmer的优化使30B多模态模型在RTX 5090上达到236 tok/s用户速度,本地智能体工作流不再受限于云端延迟。