跳到正文
北京时间

全部动态

今日 39 条
7月27日周一
  1. 公众号:月之暗面(Kimi)81

    Kimi K3 开放日:模型权重、技术报告和关键 Infra 技术同步开放

    Kimi 发布 K3 模型权重与技术报告,并开源 MoonEP、FlashKDA 和 AgentEnv 三项关键 Infra 技术。K3 是 2.8 万亿参数的 MoE 模型,支持原生视觉与 100 万 token 上下文,参数规模约为 K2.5 的 3 倍,规模化效率提升 2.5 倍。

    推荐理由:权重开源伴随技术报告公开训练细节,为研究机构直接复现和改造千亿级MoE模型提供了完整路径,也降低企业自部署门槛。

  2. Modal 官方工程博客(RSS)78

    Moonshot 发布 2.8T 参数开源多模态模型 Kimi K3,Modal 实现发布当天 460 tokens/s 推理

    Moonshot 发布 Kimi K3,总参数 2.8T、每 token 激活 16/896 专家,支持 1M token 上下文窗口和原生视觉。Modal 与 Moonshot、vLLM 合作提供 Day 0 支持,通过定制的 DFlash 投机解码模型将智能体负载交互速度从 100 提升到 460 tokens/s,吞吐从 800k 提升到 1.5M TPM/GPU。

    推荐理由:Modal 作为发布当天的托管方,给出了 K3 架构细节与推理加速数据,读者可据此评估运行这级开源模型的工程门槛。

7月25日周六
  1. 公众号:数字生命卡兹克64

    Claude Opus 5 发布,以一半价格逼近 Fable 5

    Anthropic 发布 Claude Opus 5,已全量上线,支持 100 万上下文,知识截止至 2026 年 5 月。在 ARC-AGI-3 上得分 30.2%,接近 GPT-5.6 Sol(7.8%)的四倍;输入每百万 Token 5 美元、输出每百万 Token 25 美元,价格与 Opus 4.8 相同,仅为 Fable 5 的一半。

    推荐理由:卡兹克第一时间上手 Claude Opus 5,用实测撕开官方跑分的伪装,发现它在实际工程中的漏洞,并点出 Anthropic 删掉 80% 系统提示的趋势——模型变聪明了,过去那些繁琐的 Skill 该扔了。

  2. Midjourney:Updates(RSS)73

    Midjourney V8.2 发布:专注美学提升与个性化理解

    Midjourney 今日推出 V8.2 图像模型,重点提升美学质量、图像创意与个性化表现。低质量图像出现频率将显著降低,个性化功能能更精准理解用户审美偏好。V8.2 的个性化配置文件拥有更大、更优的图像选择池,建议用户尝试新旧配置文件体验最新版本。

    推荐理由:Midjourney V8.2 把审美和个性化放到了C位,不再追分辨率,这对重度用户是实在的体验升级,建议立刻用老 profile 试试新模型。

  3. Anthropic:Newsroom(网页)92

    Anthropic 发布 Claude Opus 5

    Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

    推荐理由:Anthropic 这次把 Opus 的性价比条拉满了,性能翻倍价格减半,实际编码和知识工作基准已经超越所有模型。最打动我的是它自查自纠的严谨,写代码像真开发者一样审自己的页面,这种责任心以前只在人身上见过。

7月24日周五
  1. 公众号:蚂蚁百灵(Ling)75

    蚂蚁百灵发布Ling-3.0-flash原生混合推理模型

    蚂蚁百灵发布新一代原生混合推理模型Ling-3.0-flash,总参数量124B,激活参数量仅5.1B,在传统推理、指令遵循与长文本等指标上对标甚至超越上一代旗舰Ring-2.6-1T。模型采用原生混合线性注意力架构与1/64稀疏MoE,并扩展至10,000+可交互训练环境,长输入下TTFT降低60%至80%以上。

    推荐理由:蚂蚁百灵用124B总参、5.1B激活做到对标1T模型,还开源加免费API,想要低成本跑强Agent的团队可以立刻试。

  2. HuggingFace Daily Papers(社区热门论文)77

    SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

    SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

    推荐理由:SANA-Video 2.0 视频生成模型把单 GPU 的 720p 生成压到 13 秒,比 Wan 2.2 快 120 倍,做视频应用的开发者该重新评估成本模型了。

  3. IT之家(RSS)73

    Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

    Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

    推荐理由:FLUX 3 把图像、视频、音频塞进同一个架构,单次能出 20 秒带声视频,对比 Grok Video 胜率 69%,视频生成赛道的竞争又升温了。

  4. Microsoft AI:官方博客(网页)61

    Microsoft 发布用于 GitHub Copilot 和 Excel 的专用 MAI 模型

    Microsoft 宣布将 hill-climbing 方法应用于 MAI 模型,在 GitHub Copilot 和 Excel 中部署专用于智能体工作负载的版本。

    推荐理由:官方给出具体接受率、回访率和 token 用量数据,读者可据此比较小模型在产品内替代大模型的路径。

  5. 蚂蚁百灵:Developer Blog(网页)55

    蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

    蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。

    推荐理由:蚂蚁把124B模型的激活参数压到5.1B,还敢对标上代1T旗舰,如果实测不翻车,这个智能密度对端侧和低成本部署是个真信号。

7月23日周四
  1. X:通义千问 / Qwen (@Alibaba_Qwen)79

    通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

    阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如[whisper]、[angry])、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

    推荐理由:TTS 模型终于学会控制情感和语调了,Qwen 这次把自然语言提示和细粒度标签一起放进去,做语音助手的可以直接从‘能说话’跳进‘有性格’。

  2. Google AI:DEV 作者专属(RSS)73

    Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

    Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

    推荐理由:Gemini 3.6 Flash 降本增效,3.5 Flash-Lite 主打低成本高速,弃用 temperature 等参数是个硬变更,使用 Gemini 的开发者必须检查迁移。

  3. Hacker News 热门(buzzing.cc 中文翻译)70

    Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

    Cactus 推出基于 Gemma 4 的混合模型“Cactus Hybrid”,在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

    推荐理由:把置信度探针塞进 Gemma 4 E2B,让模型自己判断该不该求助大模型,仅路由 15-35% 的查询就能持平 Flash-Lite,对离线/隐私优先的端侧产品是个省成本的新思路。

  4. Black Forest Labs:Blog(网页)59

    FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测

    Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。

    推荐理由:Black Forest Labs 把图像、视频、音频拉通到一个模型里,这比单纯提升画质更有想象力,但目前只有一句简介,像个预告片,想真评估的还得等技术细节。

7月22日周三
  1. X:Josh Woodward (@joshwoodward, Google Labs VP)69

    Google 发布三款新模型:3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber

    Google 推出三款新模型,旨在提升性能、降低延迟和成本。其中,3.6 Flash 在复杂编码任务上 token 用量最高减少 65%,3.5 Flash-Lite 速度达 350 输出 token/秒。3.6 Flash 和 3.5 Flash-Lite 已在 Gemini 应用上线,3.5 Pro 进入合作伙伴测试。

    推荐理由:Google一口气扔出三个Gemini Flash新模型,3.6 Flash把复杂编码token砍了65%,做Agent的成本敏感型选手可以直接收益,Cyber模型专攻漏洞修复是个有意思的细分信号。

7月21日周二
  1. Google DeepMind:Blog(RSS)57

    Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型

    Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。

    推荐理由:Gemini Flash 系列常规更新,Flash-Lite 和 Cyber 变体值得 API 开发者留意,但细节还没出来,目前只能先标记。

  2. 公众号:小红书技术(dots.llm)81

    小红书 dots 模型获 IMO 2026 满分金牌

    小红书 dots 团队携内部版本 dots-note 3.0 参加第 67 届 IMO 2026,六道题均获满分,以 42/42 分取得满分金牌,全球仅 7 位人类选手获此成绩。模型不依赖形式化语言,直接读取原始 LaTeX 题目,通过递归自我批判能力端到端完成解题。dots-note 3.0 是 dots3 系列最轻量级模型,预期将开源。

    推荐理由:IMO满分金牌这个里程碑,背后是模型递归自我批判能力的突破。不依赖形式化验证就能给出优雅证明,这对数学推理研究是个真信号,做推理方向的值得细读。

  3. 公众号:小红书技术(dots.llm)77

    小红书dots模型取得IMO 2026满分金牌成绩

    小红书dots团队携dots-note-3.0内部版本参加IMO 2026,六题均获满分7分,以42/42分取得满分金牌,全球仅7位人类选手获满分。该模型不依赖形式化语言,直接读取原始LaTeX题目,通过Proof、Verify、Refine三环节递归自我批判完成解题。dots-note-3.0是dots3系列最轻量级模型,预期将开源。

    推荐理由:dots模型在IMO满分验证了递归自我批判方法的有效性,这种不依赖形式化验证、通过自我质疑改进推理的路径,可能为科学研究等难以量化的复杂任务提供新的解决思路。

  4. Qwen:Blog Retrieval(API)77

    通义千问发布 Qwen-Image-3.0 图像生成模型,核心关键词为“实”

    通义千问发布第三代图像生成基座模型 Qwen-Image-3.0,核心关键词为“实”。该模型支持最长 4.5k token 指令输入,可单次生成包含 9 个复杂信息图的 3×3 网格布局;文本渲染精度达 10px,并支持 12 种语言原生渲染,旨在将图像转化为可部署的生产力工具。

    推荐理由:我觉得 Qwen-Image-3.0 不只是画得好看,而是真正追求“有用”,4.5k token 输入、12 种语言渲染、10px 精细文字,对做设计、内容生产的人是生产力级突破。

  5. Hugging Face:Blog(RSS)70

    NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

    NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。

    推荐理由:NVIDIA 把世界模型的能力压进 4B 参数,直接在 Jetson 上实时推理并生成机器人动作,对做具身智能的人来说是个标志性信号,边缘部署终于可以摆脱云端依赖了。

7月20日周一
  1. Sakana AI:Blog(网页)60

    Sakana AI 推出 Fugu-Cyber 编排模型,面向现代网络防御

    Sakana AI 发布 Fugu-Cyber,一款面向现代网络防御的编排模型,现以新 API 端点形式提供。该模型在 CyberGym 上取得 86.9% 的成功率,在 CTI-REALM 上达到 72.1%,与 GPT-5.5-Cyber 和 Mythos-Preview 等网络安全前沿模型相当。

    推荐理由:Sakana AI 把 AI 编排带到网络安全领域,Fugu-Cyber 在真实基准上的 SOTA 成绩值得安全从业者认真看看,但具体细节还没公开,别急着上手。

  2. IT之家(RSS)70

    上海科学智能研究院开放科学多模态基础模型“神珍”

    上海科学智能研究院开放科学多模态基础模型“神珍”,总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

    推荐理由:一个模型同时理解蛋白质、气象和医学影像,还全开放权重和代码,对交叉学科的研究者是难得的工具包。比专用模型省去切换成本,值得科学计算方向的产品人关注。

  3. 公众号:面壁智能(MiniCPM)70

    面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,正式进军机器人领域

    面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。

    推荐理由:1.5B VLA模型通过视觉token压缩将带记忆推理成本降至与单帧反应式相近,使得需要持续上下文理解的机器人操作任务不再受算力约束。

7月19日周日
  1. X:面壁智能 OpenBMB (@OpenBMB)71

    面壁智能开源 MiniCPM-Robot 具身智能模型系列

    面壁智能开源首个具身AI模型系列 MiniCPM-Robot,包含 1.5B 参数的通用视觉-语言-动作(VLA)模型 MiniCPM-RobotManip 和用于目标跟踪的 MiniCPM-RobotTrack。同时发布高性能推理框架 PhyAI,旨在让机器人实现理解、记忆与行动。

    推荐理由:面壁智能把1.5B的VLA模型完整开源,让个人开发者也能在真实机器人上跑操作和跟踪,这个开放程度在具身领域很罕见,做机器人的可以直接 clone 跑一下。

  2. 公众号:面壁智能(MiniCPM)68

    MiniCPM5-2B发布:4B以下全球性能第一,适配9款芯片

    面壁智能联合OpenBMB发布端侧模型MiniCPM5-2B,以2B参数量在AA-Index榜单取得4B以下模型最高分17分,平均分54.26,超越Qwen3.5-2B等竞品。模型原生支持混合思考与512K上下文,已完成华为昇腾、英伟达等9款芯片的Day0适配,即将开源。

    推荐理由:2B 参数做到 4B 以下综合第一,而且把数据治理和 Agent 训练流程也开源了,做端侧智能体的可以盯一下,只是还没正式开源,暂时摸不到。

  3. 公众号:面壁智能(MiniCPM)64

    面壁智能发布端侧模型 MiniCPM5-2B,登顶 4B 以下性能榜首

    面壁智能联合 OpenBMB 在 WAIC 2026 发布端侧模型 MiniCPM5-2B,以 2B 参数量在 AA-Index 榜单登顶 4B 以下模型榜首,平均分 54.26,超 Qwen3.5-2B(41.66)。模型原生支持混合思考与 512K 上下文,Agent 能力得分 90.35,并完成华为昇腾、英伟达等 9 款芯片的 Day0 适配。

    推荐理由:长文本理解得分42.33、Agent能力τ²-Bench得分90.35,这些具体指标为端侧开发者评估2B模型的多步推理和工具调用提供了明确参照。

  4. 公众号:昆仑万维(天工)72

    昆仑万维宣布2026为“世界模型元年”,发布Matrix-Game 3.5等模型

    昆仑万维董事长方汉在WAIC上宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型、Mureka v9.5与O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p分辨率下单卡可达20FPS实时生成,核心架构已开源。

    推荐理由:Matrix-Game 3.5 用 Patch 记忆把世界模型推到单卡实时交互,还开源了,做游戏和具身智能的值得试。Mureka v9.5 和 O3 把 AI 音乐做成版本化创作,工具感很强。

  5. 公众号:昆仑万维(天工)63

    昆仑万维宣布2026为“世界模型元年”,发布Matrix-Game 3.5与Mureka v9.5

    昆仑万维在WAIC论坛宣布2026年为“世界模型元年”,并发布Matrix-Game 3.5世界模型与Mureka v9.5、O3音乐模型。Matrix-Game 3.5实现Patch级记忆注入,5B模型在720p下可单卡20FPS实时生成,核心架构开源。Mureka v9.5指令精准度从6.92提升至7.62。

    推荐理由:Matrix-Game 3.5 用 Patch 级记忆实现长时一致性与实时交互,为具身智能数据生成与游戏环境演化提供了可参考的架构;Mureka 将音乐生成转向「版本化制作」,结合 Agent 控制多维度调整,让非专业创作者也能迭代作品。

  6. X:通义千问 / Qwen (@Alibaba_Qwen)75

    Qwen3.8 开源发布,2.4T 参数模型上线

    Qwen3.8 即将发布并很快开源权重!🌐 该模型拥有 2.4T 海量参数,正在持续进化。我们相信它是目前最强大的模型之一,可与领先的前沿 AI 模型媲美,仅次于 Fable 5。 你无需等待即可测试。就在刚才,Qwen3.8-Max-Preview 已在阿里巴巴的 Token Plan、Qoder 和 QoderWork 上首次亮相。快来抢先体验吧。 期待你的作品。敬请关注!🚀

    推荐理由:Qwen3.8 以 2.4T 参数开源,性能仅次于 Fable 5,这对开源生态是一场及时雨,国内开发者的可用选项又多了一个重量级选手。

7月17日周五
  1. MarkTechPost(RSS)70

    NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

    NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

    推荐理由:嵌入模型不是最热的赛道,但决定了你 Agent 看到什么——NVIDIA 把 1B 模型压缩到 RTEB 第二,NVFP4 量化后精度几乎不变,做 RAG 的值得换上。

  2. 公众号:通义实验室(千问)69

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

    通义实验室发布 Wan-Streamer v0.2,这是一款将“听、看、说、演”统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。

    推荐理由:通义实验室把实时视频交互延迟压到550ms,同时提升了分辨率,不是刷榜而是解决实际问题,对做数字人和实时助手的团队是个值得跟进的信号。

  3. 公众号:通义实验室(千问)76

    Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

    推荐理由:550ms端到端延迟把实时视频对话从拼接流水线推入单模型交互循环,原先因响应太慢而无法沉浸的口语陪练与面试模拟,开始具备自然对话的交互基础。

  4. 公众号:月之暗面(Kimi)80

    Kimi K3:智能的新前沿

    Kimi 发布迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,原生支持视觉理解。该模型在长程编程、知识工作等场景表现前沿,整体能力仅次于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 及官方 App 使用,完整模型权重将于 2026 年 7 月 27 日前发布。

    推荐理由:Kimi K3 以 2.8 万亿参数开源,虽自承不及闭源顶尖,但长程编码与知识工作案例扎实,是国产开源模型冲击前沿的关键一步,开发者值得跟进。

  5. 公众号:月之暗面(Kimi)83

    Kimi K3:智能的新前沿

    月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。

    推荐理由:K3 把 2.8 万亿参数开源,并展示了从内核优化到芯片设计的连贯长程能力,为评估开源模型在复杂工程任务中的实际上限提供了参照。

  6. HuggingFace Daily Papers(社区热门论文)73

    NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

    NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

    推荐理由:NVIDIA 这次把音频和视觉在长视频上的联合推理做成了全开源模型,AV-Skills 数据集和 TAVIT 推理框架是亮点,做视频理解的开发者可以直接拉下来用。

  7. IT之家(RSS)79

    Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶

    月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。

    推荐理由:Kimi K3 的 2.8T 参数和 100 万上下文不是数字游戏,前端跑分实打实地压过 Claude Fable 5,七个子领域拿六个第一,这对做前端和长文档处理的人是个明确信号,可以下场试了。

7月16日周四
  1. X:Thinking Machines (@thinkymachines)70

    Thinking Machines 发布多模态模型 Inkling

    今天,我们推出 Inkling。 Inkling 能高效地对文本、图像和音频模态进行推理。我们将提供完整权重。 https://thinkingmachines.ai/news/introducing-inkling/ 即日起可在 Tinker 上进行微调。在 Inkling Playground 中试用。🧵

    推荐理由:多模态推理终于有了开放权重的选项,Inkling不是最强的,但可能是最方便你上手微调的。想试试多模态Agent的,今天就能在Playground玩。

  2. OpenAI:官网动态(RSS · 排除企业/客户案例)67

    OpenAI 发布 GPT-Red:通过自动化红队测试提升模型鲁棒性

    OpenAI 训练了自动化红队模型 GPT-Red,用于在部署前发现漏洞并在训练中生成攻击以提升模型鲁棒性。GPT-Red 能攻破此前几乎所有模型,其攻击被用于对抗训练 GPT-5.6 Sol,使该模型在直接提示注入基准测试中的失败率降至四个月前最佳生产模型的 1/6。GPT-Red 通过自对弈强化学习训练,投入了 OpenAI 后训练中前所未有的计算规模。

    推荐理由:OpenAI 用自博弈训练出的红队模型 GPT-Red,把直接提示注入攻击成功率压到了 0.05%,而且没有降低模型能力。做 AI 安全的人应该好好读一下他们怎么实现这个飞轮的。