推荐理由:将视频理解提升到结构化空间输出,动态帧率分析让模型能真正「看懂」动作,做具身智能的开发者可以关注。
模型发布
全部主题新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
最新精选
第 461–480 条 · 共 710 条
OpenRouter@OpenRouter精选AI 评分6969
Krea@krea_ai精选AI 评分6868这是Krea 2。 我们的首个基础模型,完全从零构建,旨在实现美学多样性和风格控制。 了解更多并获取早期访问权限👇

推荐理由:Krea 终于自研基础模型了,而且是从零开始做,专门为美学多样性和风格控制优化的,对做视觉内容的人来说多了一个风格自由度的选择,值得试试 early access。
HuggingFace Daily Papers(社区热门论文)精选AI 评分7676 Qwen-Image-2.0技术报告
Qwen-Image-2.0是一个统一高保真生成与精确编辑的全能图像生成基础模型。它采用Qwen3-VL作为条件编码器,结合多模态扩散变换器进行联合建模,并通过大规模数据整理与多阶段训练实现强化。该模型支持长达1K令牌的指令输入,能生成幻灯片、海报等富文本内容,显著提升多语言文本渲染与排版质量。在生成方面,它增强了细节、纹理真实感与光照一致性,并更可靠遵循复杂指令。人工评估表明,其在生成和编辑任务上均大幅超越前代模型。
推荐理由:这是 Qwen-Image 系列第一次把多模态理解和生成真正拧到同一框架里,长文本渲染和多语言排版提升肉眼可见,做海报和幻灯片的可以重点关注。
OpenRouter@OpenRouter精选AI 评分6969引用Ant Ling@AntLingAGI我们正在发布 Ring-2.6-1T,一个万亿参数级别的旗舰思考型模型,专为真实世界的复杂任务和生产环境打造:🚀 - 可调节思考深度:动态计算机制,灵活平衡认知深度、Token 成本与执行速度; - 面向 Agent 优化:针对高频工作流打造,实现快速的多步执行与工具编排,并具备 SOTA 稳定性; - 深度思考:释放模型的最大能力上限,适用于严谨的数学逻辑与科学研究。
推荐理由:万亿参数的思维模型免费到5月15日,可调思考力度的设计很接地气,做agent的可以趁窗口压测一下,看看它能不能扛住真实生产环境。
SenseTime@SenseTime_AI精选AI 评分7272推荐理由:商汤把新模型U1的ComfyUI部署流程完整放出,还有实测视频,想在自己机器上跑国产图像模型的开发者可以直接抄作业了。
Thinking Machines Lab:官方博客(RSS)精选AI 评分5959 Thinking Machines Lab发布Interaction Models研究预览
Thinking Machines Lab发布interaction models研究预览。该模型从零训练,原生处理音频、视频和文本,采用多流微回合设计实现实时响应,无需外部脚手架。研究预览展示了全新的交互能力,并在智能性与响应性上取得综合SOTA表现。
推荐理由:Thinking Machines 把实时交互训进了模型本身,不再是外挂脚手架,微轮次架构和 benchmark 数据很硬,做语音/视频助手的可以认真看看,虽然还是研究预览,但方向值得盯着。
Ant Ling@AntLingAGI精选AI 评分7878

推荐理由:蚂蚁憋了个万亿参数的大家伙,而且把可调思考和 Agent 优化当主打,明显是冲着生产级落地的,做 agent 的可以盯一下实际推理成本。
Hugging Face:Blog(RSS)精选AI 评分7272 EMO:为涌现模块化预训练的专家混合模型
EMO是一种新型专家混合模型,通过端到端预训练使模块化结构直接从数据中涌现,无需依赖人类定义的先验。该模型允许在特定任务中仅使用12.5%的专家子集(即8个活跃专家中的部分),同时保持接近全模型的性能;当所有128个专家共同使用时,它仍作为强大的通用模型。EMO具有1B活跃参数和14B总参数,训练数据达1万亿令牌。与标准MoE相比,EMO通过文档级路由约束,鼓励专家形成领域专业化组,从而支持选择性使用而不导致严重性能下降,实现了可组合架构,优化了大型稀疏MoE的内存-准确性权衡。
推荐理由:EMO 让 MoE 专家从按词法分散进化到按语义域自然模块化,仅用 12.5% 专家就能接近全模型性能,对需要按需加载的大模型部署是真正的突破。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7474 Scaling Trusted Access for Cyber with GPT-5.5 and GPT-5.5-Cyber
OpenAI扩展了网络安全领域的可信访问计划,推出了GPT-5.5和专门针对网络安全的GPT-5.5-Cyber模型。此举旨在帮助经过验证的网络安全防御者加速漏洞研究,并加强对关键基础设施的保护。新模型将为安全专业人员提供更强大的AI工具支持。
推荐理由:GPT-5.5 正式登场,首秀是给安全防御者用的,Trusted Access 机制把模型和真实漏洞环境连起来,做网络安全的可以关注,其他人先看看。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分8686 通过 API 中的新模型推进语音智能
OpenAI API 推出了新的实时语音模型,能够进行推理、翻译和语音转录。这些模型显著提升了语音交互的自然度与智能水平,支持实时处理与多语言转换。新功能旨在为开发者提供更强大的工具,以构建更流畅、更智能的语音应用体验。
推荐理由:语音模型不再只是‘听写’,开始能推理和翻译了,OpenAI这次API更新的几个新模型把语音智能推向更实用的阶段,做语音产品的值得赶紧试试。
Ant Ling@AntLingAGI精选AI 评分7676
推荐理由:万亿参数专攻Agent,成本还直降75%,对狂烧token费的AI Agent团队来说是个真信号。蚂蚁终于不玩虚的,OpenRouter上就能试。
SenseTime@SenseTime_AI精选AI 评分7171
推荐理由:从100步到8步,23秒压到2秒,商汤这个蒸馏LoRA把U1的推理成本打下来了,做实时图像应用的可以认真看看,ComfyUI一接就能跑。
IT之家(RSS)精选AI 评分7171 豆包大模型家族首款全模态理解模型:字节跳动 Doubao-Seed-2.0-lite 升级
字节跳动火山引擎发布豆包大模型家族首款全模态理解模型 Doubao-Seed-2.0-lite 升级版。该模型原生统一支持视频、图像、音频和文本理解,并能进行跨模态联合推理,在物理、医疗等学科推理及细粒度感知上表现超越此前Pro版本。音频方面支持19种语种转写及多语种互译,多项基准测试优于Gemini-3.1-Pro。同时,其Agent、Coding与GUI能力升级,能更稳定处理长任务、胜任深度开发,并实现界面理解与操作执行的闭环。新版本已在火山方舟上线,旨在为企业提供高性价比的全模态任务部署方案。
推荐理由:豆包Seed 2.0 lite把视频、音频、图片、文字原生塞进一个模型,还顺手强化了Agent和GUI操作,对需要全模态处理的企业来说,这可能是目前性价比最高的选择。
Zyphra Research(网页)精选AI 评分6767 Zyphra 发布 ZAYA1-8B:全 AMD 集群训练的 MoE 模型
Zyphra 发布 ZAYA1-8B,一个活跃参数不足 10 亿的 MoE 模型,是首个完全在 AMD Instinct MI300 集群(1,024 个节点,与 IBM 合作构建)上完成预训练、中期训练和监督微调的模型。
推荐理由:原文给出活跃参数不足 1B 的 MoE 模型在数学和编码基准上的具体成绩,以及全 AMD 集群训练和 Markovian RSA 测试时计算方法。
ChatGPT@ChatGPTapp精选AI 评分7373
推荐理由:OpenAI突然发了一个「Instant模型」,推文只有一句庆祝,没给任何能力指标。如果真是主打实时响应,那对聊天体验是实打实的提升,但现在啥也看不出来。
Greg Brockman@gdb精选AI 评分9191引用OpenAI@OpenAIGPT-5.5 Instant 开始在 ChatGPT 中逐步推出。 这是一次重大升级,它能以更温暖、更自然的语气,为你提供更智能、更清晰、更个性化的回答。 同时它也更加简洁——我们听到了大家的诉求。我们相信你会喜欢与它聊天。
推荐理由:ChatGPT终于迎来一次真正的代际升级,GPT-5.5 Instant把聪明和人性化揉在一起,而且更简洁了,之前那些因为啰嗦被嫌弃的对话可以翻篇了。
Elon Musk@elonmusk精选AI 评分8383引用xAI@xaiGrok 4.3 现已上线 xAI API。这是迄今为止我们最快、最智能的模型。 它在 @ArtificialAnlys 的智能体工具调用和指令跟随排行榜上位居榜首,并且在 @ValsAI 的企业领域(如判例法和公司金融)中排名第一。 Grok 4.3 支持 100 万模型 token 的上下文窗口,定价为每百万输入 token 1.25 美元,每百万输出 token 2.50 美元。 创建 API 密钥并开始构建:http://console.x.ai/team/default/api-keys
推荐理由:Grok 4.3 把 agentic tool calling 和指令遵循两个榜单压在脚下,百万上下文配上亲民价格,对做自动化 agent 的团队是个够分量的信号。
TestingCatalog News 🗞@testingcatalog精选AI 评分7777
引用OpenAI@OpenAIGPT-5.5 Instant 开始在 ChatGPT 中逐步推出。 这是一次重大升级,它能以更温暖、更自然的语气,为你提供更智能、更清晰、更个性化的回答。 同时它也更加简洁——我们听到了大家的诉求。我们相信你会喜欢与它聊天。
推荐理由:GPT-5.5 Instant这版从语气到长度都在优化,免费用户终于能摸到GPT-5.5的门槛了,实际体验可能会比参数更重要。
Sam Altman@sama精选AI 评分6969引用Eric@ericmitchellai很高兴地宣布,我们今天正在更新 ChatGPT 的默认模型! 5.5 instant 在智力水平、图像感知和事实准确性方面有了大幅提升。 同时,写作风格也进行了更新,变得更加简洁直接。 你的愿望清单上还有哪些内容?
推荐理由:ChatGPT 默认模型悄悄换上了 5.5 instant,图像感知和事实性提升明显,写作风格也更直接,每天用它的人今天会感觉到差异,不是小修小补。
OpenAI:官网动态(RSS · 排除企业/客户案例)精选AI 评分7575 GPT-5.5 Instant 系统卡片
OpenAI 于2026年5月5日发布了最新即时模型 GPT-5.5 Instant。该模型在网络安全、生物与化学防范两个类别首次被定位为“高能力”级别,并为此实施了相应的安全防护措施。其整体安全缓解方案与此系列前代模型相似。官方明确,不存在名为 GPT-5.4 Instant 的模型,其主要对标基线是 GPT-5.3 Instant。为避免混淆,GPT-5.5 模型被特指为 GPT-5.5 Thinking。
推荐理由:GPT-5.5 Instant 是第一个被 OpenAI 标记为「高能力」的 Instant 模型,安全评估里多了些新门槛,做 AI 安全的可以翻开系统卡看看具体红线画在哪。