AI助力美国产水泥与混凝土
Meta发布了名为贝叶斯优化的新AI模型,用于设计混凝土配比。该模型旨在帮助建筑行业生产更高质量、更可持续的混凝土混合物,并特别聚焦于美国本土生产的产品。此次发布与2026年美国混凝土学会春季大会同步进行,是Meta长期路线图的一部分,旨在推动建筑业利用人工智能优化材料性能与环保指标。
推荐理由:Meta 将 AI 应用于传统建筑行业,展示垂直领域落地案例,启发其他行业探索 AI 应用。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Meta发布了名为贝叶斯优化的新AI模型,用于设计混凝土配比。该模型旨在帮助建筑行业生产更高质量、更可持续的混凝土混合物,并特别聚焦于美国本土生产的产品。此次发布与2026年美国混凝土学会春季大会同步进行,是Meta长期路线图的一部分,旨在推动建筑业利用人工智能优化材料性能与环保指标。
推荐理由:Meta 将 AI 应用于传统建筑行业,展示垂直领域落地案例,启发其他行业探索 AI 应用。
美团 LongCat 团队开源的扩散式 TTS 模型摒弃传统的 mel-spectrogram 中间表示,直接在波形潜空间操作,仅通过 Wav-VAE 与扩散骨干网络即可合成语音。该模型修复了训练-推理不匹配问题,并以自适应投影引导替代无分类器引导。最大版本 3.5B 在 Seed 基准实现 SOTA 零样本语音克隆,说话人相似度(SIM)在 Seed-ZH 达 0.818、Seed-Hard 达 0.797,超越此前最优的 Seed-TTS。研究还发现 Wav-VAE 的重建保真度与最终合成质量并非正相关。
推荐理由:美团开源 1B 语音克隆模型,Seed 基准超 Seed-TTS,零样本推理可用
Qwen Studio 发布,集成聊天机器人、图像视频理解、图像生成、文档处理、网页搜索、工具使用及 Artifacts 功能,提供全模态 AI 一站式解决方案。
推荐理由:阿里发布Qwen3.5-Omni多模态模型,迈向原生全模态AGI
欢迎 Gemini 3.1 Flash Live。🗣️ 我们最新的音频模型带来了更自然的对话体验,并改进了函数调用——使其更加实用且信息更丰富。以下是新功能介绍 🧵
推荐理由:Google发布Gemini 3.1 Flash Live,支持低延迟语音交互与Agent构建
Gemini 3.1 Flash Live 音频模型发布,支持更自然的实时对话,函数调用能力改进,使 AI 助手更实用、信息获取更充分。
推荐理由:Google发布Gemini 3.1 Flash Live音频模型,支持更自然对话与函数调用
推荐理由:Google 发布 Gemini 3.1 Flash Live 语音模型,实时 API 已开放试用
Gemini 3.1 Flash Live 已上线 Google 全系产品,提供更自然、可靠的实时音频 AI 交互能力。
推荐理由:Google发布Gemini 3.1 Flash Live,提升音频AI自然度与可靠性


推荐理由:OpenAI 发布 GPT-5.4 mini/nano,性价比突出且评测数据详实,nano 性能超越同级竞品。
Cohere 发布开源 ASR 模型 Cohere Transcribe,基于 Conformer 编码器-解码器架构,参数量 2B,支持英语、法语、中文、日语、阿拉伯语等 14 种语言,采用 Apache 2.0 许可证。
推荐理由:原文给出了模型规格、WER 数据和推理吞吐表现,读者可以据此评估它在语音识别工作流中的实际可用性。
Lyria 3 音乐生成模型现已开放付费预览,开发者可通过 Gemini API 调用,或在 Google AI Studio 免费测试。
推荐理由:Google 发布音乐生成模型 Lyria 3,现可通过 Gemini API 和 AI Studio 体验
Mistral AI 发布 4B 参数文本转语音模型 Voxtral TTS,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语 9 种语言。
推荐理由:官方公布了模型架构、延迟数据和与 ElevenLabs 的人类评测对比,可据此评估其在语音智能体场景的适用性。


推荐理由:Mistral 开源 Small 4,支持混合推理与多模态,Agent 任务表现大幅提升
我们的新图像生成器 MAI-Image-2 发布了!现已在 MAI Playground 上线,从逼真的写实效果到详细的资讯图,样样都能胜任。 我们团队为这次发布付出了巨大的努力,现在我们已跻身顶尖模型之列:在 @arena 上排名第 3 的模型家族。 详情请见我们的博客:https://microsoft.ai/news/introducing-MAI-Image-2/ 它即将登陆 Copilot 和 Bing Image Creator,以及 Microsoft Foundry。 真的为我们模型和产品上的进展感到自豪——敬请期待新发布,并加入我们的超级智能使命!
推荐理由:微软 CEO 宣布 Superintelligence 团队新图像模型 MAI-Image-2 发布,竞技场排名第三
Composer 2 登陆 Cursor,定价 $0.50/M(输入)和 $2.50/M(输出),Terminal-Bench 2.0 得分 61.3,SWE-bench Multilingual 达 73.7,显著优于前代。支持数百步长周期编码任务,团队同步发布训练技术报告。
推荐理由:Cursor发布Composer 2编程Agent,性能大幅提升且定价极具竞争力
Qwen3.5-Max-Preview 已登陆 LMSYS Chatbot Arena。Qwen Studio 提供聊天机器人、图像与视频理解、图像生成、文档处理、网页搜索、工具调用及 artifacts 等全栈功能。
推荐理由:阿里 Qwen3.5-Max 预览版上线 Arena,支持多模态理解与工具调用
推荐理由:AI视频生成速度突破实时阈值,单GPU秒级出片可直接上手体验
GPT-5.4 mini 现已登陆 ChatGPT、Codex 和 API。 针对编程、计算机使用、多模态理解和子智能体进行了优化。而且它的速度是 GPT-5 mini 的 2 倍。 https://openai.com/index/introducing-gpt-5-4-mini-and-nano/ https://t.co/sirArgn37L
推荐理由:OpenAI 发布 GPT-5.4 mini,针对编码和 Agent 优化且速度翻倍
GPT-5.4 mini 今日在 ChatGPT、Codex 和 API 中可用。针对编程、计算机使用、多模态理解和子代理场景优化,推理速度比 GPT-5 mini 快 2 倍。
推荐理由:OpenAI 发布 GPT-5.4 mini,支持子代理且速度翻倍
M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了“分析-修改-评估”的自主迭代优化循环,在内部评估中提升了性能。
推荐理由:MiniMax M2.7 让模型参与自身进化,在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平,Agent Teams 设计也值得看,但整体仍是追赶者姿态。
H公司发布了多模态计算机使用模型Holotron-12B。该模型基于NVIDIA开源的Nemotron-Nano-12B-VL模型,使用专有数据混合进行训练,专注于在交互环境中高效感知、决策和行动。其采用混合状态空间模型与注意力机制架构,在单张H100 GPU上实现了比前代Holo2-8B高2倍以上的吞吐量,在100并发基准测试中达到每秒8900个token。在WebVoyager基准测试中,性能从基线的35.1%提升至80.5%,在定位和导航基准上也显著提升。模型已通过NVIDIA开放模型许可在Hugging Face发布。
推荐理由:高效推理的计算机使用代理模型,适合生产部署,开发者可直接试用。