跳到正文
北京时间

全部动态

今日 39 条
9月5日周六
  1. IT之家(RSS)83

    奥尔特曼致歉 GPT-6 Astra 发布混乱,现已面向所有 Plus / Pro 等用户推出

    OpenAI 于 9 月 3 日上线 GPT-6 Astra,称其在电脑使用、浏览、软件工程、科学和专业工作方面达到最先进性能。因企业安全客户先于 Pro 订阅者获得访问权限引发高价 Pro 用户不满,CEO 奥尔特曼 9 月 4 日在 X 平台致歉,并提出补偿机制:从 9 月 4 日起付费用户每缺少一天 Astra 访问即获得一次额度重置。

    推荐理由:原文梳理了 GPT-6 Astra 发布混乱的经过、用户不满与补偿机制,可借此了解大模型分阶段发布中的次序争议。

  2. X:Sam Altman (@sama)80

    GPT-6 Astra 开始向 Plus 和 Business 用户推出

    Sam Altman 宣布 GPT-6 Astra 现已向所有 Plus 和 Business 用户推出。此前该模型已面向 Pro、Enterprise 和 Business Premium 用户在 Work/Codex 及 API 中提供。

    推荐理由:原文确认 GPT-6 Astra 的用户覆盖范围扩大到 Plus 和 Business,读者可以据此判断自己的可用入口和时间点。

  3. X:OpenAI (@OpenAI)82

    OpenAI 发布 GPT-6 Astra,面向 Pro、Enterprise 和 Business Premium 用户开放

    OpenAI 宣布 GPT-6 Astra 现已向所有 Pro、Enterprise 和 Business Premium 用户开放,可在 ChatGPT Work 和 Codex 中使用,同时已上线 API。Plus 和 Business 用户的推送可能需要几天时间。

    推荐理由:官方宣布 GPT-6 Astra 上线范围与渠道,Plus 和 Business 用户还需等待几天,读者可据此确认自己能否用上。

  4. Microsoft AI:官方博客(网页)63

    Microsoft 发布 MAI-Image-2.6 与 MAI-Image-2.6-Flash 图像模型

    Microsoft 于 9 月 4 日发布 MAI-Image-2.6,称其为迄今最强的图像模型,并面向开发者上线 Microsoft Foundry,同时推出面向低延迟、高吞吐场景的 MAI-Image-2.6-Flash。

    推荐理由:原文给出排名、速度和效率数字,并说明两个版本分别面向精度与吞吐的不同场景,便于开发者按工作流选型。

9月4日周五
  1. X:Satya Nadella (@satyanadella)63

    GPT-6 Astra 上线 Microsoft Foundry,早期客户已在 Azure 上使用

    Satya Nadella 发文表示,早期客户已开始使用 Azure 上的 Astra。GPT-6 Astra 现已通过 Microsoft Foundry 提供,详情见 Azure 官方博客 https://azure.microsoft.com/en-us/blog/gpt-6-astra-frontier-intelligence-for-work-now-available-in-microsoft-foundry/。

    推荐理由:Satya Nadella 确认 GPT-6 Astra 已在 Microsoft Foundry 开放,早期客户已可在 Azure 上使用。

  2. X:Greg Brockman (@gdb)72

    Greg Brockman 转发:GPT-6 Astra 在 ARC-AGI-3 达到 SOTA,基准趋于饱和

    Greg Brockman 转发 @arcprize 的评测称 OpenAI 的 GPT-6 Astra 在 ARC-AGI-3 上取得 SOTA,他称该基准已饱和。Astra 标准 harness 得分 63%,经新的 Provider Adapter harness 达 99%,在 96% 的 ARC-AGI-3 关卡上超越人类表现;排行榜图还显示更高推理层级通常成本更低,因为 Astra 用更少动作通关,减少模型调用和 token 数。

    推荐理由:转发 ARC Prize 对 GPT-6 Astra 的评测数据,标准与 Provider Adapter 两种 harness 分差大,可据此了解 harness 对得分的影响。

  3. X:Aravind Srinivas(Perplexity CEO) (@AravSrinivas)70

    Perplexity 宣布将接入 OpenAI GPT-6 Astra,称其在 WANDR 评测中居首

    Perplexity CEO Aravind Srinivas 祝贺 OpenAI 发布 GPT-6 Astra,称其在宽度和深度研究任务上远超其他模型且更具成本效益,将很快向 Perplexity Computer 的 Pro 和 Max 用户开放。

    推荐理由:Perplexity CEO 确认 GPT-6 Astra 在其评测中领先,并宣布将向 Pro 和 Max 用户开放。

  4. OpenAI:官网动态(RSS · 排除企业/客户案例)81

    OpenAI 发布 GPT-6 Astra 并公布安全概览,称其网络安全能力达到 Preparedness Framework 的 Critical 级

    OpenAI 发布 GPT-6 Astra,称这是其部署过的最强模型,也是首个在其 Preparedness Framework 下达到网络安全能力 Critical 级的模型,可在无人逐步引导的情况下发现未知安全漏洞并开发利用方式。

    推荐理由:OpenAI 官方发布的安全评估,给出模型在网络安全能力、对齐和可监测性上的具体发现,读者可借此了解前沿模型安全实践的最新变化。

  5. Hacker News 热门(buzzing.cc 中文翻译)78

    IFM 发布 K2 Horizon 六款开源模型,覆盖 0.9B 到 375B-A23B 并开放完整训练生命周期

    IFM 发布 K2 Horizon 模型系列,共六个模型:375B-A23B、36B-A4B、32B、7B、3.7B 和 0.9B,均以 Apache 2.0 开源,其中 0.9B、3.7B 和 7B 宣称在其规模上达到 SOTA,36B-A4B 采用新提出的稀疏注意力架构 MoVA。

    推荐理由:原文在发布模型之外还放出从预训练到智能体后训练的全流程产物,研究者可以据此复现和改造整套训练方法。

  6. TechCrunch:AI(RSS)81

    OpenAI 发布新模型 Astra,主打计算机与浏览器操作但因 opaque recurrence 引发争议

    OpenAI 发布最新模型 Astra,称其为迄今最强大模型,主打计算机和浏览器操作,先面向 Daybreak 网络安全计划客户开放,随后一周内覆盖 Pro、Plus、Enterprise、Business 付费账户及 API。

    推荐理由:原文梳理了 Astra 的能力主张、发布节奏,以及 opaque recurrence 引发的可监控性争议,信息较为完整。

9月3日周四
  1. Microsoft AI:官方博客(网页)64

    Microsoft AI 发布语音识别模型 MAI-Transcribe-2

    Microsoft AI 发布转录模型 MAI-Transcribe-2,称其在 FLEURS 基准 60 种语言上平均词错率 5.2% 排名第一,并占据 Artificial Analysis 准确率-延迟 Pareto 前沿。

    推荐理由:官方给出具体基准排名、对比速度倍数和定价,读者可以据此评估它对现有语音转写方案的可替换性。

  2. Google DeepMind:Blog(RSS)70

    Google DeepMind 发布 WeatherNext 3 全球天气 AI 模型, hourly 更新且分辨率较上一代提升约 5 倍

    Google DeepMind 与 Google Research 发布 WeatherNext 3,称其为迄今最先进的全球天气 AI 模型,经 Brightband 独立实时评估。

    推荐理由:原文给出分辨率、卫星数据接入和降水精度的具体数字,并说明在 Google 产品和 Cloud 中的获取方式,读者可评估其实际用途。

  3. X:Sundar Pichai (@sundarpichai)65

    Google 发布 Gemini 3.8 Flash,称在 DeepSWE v1.1 上超越多数更大前沿模型

    Google 发布 Gemini 3.8 Flash,为 6 周内第 3 次 Flash 更新。官方称相较 3.7 Flash 在软件工程、智能体任务和多步推理上有显著提升,在 DeepSWE v1.1 上以更低成本自主端到端解决复杂工程问题,表现超越多数更大的前沿模型。图中基准显示其 Terminal-bench 2.1 得 89.4%、HLE-Verified 得 54.9%,输入价格 $0.75/1M tokens、输出 $3.75/1M tokens,为 2026 年 12 月 31 日前 introductory 价。详情见 https://blog.google/innovation-and-ai/models-and-research/gemini-models/3-8-flash-and-3-8-flash-cyber/

    推荐理由:原文给出模型能力变化、定价和多项基准对比,读者可据此评估它相对更大模型的性价比与适用场景。

9月2日周三
  1. Anthropic:Newsroom(网页)87

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1 和 Claude Mythos 5.1,两者为同一模型但安全防护级别不同,Mythos 5.1 仅通过可信访问计划提供给网络安全和生命科学领域的受审机构。

    推荐理由:官方发布给出了定价变化、基准数据和科学应用实例,读者可以据此评估新模型在编码与科研场景中的成本与能力取舍。

  2. X:通义千问 / Qwen (@Alibaba_Qwen)69

    Qwen3.8-Max-0902 登顶 Code Arena 并以 $5/MToken 领跑 Pareto 前沿

    通义千问发布 Qwen3.8-Max-0902,在 Code Arena: WebDev 以 1,691 分首次亮相即排名总榜第一,并以混合价 $5/MToken 成为 Pareto 前沿上得分最高的模型,现已可在 QwenCloud 试用。

    推荐理由:官方发布自家新模型并给出 Arena 排名与价格数据,读者可据此比较其在编码场景的性价比位置。

  3. OpenAI:官网动态(RSS · 排除企业/客户案例)82

    OpenAI 评定 Astra 达到网络安全 Critical 能力阈值,将受限发布

    OpenAI 宣布 Astra 在其 Preparedness Framework 下达到 Critical 网络安全能力阈值,是首个被评定为该级别的模型,可在少人干预下发现未知漏洞并构建利用链。

    推荐理由:OpenAI 说明了把 Astra 评为 Critical 网络安全能力的评估依据、对应的安全防护设计和受限开放安排,有助于读者理解前沿模型能力分级与放行逻辑。

  4. Claude Platform:开发者版本说明(RSS)72

    Anthropic 发布 Claude Fable 5.1 与 Claude Mythos 5.1

    Anthropic 发布 Claude Fable 5.1(claude-fable-5-1),面向长时间运行的智能体编码、知识工作与研究,Claude Mythos 5.1 面向 Project Glasswing 参与者。

    推荐理由:官方版本说明给出定价、缓存和 API 兼容性变化,开发者可据此评估迁移成本与新特性用法。

  5. Artificial Analysis 完整文章(网页)66

    Google 发布 Gemini 3.8 Flash,四个月内第四款 Flash 模型

    Google DeepMind 发布 Gemini 3.8 Flash,在 Artificial Analysis Intelligence Index 上以 high 推理得分 59,较 Gemini 3.7 Flash 提升 3 分。

    推荐理由:评测方一手数据给出了智能指数、单任务成本和速度的具体变化,可帮助读者判断该模型在实际任务中的性价比。

  6. Artificial Analysis 完整文章(网页)74

    Meta 发布 Muse Spark 1.3,Artificial Analysis 指数达 61/62 分逼近前沿

    Meta 发布 Muse Spark 1.3,是其五个月内第四个 Muse Spark 版本。xhigh 版在 Artificial Analysis Intelligence Index 得 61 分。

    推荐理由:独立评测方给出与同档模型的分数和单任务成本对比,读者可据此判断该模型在智能与成本上的位置。

9月1日周二
  1. 上海人工智能实验室 InternLM:原创项目63

    上海AI实验室发布 InternLumina-U2:16B-A1B 多码本扩散统一多模态模型

    上海AI实验室发布 InternLumina-U2,一个 16B 参数(激活 1B)的 MoE 扩散语言模型,用 8 码本全离散视觉表示统一覆盖文本问答、文生图、图像理解与编辑、视频及 3D 理解。

    推荐理由:原文给出多码本全离散统一架构的设计细节、基准分数和双硬件适配说明,读者可以了解统一理解与生成模型的一条新路线。

  2. Runway:News(网页)67

    Runway 发布 Interface World Models 首个模型 Solaris,实时逐帧生成可交互界面

    Runway 发布 Solaris,称其为新模型家族 Interface World Models 的第一个模型,由世界模型实时逐帧生成界面并对点击、拖拽等交互作出响应,无需代码等中间表示。

    推荐理由:官方完整披露了模型机制、用户研究和局限,读者可以据此理解去除中间表示后界面生成与智能体训练的路径。

8月31日周一
  1. IT之家(RSS)77

    DeepSeek-V4-Flash-Vision-Exp 模型已开源,多模态 Agent 能力接近 Opus-4.8

    DeepSeek 于 8 月 31 日在 Hugging Face 开源首个多模态模型 DeepSeek-V4-Flash-Vision-Exp,采用 MIT License,公开模型文件、Tokenizer、Prompt Encoding 参考实现及最小化 PyTorch 推理实现。

    推荐理由:原文梳理了模型开源内容与能力定位,读者可据此评估其在多模态 Agent 场景中的可用性。

8月29日周六
  1. IT之家(RSS)72

    智谱开源 GLM-5.3 模型权重,主打智能体编程与网络防御

    智谱宣布开源 GLM-5.3 模型权重,支持本地运行与个性化定制,擅长复杂编码、防御性网络安全及长程任务。该模型在 AA 综合智能指数中取得 60 分,与 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰同级,并与 Kimi K3 并列开源模型第一。仅年营业额超 100 亿美元的机构将其作为外部模型服务提供时才需安全审查。

    推荐理由:许可条款把强制安全审查限定在百亿美元级外部模型服务,自有部署和中小团队实际不受影响,开源可用性比表面限制更宽。

8月28日周五
  1. X:智谱 Z.ai (@Zai_org)65

    GLM-5.3 开源权重,智能体编码与网防最强

    GLM-5.3 现已开放权重。 我们最强大的智能体编码与网络防御模型,现已可供下载、运行和定制。 权重:https://huggingface.co/zai-org/GLM-5.3 技术博客:https://z.ai/blog/glm-5.3

    推荐理由:开放权重让需要私有化部署的编码智能体与安全防御场景可以直接下载、运行和定制模型,不再受闭源 API 限制。

  2. 公众号:腾讯混元82

    腾讯混元发布 Hy4 preview:770B 总参数、1M 上下文,开源上线

    腾讯混元发布新一代旗舰模型 Hy4 preview,总参数 770B、激活参数 49B、上下文长度 1M,现已开源并在腾讯云 TokenHub 和 OpenRouter 上线。

    推荐理由:官方盲测中它与 GLM-5.3、Kimi K3 的分差不足 0.1,选型时 1M 上下文和开源部署成本可能比榜单排名更实际。

  3. Midjourney:Updates(RSS)64

    Midjourney 开放 V8.2 图像编辑模型测试

    Midjourney 开始向所有用户开放其首个 V8.2 图像编辑模型的测试。该模型支持指令编辑、以图生图(最多同时引用 4 张参考图)、局部重绘与扩画,并兼容个性化、moodboards 和 srefs 功能。用户可通过网页端或 Discord 的 `--edit` 命令使用,官方同步更新了 midjourney.com 与 alpha.midjourney.com 的界面。

    推荐理由:这一版把图像引用数量从单参考提升到最多四张,做多素材融合时不必先拼接成单图再喂给模型,能减少中间步骤。

  4. Google DeepMind:Blog(RSS)70

    Gemini Omni 1.1 Flash 发布,为开发者提供更强生成式视频控制

    Google 推出 Gemini Omni 1.1 Flash,为开发者提供更强的生成式视频控制能力。新模型支持场景扩展(可分析最多 10 秒先前上下文,以 10 秒为增量累计延长至 40 秒)、指定首尾帧生成平滑过渡,以及 4K 高清输出。

    推荐理由:360p 预览的成本降到 720p 的三分之一并提速最多 60%,让视频生成的前期探索可以低成本多版本比较,改变的是创意工具迭代的节奏。

8月27日周四
  1. X:唐杰(@jietang)71

    唐杰宣布GLM-5.3 Flash AA登顶OpenRouter

    Ox Alpha = GLM-5.3 Flash AA = 57,以1/100的前沿价格, 由纯国产芯片驱动。在OpenRouter上实现了近20%的周token份额(第一)。 感谢大家的支持。

    推荐理由:OpenRouter 周 token 份额近两成说明开发者已在用真实调用投票,低价模型正从价格敏感场景切入,团队评估模型成本时会更多参考实际使用量而非榜单单项分。

  2. Google DeepMind:Blog(RSS)68

    Gemini 3.5 Transcribe 发布:面向实时语音交互的高精度语音转文本模型

    Google DeepMind 推出 Gemini 3.5 Transcribe 语音转文本模型,支持流式与非流式两种 API。据 Artificial Analysis 评测,其流式与非流式平均词错率分别为 4.0% 和 2.6%,支持超 85 种语言、自定义词汇及最多三人说话人识别。

    推荐理由:相较于上一代 Chirp 3,流式词错率降到 4.0% 且最终转录延迟改善 70%,会影响语音代理和实时字幕方案的成本与体验取舍。

8月26日周三
  1. X:Unsloth (@UnslothAI)81

    Unsloth 发布 Qwen3.8-Flash-Next GGUF,75GB 内存可本地运行

    Unsloth 推出 Qwen3.8-Flash-Next 的 GGUF 量化版本,称该 125B MoE 多模态模型性能超过 Claude-Opus-4.6 (Max),可在 75GB RAM 上本地运行,无需 GPU VRAM。

    推荐理由:原文给出了本地运行所需的内存档位与量化精度权衡,读者可据此判断自己的设备能否跑动这个 MoE 模型。

  2. X:通义千问 / Qwen (@Alibaba_Qwen)84

    Qwen3.8-Flash 开源,Qwen4 架构预览

    通义千问发布 Qwen3.8-Flash,一款多模态 MoE 模型,作为 Qwen4 架构的早期预览并开放权重。该模型总参数 125B,每 token 仅激活 6B,训练成本仅为 Qwen3.7-Plus 的 1/9,性能全面超越后者。生产版 API 定价 $0.16/1M 输入 tokens 和 $0.47/1M 输出 tokens,原生上下文 262K,可扩展至 1M。

    推荐理由:训练成本降到前代的九分之一,同时编码和办公任务基准分数更高,对成本敏感的 API 调用场景提供了一个新的权衡参考点。

  3. Qwen:Blog Retrieval(API)83

    Qwen3.8-Flash-Next 开源:Qwen4 架构早期预览

    通义千问开源 Qwen3.8-Flash-Next,一款多模态 MoE 模型,也是 Qwen4 架构的早期预览。该模型采用 GDN + QSA 混合注意力等四项升级,总参数 125B,每 token 激活 6B,训练成本约为 Qwen3.7-Plus 的 1/9,编码与办公任务能力更强。

    推荐理由:这次提前开放 Qwen4 架构权重,关键在于 QSA 稀疏注意力与 N-gram 查表参数同时降低长上下文成本、扩大容量,为评估下一代模型提供早期样本。

  4. 公众号:腾讯混元67

    腾讯混元将端侧翻译模型 Hy-MT2-1.8B 压缩至 440MB,已落地哔哩哔哩直播弹幕翻译

    腾讯混元将端侧翻译模型 Hy-MT2-1.8B 通过 2-bit 与 1.25-bit 量化方案压缩至 574MB 和 440MB,翻译质量几乎无损,在 FLORES-200 上优于 Microsoft Translator 等商业 API。该模型已联合英特尔完成 x86 适配,并在哔哩哔哩直播弹幕实时翻译中落地,单条弹幕翻译耗时 500~800ms。

    推荐理由:相比精度数字,这套量化给出 x86 优化和直播弹幕实测数据,让端侧替代云翻译 API 的成本与隐私权衡有了可对照的工程基线。

  5. X:Google AI (@GoogleAI)73

    WeatherNext 预测气旋:提前五天预警五级飓风

    Google AI 发布 WeatherNext 气旋预测模型,可同时预测风暴路径、强度和规模,比现有系统多提供一整天的预警时间。该模型在 2025 飓风季实战测试中,提前五天预测飓风 Melissa 在牙买加的五级登陆,系美国国家飓风中心首次实时使用 AI 模型。模型单场风暴可生成多达 1000 次模拟,代码与权重已开源。

    推荐理由:把路径、强度和尺度放进同一模型,省去过去切换全球与区域模型的步骤,对需要快速判断登陆风险的预报流程是种简化。

8月25日周二
  1. OpenAI:官网动态(RSS · 排除企业/客户案例)59

    GPT-5.6 登陆 Kiro,为开发者提升性价比

    GPT-5.6 模型家族现已登陆软件开发智能体 Kiro,包含 Sol、Terra 和 Luna 三款模型。在 Terminal-Bench 2.1 测试中,GPT-5.6 Terra 在 Kiro 内完成任务成本降低约 82%。该更新由 OpenAI 与 AWS 合作优化,旨在以更少迭代和更高 token 价值帮助开发者产出更高质量的代码。

    推荐理由:在 Terminal-Bench 2.1 上,GPT‑5.6 Terra 在 Kiro 中完成任务的成本约下降 82%,为长周期编码任务的投入产出评估提供了一个量化基准。

8月22日周六
  1. FireRedTeam:原创语音与多模态项目64

    FireRedTeam 开源 FireRedAudio 9B 通用音频语言模型

    FireRedTeam 发布 FireRedAudio 的代码与模型,一个基于 9B 参数 LLM 的通用音频语言模型,采用理解与生成解耦的连续表征设计。单模型支持 ASR、音频理解、零样本 TTS、指令 TTS、语义与声学语音编辑,以及最长一小时录音的时序定位理解,在 MMAU、Seed-TTS-Eval 等基准上取得竞争性或领先结果。

    推荐理由:官方发布了代码和权重,读者可以据此了解用一个 9B 骨干同时覆盖语音理解与生成的解耦表征设计。