Qwen3.8-Max 发布:开源最强编码与协作模型,2.4T 参数
Qwen3.8-Max: A New Bar for Coding and Cowork
Qwen 正式发布 Qwen3.8-Max,这是 Qwen 家族迄今最强的模型,拥有 2.4T 参数(95B 激活),并首次开源 Qwen-Max 级权重,开放权重将于下周发布。
首次将 Max 级模型权重开源,为开源社区提供比肩闭源旗舰的能力,但实际效果需待下周权重放出后由社区验证。
今天,我们正式发布 Qwen 3.8-Max,这是 Qwen 家族迄今为止能力最强的模型。这也标志着我们首次开源 Qwen-Max 级别模型的权重——开放权重将于下周发布。Qwen 3.8-Max 基于 Qwen 3.5 的架构基础构建,规模扩展至 2.4 trillion 参数,在编程、工作、研究和长周期任务方面实现全面改进。它不仅能回答更具挑战性的问题,还能以更高的可靠性端到端完成复杂任务,产出可信赖的交付成果。
Qwen3.8-Max——现已通过 QwenCloud 提供:
- 2.4T 参数(95B 激活),开放权重将于下周发布
- 在编程、工作、研究和长周期任务方面实现全面改进
- 端到端且可靠地交付复杂任务
通过 QwenCloud 上的 API 调用。

编程#
对于顶级模型而言,如今的编程远不止按需编写一个函数——它意味着能够独立地将一个真实的、耗时多日的项目从空文件夹一路推进到最终完成。我们在三个此类挑战上测试了 Qwen3.8-Max,其中每一个结果都必须通过实际编写和运行代码来赢得,完全没有任何人类帮助。一条线索贯穿这三项挑战:Qwen3.8-Max 不只是遵循固定计划——它通过反馈循环自我进化,无论是构建一个能自我升级的测试框架、在一次又一次实验中改进研究方法,还是一次又一次提交中攀登竞赛排行榜。
10 天以上的自主编程:构建自我进化的测试框架#
在这个案例中,Qwen3.8-Max 被要求从零开始创建 oh-my-cli 项目,并在一次超过 10 天的长时程自主编程运行中,构建一个自我进化的测试框架。它将用户反馈、先进的社区实践以及模型自身的自测结果整合到一个工程循环中:需求被规范化为 issue,由智能体自动认领并执行,并通过代码、测试、预览和日志持续迭代。完整的项目轨迹已在 GitHub 仓库 qwen-code-dev-bot/oh-my-cli 中公开。
自主编程测试框架的关键实现细节:
- 循环工程设置:任务状态、调度与恢复。 Qwen3.8-Max 将 issue 状态机、调度器、监控器和看门狗整合为一个执行循环:新需求进入 GitHub Issues 后,智能体通过状态机认领该需求,并依次经过
ready → leased → active;一旦实现完成,便触发 E2E 测试和 CI 检查,通过后合并 PR。 - 自测试:产品自测试与维护。 每次更新后,模型会触发 Build、Unit Test、E2E 和 Desktop Lifecycle 验证;异常状态会被路由回相关的 issue / PR 进行修复并重新验证。
- 多源演进:产品从多种需求信号中升级。通过将社区经验以及用户 / 开发者反馈转化为可执行的工作,harness 持续演进
/goal、/resume、Dynamic Workflow、Session Replay、Desktop 等能力。
截至 2026 年 7 月 30 日,在约 16 天的全自主 AI 运行之后,该仓库已累计 265 次提交、127 个 PR 和 151 个 issue,展现出持续演进的自主编码能力。
视频 1。在一次持续 10 天以上的长时程自主编码运行中,Qwen3.8-Max 自主构建了一个可自我演进的 harness,持续完成社区需求收集、issue 调度、代码生成、验证和自我修复。
复现一篇研究论文——然后改进它#
我们把一篇近期的研究论文——“Unified Data Selection for LLM Reasoning”——交给 Qwen3.8-Max,并要求它:用代码复现论文的实验,然后尝试做得更好。这篇论文探讨的是 AI 训练中一个非常实际的问题:当你拥有的数据远超你负担得起的训练量时,究竟哪些样本值得保留?论文给出的答案是,要重视那些充满“困难决策点”的样本——也就是在一段解题过程中,模型确实不确定下一步该往哪个方向走的那些时刻。
问题在于:Qwen3.8-Max 的起点只有这篇论文和一组 GPU——没有起始代码,没有现成的流水线。数据处理脚本、训练代码、评估设置——它必须全部从零开始设计和编写,而这正是熟练工程师需要花上数天才能完成的那类工作。
在完全自主运行约五天(约 125 小时的持续工作)期间,Qwen3.8-Max 编写了大约7,600 行代码,执行了1,100 次操作,并运行了33 轮 GPU 训练。它首先花费约 37 小时从零重建了论文的完整流程,并复现了其六项主要发现——在它选定的数据上反复微调 Qwen3-8B 模型,并在高难度数学基准上确认了增益(例如,论文的筛选方法在 AIME24 上比随机挑选数据高出+7.7%)。
随后它更进一步,将复现转变为自我进化。在接下来的约 88 小时里,它运行了一个自我改进的研究循环——提出假设 → 编写代码 → 在 GPU 上运行 → 分析 → 再试一次——在四轮中自主提出并测试了18 个改进想法。每一轮的结果都会为下一轮的假设提供输入,通过诊断每次尝试失败的原因,它最终进化出一种新方法,超越了论文自身的方法,在竞赛级数学基准 AIME24 上取得了+2.7 分的提升。
改进搜索的展开过程——4 轮,18 个想法
| 轮次 | 该轮最佳想法 | 得分(AIME24) | 相比基线的提升 |
|---|---|---|---|
| — | 论文方法,复现(基线) | 49.58% | — |
| 1 | 在选择前按难度划分数据 | 50.42% | +0.84 |
| 2 | 按熵–分数差距对样本加权 | 51.67% | +2.09 |
| 3 | 调整选择宽度 | 51.25% | +1.67 |
| 4 | 统计困难决策点(“nhighgate”) ★ | 52.29% | +2.71 |
24 小时内击败数百支人类团队#
接下来,我们将 Qwen3.8-Max 投入了一场真实的线上竞赛——WWW2025 多模态对话意图识别挑战赛,该赛事由阿里云天池平台主办,共有526 支人类团队参与角逐。任务要求:阅读客服对话——包括文本和截图——并准确判断客户想要什么。
完全自主运行,并在严格的24 小时时限内,Qwen3.8-Max 阅读了竞赛规则并用代码构建了一套完整方案。在文本方面,它微调并集成了多个中文语言模型——BERT、MacBERT 和 RoBERTa;对于产品截图,它微调了一个视觉语言模型 Qwen2.5-VL-7B,并由一个 Chinese-CLIP 模型为其主模型不确定的图像提供支持。随后,它将所有模型融合为一个加权投票系统,通过交叉验证校准每个模型投票的权重,并加入额外的图像投票者来打破平局。在45 次提交中——每一轮的反馈都引导下一轮的微调和重新加权——其准确率从0.60 稳步攀升至最终的 0.853,击败了526 支人类团队中的 458 支(占参赛队伍的 87%)。
这三个案例共同展现了 Qwen3.8-Max 的突出之处:它能够连续数天专注于一个艰难且开放的目标,提出自己的想法,并将其转化为可用的成果——全程无需人类介入。
工作#
除了编程之外,实际工作——那些几乎每个职业的日常工作中都充斥着的杂乱、多步骤、重度依赖工具的任务——是前沿模型创造巨大经济价值的另一条主要赛道。因此,让 Qwen3.8-Max 在这些工作流中具备广泛的能力和可靠的稳健性,是我们使命的核心。
扩展真实世界 RL 系统。通过联合扩展 RL 环境与算力,我们在多个主流 harness(QwenWork / Claude Code / Codex / OpenClaw / Hermes)上一致地提升了通用工作能力。实现这一点需要解决三个相互耦合的挑战:
持续扩展解耦的真实环境,沿相互独立的轴线推进——任务(单任务 → 多任务 → 多天)、工作区(多文件 → 层级文件夹 → 复杂异构文件夹)以及 Harness(类别、版本、技能)——从而使环境增长以组合方式复利叠加,而无需定制化集成。
一个通用奖励系统,将异构验证内化——涵盖基于执行的检查、对文本与渲染视觉输出的评分标准条件化裁定,以及智能体式审查——并置于可自动扩展的评分标准之下。通过将这些模态统一在一个奖励系统之内,它在所有环境中提供了一致且可靠的奖励来源,消除了维护任务专用验证器所固有的不一致性。
一个在线数据均衡器,它塑造每一个批次,使其在任务、难度、工作区和 harness 上的分布保持高度均衡,抑制批次间梯度方差,从而维持 RL 算力稳定、持续的扩展。
这些因素共同提供了广度、可靠的奖励信号与稳定性——将环境与算力的联合扩展转化为真实世界工作能力上可量化的横向提升。

图 1. 随着 RL 训练持续扩展,Qwen3.8-Max 在数十项内部与公开工作基准上展现出稳定且一致的提升。

图 2. Qwen3.8-Max 在多种 harness 上取得了相当的性能表现,包括 QwenWork、Claude Code、Codex、OpenClaw 和 Hermes。
测试广度的工作能力,跨越数百个高价值职业#
随着前沿模型在经济有价值的工作中承担起日益广泛的角色,我们对 Qwen3.8-Max 在真实工作流中交付生产级结果的能力广度进行了压力测试——覆盖了横跨数百个高经济价值职业的高频任务。以下是几个具有代表性的展示:
- 企业合规顾问— Qwen3.8-Max 浮现1,284 条相关条款横跨一个语料库,包含数百份文档仅需一次处理,即可完成全部审查,用时不到一小时。此类审查通常需要一个律师助理团队协作约一周.
- UI/UX 设计师 — Qwen3.8-Max 为数字银行应用 NOVA 生成了一个高保真、可交互的原型 — 8 个页面,具备一致的设计系统,一次成型,零轮人工修改,而传统工作流程需要 3–5 轮修改。
- 餐饮品牌创始人 — Qwen3.8-Max 通读了一百多份食材供应简报,一次性产出了一份完整的26 道菜的菜单。每道菜都标注了平均热量值和食材来源,食材成本率控制在 33.8%。这样的菜单开发通常需要一名主厨和运营团队花费数周时间反复进行配方测试、成本核算和优化。
- 结构工程师 — 仅凭一套图纸,Qwen3.8-Max 就在浏览器中重建了一栋 30 层办公大楼的抗震结构模型,自振周期、基底剪力和层间位移角均可悬停实时查看。在传统工作流程中,工程师需要在专业建模软件中手动搭建模型,通常需要一周以上。
- 康复治疗师 — Qwen3.8-Max 将一份2D 纸质评估表转化为一个3D 交互式演示,支持自由旋转视角和逐层解剖叠加,让患者能够清楚看到损伤所在位置以及康复进展——这项工作此前外包给医疗动画工作室,需要2–4 周的交付周期和数千美元的成本。
- 体育数据分析师 — Qwen3.8-Max 将每位球员约 8,400 个进攻/防守回合解析为可直接使用的球员战术画像和教练报告,耗时仅数十分钟。传统分析团队则需要手动完成战术分割、因果归因和报告撰写——这一过程通常需要数个工作日。
视频 1。在数百个高价值职业中,Qwen3.8-Max 在实际工作流程中可量化地提升人类生产力——展示了其工作能力的广度。
在单次会话中构建可盈利的端到端量化策略#
凭借其 Dynamic Workflows 构建能力,Qwen3.8-Max 以程序化方式驱动任务规划,并精准编排大规模子智能体系统——将单次对话转化为端到端的自动化量化研究闭环。
深度——端到端 ETF 轮动策略研发。从一行任务描述出发,Qwen3.8-Max 自主规划出一套复杂的动态工作流,并持续工作 数小时,交付了一套完整的 ETF 轮动策略——构建数据系统、构造基础因子,并编排多轮贪婪迭代,全程动态分析回测并修正方向。在整个过程中,它 依据证据行动,而非遵循固定脚本:
- 当它观察到设计期指标与验证期指标之间出现不一致——这是典型的过拟合信号——它 自动触发剪枝,逐轮剔除冗余因子。
- 当它发现多条路径收敛到同一组核心信号时,它 加入了多种子联合验证,以消除路径依赖。
- 当它判断在小截面上三模型集成不如固定方向合成稳健时,它 自主切换到更合适的策略框架。
广度——大规模并行因子挖掘。因子研究涉及巨大的搜索空间,而传统工作流程仍是串行的。Qwen3.8-Max 将这一过程并行化:仅凭六段简短描述,涵盖动量、价值、质量、投资、低风险和情绪这些经典因子族,它便将每一段分解为50 个研究方向,调度了约 330 个子智能体,完成了约 6,000 次回测,并在运行过程中持续调整工作流程。最终筛选出的因子实现了0.64–1.48 的超额夏普比率,IC 全部为正,范围在0.010 至 0.014之间。
从连贯的单轨研发到对庞大假设空间的并行探索,Qwen3.8-Max 利用动态工作流程将编排逻辑固化为可复现的程序——把曾经需要研究人员数周到数月串行工作的量化研究,压缩为一个可扩展的自动化循环,并在单次对话中交付,展现了该模型在长时程自主工作方面的广泛潜力。
视频 2。Qwen3.8-Max 有望让每位普通人都能触及量化研究员的专业能力——展现其工作能力的深度。
长时程任务#
在处理高度复杂、长周期、多约束任务时,Qwen3.8-Max 展现出卓越的系统级自主规划能力和端到端闭环自适应学习能力。无论是在数字芯片设计中应对严苛的物理约束,还是在竞争激烈的战略商业模拟中,该模型都能通过“行动-反馈-迭代”循环,在数千轮交互中实现深度的算法与策略重构。
自主芯片设计与闭环反馈驱动的优化#
Qwen3.8-Max 已独立实现了整个硅设计流程的自主执行,涵盖逻辑重构、多约束优化以及物理布局生成。目标设计是一个GCD / RSA 密码硬件加速器,集成了模幂运算与模乘运算。该模块基于 GCD 数据通路和控制通路构建,是一个典型的结构紧凑但逻辑密集的数字电路。在随机化cocotb验证框架下,模型必须在 4 位、6 位、8 位和 16 位配置中保持位精确的功能正确性,同时最小化综合后的门数(Yosys 单元数)——这直接针对前端硬件设计中面积与正确性之间的经典权衡问题。面积性能基于 16 位(WIDTH = 16)配置进行评估。
Qwen3.8-Max 在一个沙箱环境中优化了这一设计,该环境集成了仿真(Iverilog)、综合(Yosys)和物理设计(OpenROAD)工具链。从最少的输入开始——一个基本任务描述、一个带有空模块模板的 RTL 工作区桩,以及一个用于验证和综合的评估脚本——Qwen3.8-Max 完全自主运行。在没有任何黄金参考设计或人工干预的情况下,该模型独立执行了从高层算法架构设计到 RTL 代码生成以及多轮迭代优化的整个流程。
在一次连续自主运行中,Qwen3.8-Max 在 13 个关键里程碑上完成了约 500 轮和 71 次评估,执行了设计的端到端重构。该模型自主管理 RTL 编辑、仿真调试、综合分析、冗余定位和迭代数据通路重新架构——从最初的 bug 修复推进到深层的算法级重写。虽然其首个功能可用的设计测得 8,298 个门,但 Qwen3.8-Max 将其降至 678 个门,在所有被评估模型中领先。这一轨迹表明,Qwen3.8-Max 即使在运行数百轮之后也能实现重大结构性突破,而不是在早期取得低垂果实后便停滞不前。
轨迹中的关键设计里程碑:(演化记录保留了每个阶段的完整电路拓扑和相应的代码 diff 细节)
- 算法重写:将取模除法器改为迭代式移位减法(8,298 → 2,010 个门,第 22 轮) 这是最大的一次优化步骤。Qwen3.8-Max 将
modular_multiplier中昂贵的 16 位硬件取模除法器替换为迭代式移位减法架构,一举削减了 6,288 个门——占总面积缩减量的 80% 以上。 - 冗余消除与位宽裁剪(2,010 → 1,304 个门,第 35–48 轮) 在识别出调用方的前置条件后,模型安全地绕过了整个
REDUCE阶段,将两个独立的归约模块合并为单个共享块,将输出路径优化为组合逻辑,并收窄了内部寄存器k_ff的位宽。 - 寄存器与控制 FSM 修剪(1,304 → 907 个门,第 60–113 轮) 模型移除了冗余的
base和mod寄存器以及k_nz触发器,为偶数引入了提前退出机制,利用减法器的最高有效位(MSB)作为比较器,并将 GCD 模块中独立的“先比较后相减”逻辑合并为单个可复用的减法器。 - 模块融合与逻辑共享(907 → 765 个门,第 170–252 轮) 模型打破了模块边界,将乘法器直接内联到模幂运算 有限状态机(FSM) 中,合并了三个子模块,并在全局共享单个减法器,从而消除了跨模块的冗余接口和重复逻辑。
- 门级精化(765 → 678 个门,第 443–500 轮) 利用共享 NOR 门树、绝对差减法拆分(abs-sub splitting)以及字节到位的选择逻辑等局部优化,模型挤出了最后一点门级冗余。
为了验证前端优化能否转化为物理实现,Qwen3.8-Max 使用 OpenROAD(Nangate45 PDK)对 RTL 设计运行了标准布局布线(PR)流程,以生成物理硅片版图。在物理版图表示中,每颗芯片展示了实际布线结果:标准单元布置在裸片的物理平面上,金属布线层堆叠于其上(每一层以颜色区分,并通过垂直通孔连接)。起始设计占用 106×106 µm² 的裸片,总连线长度为 33,369 µm,并存在严重的时序违规(负裕量为 -4.46 ns)。最终版图缩小至 46×46 µm² 的裸片,连线长度降至 4,187 µm,并成功在 500 MHz 下实现时序收敛(+0.66 ns 裕量)。这意味着物理裸片面积减少了 81%,证明高层前端架构优化可直接转化为高度紧凑、可布线且高性能的硅片实现。
这一案例凸显了 Qwen3.8-Max 作为自主长时程硬件智能体基础模型的两项关键能力:
- 长时程持续优化:模型在数百个复杂交互轮次中保持高度连贯、系统化的策略,深入推动算法级数据通路重写,而非停滞于表层语法调整。
- 反馈驱动的闭环改进:在缺乏先验参考设计的情况下,模型完全依赖“编辑—仿真—综合—布局”的反馈闭环来驱动优化。每一次设计迭代都通过自动化
cocotb功能测试进行严格验证,物理可行性则由 OpenROAD 后端验证全面保障。
长期运营中的持续学习#
E-Commerce Bench 是一个365 天长周期电商运营仿真基准,旨在评估大语言模型在持续运营场景中的商业决策能力。该基准基于淘宝和天猫真实脱敏交易数据构建,深度复现了一个由12 种店铺类型、60 个商品品类、近 600 家供应商和 7,000 件商品组成的复杂生态。模型获得 ¥100,000 起始资金,同时运营多家网店。在全年中,它必须应对季节性需求波动、突发环境事件,以及高度拟真的电商结算系统带来的现金流压力。模型必须自主完成全链路决策,包括选品、供应链谈判、库存管理、动态定价和退货处理,最终目标是在年末最大化总余额。这同时也考验模型全年的资金配置策略。它必须知道何时主动投入以换取增长。同样重要的是,它必须在周期结束前将库存和经营收益转化为现金。否则,留在账面上的未转化资产会拖累最终结果。
在价格谈判中,该基准引入了一个由博弈论原理驱动的供应商矩阵,其中每个供应商都拥有独特的性格特征和让步策略。这要求模型通过多轮自然语言交互进行谈判。Qwen3.8-Max 在谈判中展现出持续学习能力。它针对同一供应商的同一产品进行深度试探,逐轮实现采购价格的渐进式下降和利润的稳步增长。这使得谈判效率(以雷达图中的面积表示)随时间不断扩大。此外,它还能有效地将这一谈判经验泛化到类似产品上,而其他模型的谈判效率普遍在中期就触及瓶颈。
此外,模型还必须应对表面之下的隐藏风险和复杂的市场节奏。在近 600 家供应商的矩阵中,该基准暗中嵌入了 152 家欺诈商户,涵盖“会员费陷阱”“低价诱饵”“货不对板”等经典骗局模式。这全面考验了模型的风险控制能力。与此同时,年度大促期间订单激增的压力与台风、材料短缺等随机供应链危机交织在一起,将模型的备货节奏和危机管理能力推向极限。在此背景下,Qwen3.8-Max 展现出卓越的前瞻性规划能力。它在运营的最早阶段投入了最多的资金来确立自身地位,这加速了其后续的资产增长曲线。它还在年终大促期间实现了超过 ¥100,000 的净利润——几乎是排名第二的 GLM 5.2 的 2.4 倍。
Qwen3.8-Max 最终实现了最高的总余额 ¥416,252(4.16 倍回报),以 38% 的优势超越了排名第二的 GLM 5.2。这也比其上一代旗舰 Qwen3.7-Max 提升了 152%。这些结果表明,Qwen3.8-Max 在长时程连贯决策方面具有优势。此外,它具备从交易反馈中自适应学习的能力,在超过 2,000 轮交互中持续迭代与演化,而非僵化地固守早期学到的策略。
多模态智能体#
从它所看到的一切到它所做的一切,Qwen3.8-Max 不仅能理解图像、文档和视频。它提供的是贯穿整个任务生命周期的视觉智能。
在处理跨越200 多页的财务报告和复杂 PDF 时,Qwen3.8-Max 能够理解跨页面的文本、图表和文档布局,从大量信息中提取关键洞察,并将其转化为结构化报告或可直接上线的网页体验。在处理超过100 小时的视频时,它不仅能定位特定时刻并回答细节问题。它还能将人物、事件、时间戳和场景组织成一张视频记忆图,在长时间跨度中持续建立关联,以重建事件进展、人物关系和关键时刻。
无论是数百页的文档、一整部电视剧,还是长达 100 小时的直播,那些原本难以消化的信息,都可以被转化为可搜索、可追溯、可交互的知识结构。
除了理解之外,Qwen3.8-Max 还能执行真正的视觉生产任务。它可以把个人素材剪辑成 vlog,把一个提问变成沉浸式教育动画,从一张界面截图重建出完整的前端项目,把户型图转化为基于 Blender 的 3D 室内可视化效果,还能根据自然语言请求开发交互式游戏和应用。
更重要的是,视觉并不局限于输入阶段。在执行过程中,Qwen3.8-Max 会持续观察并评估自己的中间结果。它可以检查页面布局、物体朝向、空间关系、动画质量和交互结果。当它发现问题时——比如电视朝向错误、界面对齐有误,或视觉结果与预期设计不符——它能够识别偏差、修改方案,并自主修正输出。
这意味着视觉不再只是智能体用来理解输入的又一种模态。它成为了一条贯穿规划、执行、验证与迭代的原生反馈回路。模型边生成边观察,边行动边审视,反复检查结果、发现问题并改进自己的工作。这一视觉反馈回路让智能体不再只是完成任务,而是把任务完成好。
Qwen3.8-Max 正在帮助多模态智能体从理解世界进化到通过视觉在其中持续行动与创造。
在数字世界中,独立完成一项复杂任务往往需要同时做到两件事:编写代码来实现底层逻辑,以及手动操作界面来驱动任务并观察结果。这种混合智能体能力——即编码与GUI 操作的配对——使这两条通道形成互补:编码高效且大规模地承担繁重工作,而GUI 操作能够触达人类所能看到和触及的一切,并且同样重要的是,它能反馈实时系统中实际发生的情况——将上述视觉反馈闭环从检查自身输出扩展到针对真实运行中的应用进行验证。
为了衡量这一点,我们推出了RecreationBench,这是一个长时程应用复刻基准,涵盖五个平台——桌面端(Ubuntu、macOS、Windows)、移动端(Android)以及 Web。模型只能以黑盒方式观察一个真实运行中的应用——没有源代码,没有互联网访问——纯粹通过交互和反馈来理解它,然后从零开始重建整个应用。在这里,Qwen3.8-Max 已经展现出前沿级别的混合智能体能力,通过迭代编码与交互反馈的反复循环,逐步逼近原始应用。
为了让这些能力更容易集成到现有的智能体系统中,我们还推出了 Qwen-MM-Plugins。这是一个专为多模态智能体设计的 harness 扩展库,为智能体框架提供图像和视频处理、多模态记忆、动态分辨率支持、视觉工具调用,以及面向视频编辑、Blender 和 CAD 等任务的专门能力。借助 Qwen-MM-Plugins,任何现有的智能体 harness 都能被扩展为更自然的多模态原生系统。
用户反馈#
关于 Qwen3.8-Max 最真实的评价来自那些真正把它投入实际工作的人。顶级智能体平台、领先的开源算法团队、法律、金融和制造业的专业机构、灵活敏捷的初创公司、独立开发者以及学术研究人员——他们都在不断把最复杂、最关键、周期最长的任务交给它。
企业用它搭建大规模智能体系统。知识工作者把他们的图像、手稿和视频统统丢给它,然后拿到全部处理好的结果。开发者直接把最繁重的工程任务交给它。研究团队端到端地跑通文献、数据和仿真的完整循环。一个模型,在如此不同的工作中被如此频繁地调用,以至于变得不可或缺。结论是一致的:Qwen3.8-Max 能够驱动长时间、自主的任务链,并一次性产出可直接交付的成果。











完整基准测试表#
| Opus4.8 | Fable5 | GPT5.6 Sol(max) | Qwen3.7-Max | Qwen3.8-Max | |
|---|---|---|---|---|---|
| 编程智能体 | |||||
| Terminal Bench 2.1 | 84.6 | 84.6 | 88.8 | 74.5 | 86.6 |
| SWE-bench Pro | 69.2 | 80.0 | 64.6 | 60.6 | 67.7 |
| DeepSWE 1.1 | 59.0 | 70.0 | 73.0 | 21.6 | 56.6 |
| NL2Repo-Bench | 69.4 | -- | -- | 47.2 | 55.9 |
| FrontierSWE | 70.0 | 88.8 | -- | 40.7 | 73.5 |
| MLS-Bench-Lite | 42.8 | 49.9 | 46.2 | 31.7 | 41.0 |
| PaperBench | 80.3 | 88.8 | 90.5 | 64.8 | 93.0 |
| AndroidBench | 69.8 | 84.5 | 74.0 | 56.5 | 70.2 |
| QwenSWEBench | 84.0 | 86.3 | 73.5 | 63.4 | 80.7 |
| QwenQoderBench | 62.7 | 63.1 | 53.8 | 36.8 | 58.4 |
| QwenReactBench | 1694 | 1770 | 1564 | 1538 | 1724 |
| QwenSVGBench | 1648 | 1690 | 1758 | 1499 | 1713 |
| 通用智能体 | |||||
| CoWorkBench | 72.3 | 75.9 | 71.5 | 64.6 | 74.8 |
| WorkSpaceBench | 66.8 | 68.7 | 65.6 | 61.4 | 67.7 |
| JobBench | 48.4 | 57.4 | 45.4 | 31.3 | 53.4 |
| SkillsBench | 65.1 | 70.9 | 73.5 | 61.2 | 70.2 |
| Agents' Last Exam(通过 / 得分) | 27.0 / 45.1 | -- / -- | 30.6 / 53.6 | 11.8 / 31.1 | 27.0 / 52.4 |
| Automation-Bench(Pass@1) | 27.2 | 29.1 | 29.7 | 14.2 | 27.3 |
| Toolathlon Verified(Pass@1) | 76.2 | 77.9 | 74.9 | 49.7 | 72.5 |
| WideSearch | 72.9 | 81.2 | -- | 75.2 | 81.9 |
| HLE(带工具) | 57.9 | 64.5 | 58.0 | 53.5 | 56.2 |
| 通用能力 | |||||
| GPQA Diamond | 92.0 | 92.6 | 94.1 | 92.4 | 92.6 |
| HLE | 45.7 | 53.3 | 47.2 | 41.4 | 43.6 |
| IFBench | 62.2 | 63.5 | 72.7 | 79.1 | 82.8 |
| $OneMillion-Bench(专家评分) | 41.8 | 55.9 | 53.8 | 44.4 | 52.5 |
| HealthBench | 52.4 | -- | 55.3 | 54.5 | 60.2 |
| PLawBench | 69.6 | 70.2 | 72.3 | 58.9 | 73.2 |
| PRBench-Legal | 52.7 | 57.6 | 57.6 | 48.5 | 57.6 |
| PRBench-Finance | 51.9 | 55.8 | 55.5 | 46.8 | 58.3 |
| MRCR v2 256K(8-needle) | 83.2 | -- | 93.8 | 86.7 | 92.9 |
| LongBench v2 | 69.1 | -- | 67.1 | 65.3 | 66.3 |
Fable5 的结果可能涉及回退。
Terminal Bench 2.1:使用 Claude Code(avg@10)进行评估,采用 5 小时超时和 max_tokens=131,072。对于所有其他模型,我们报告各测试框架中已公布的最佳成绩:Claude Opus 4.8 和 Claude Fable 5 采用来自 Artificial Analysis 的 Terminus 2(https://artificialanalysis.ai/evaluations/terminalbench-v2-1);GPT-5.6 Sol 采用 Codex(https://openai.com/index/previewing-gpt-5-6-sol/)。
SWE-bench Pro:使用 Claude Code 测试框架进行评估,temp=1.0,top_p=0.95,上下文窗口为 256K。已修正有问题的任务,所有基线均在改进后的基准上重新评估。
DeepSWE 1.1:使用 Claude Code 和 mini-SWE-agent 测试框架进行评估,temp=1.0,top_p=0.95,上下文窗口为 256K。我们报告两个测试框架中的最高分;值得注意的是,Qwen3.8-Max 在 Claude Code 上表现最佳。
NL2Repo-Bench:使用 Claude Code 测试框架进行评估。为防止奖励黑客行为,我们禁用了试图访问特定仓库的 Bash 命令,例如 pip download、pip install 和 git clone。
FrontierSWE:使用 Claude Code 测试框架进行评估。所有其他可获得的 MEAN@5 结果均取自截至 2026 年 8 月 3 日的官方 FrontierSWE 排行榜(https://www.frontierswe.com)。Dominance 分数使用官方评估脚本从原始分数重新计算得出。"--" 表示截至该日期没有可获得的官方 MEAN@5 结果。
MLS-Bench-Lite:使用 Claude Code 进行评估,超时时间为 5 小时,max_tokens=131,072。所有其他模型分数均取自官方排行榜。
PaperBench:在 Code-Dev 模式下的 BasicAgent 设置中进行评估,由 Claude Opus 4.6 担任评判,并在 3 次运行中取平均值(每次运行最长 12 小时)。
AndroidBench:在 95 项任务的公开子集上进行评估,报告 avg@3 分数。
QwenSWEBench:内部编码基准,用于评估模型的软件工程能力。使用 Claude Code 测试框架进行评估。报告 avg@3,超时时间为 8 小时,max_tokens=32,768,temperature=1.0,上下文窗口为 256K token。
QwenQoderBench:内部编码基准,用于评估 Qoder 上的用户体验。使用 Claude Code 测试框架进行评估。报告 avg@5,超时时间为 6 小时,max_tokens=32,768,temperature=1.0,上下文窗口为 256K token。
QwenReactBench:内部 React 项目构建基准,使用 Claude Code 作为测试框架,双语(EN/CN),7 个类别;自动渲染 + 多模态评判;BT/Elo 评分。
QwenSVGBench:内部 SVG 代码生成基准;双语(英文/中文),自动渲染 + 多模态评判;BT/Elo 评分。
CoWorkBench:内部协作基准,用于评估跨计算机科学、金融、法律、医疗及其他生产力领域的长周期任务。
SkillsBench:在公开的 SkillsBench v1.1 基准上评估,涵盖 87 项任务,报告每项任务三次运行的平均得分。Opus 4.8 和 Fable 5 在 Claude Code 上评估;GPT-5.6 Sol 在 Codex 上评估;Qwen 系列在 OpenCode 上评估。所有结果均来自我们自己的测试。
Automation-Bench:在 600 项任务的公开子集上评估。
WideSearch:外部模型使用 Claude Code 测试框架评估,我们的模型使用 Qwen-Agent 测试框架评估,报告四次运行的平均 item-F1。
$OneMillion-Bench:使用 gemini-3.1-pro-preview 评估。
PLawBench:使用 gemini-3.1-pro-preview 评估。
空白单元格(--):得分尚不可用或不适用。
| Opus4.8 | Fable5 | Gemini3.1-Pro | GPT5.6-Sol | Qwen3.7-Plus | Qwen3.8-Max | |
|---|---|---|---|---|---|---|
| 多模态推理 | ||||||
| MMMU-Pro | 75.6 | 81.2 | 80.5 | 83.0 | 79.0 | 82.3 |
| MathVision | 87.1 / 97.1 | 92.7 / 98.6 | 87.4 / 95.7 | 90.8 / 97.8 | 90.3 / -- | 95.2 / 97.7 |
| BabyVision | 28.4 / 81.2 | 42.5 / 90.5 | 55.9 / 68.3 | 65.5 / 88.9 | 64.7 / 70.4 | 82.0 / 91.3 |
| HLE-VL(带工具) | -- | -- | 43.9 | 51.2 | 25.6 | 52.2 |
| ZeroBench(Pass@5) | 17.0 / 34.0 | 20.0 / 46.0 | 17.0 / 23.0 | 22.0 / 35.0 | 19.0 / 19.0 | 24.0 / 49.0 |
| ZeroBench-Sub | 31.1 | 37.1 | 36.5 | 46.7 | 41.0 | 48.5 |
| LogicVista | 76.7 | 85.7 | 82.6 | 89.7 | 84.3 | 91.9 |
| HiPhO | 69.3 | 78.6 | 85.4 | 86.8 | 84.1 | 90.0 |
| PhyX | 54.2 | 71.7 | 79.4 | 79.1 | 80.0 | 83.5 |
| SLAKE | 75.9 | 86.6 | 82.9 | 85.1 | 83.2 | 90.8 |
| MedXpertQA-MM | 71.7 | 80.0 | 80.7 | 81.5 | 71.0 | 80.4 |
| PMC-VQA | 59.2 | 63.2 | 62.5 | 62.3 | 63.4 | 66.2 |
| 视觉智能体与编程 | ||||||
| OSWorld-Verified | 83.4 | 85.0 | 76.2 | 83.2 | 73.3 | 86.1 |
| OSWorld 2.0 | 20.6 / 54.8 | -- / 66.1 | 7.8 / 30.6 | -- / 62.6 | 2.8 / 21.5 | 19.4 / 46.7 |
| ScreenSpot Pro | 82.3 | 87.3 | 68.1 | 81.3 | 79.0 | 84.5 |
| WebArena-Verified | 67.9 | 71.3 | 64.3 | 69.7 | 55.3 | 66.8 |
| AndroidWorld | 75.0 | 88.8 | 70.7 | 77.6 | 81.0 | 85.3 |
| MobileWorld | 67.5 | 85.5 | 58.1 | 76.9 | 51.2 | 77.8 |
| ClawEval-MM | 73.3 / 73.8 | 81.2 / 77.5 | 50.5 / 55.2 | 81.2 / 78.9 | 57.4 / 60.1 | 77.2 / 74.8 |
| Vision2Web | 62.4 | 70.5 | -- | 62.1 | 42.1 | 69.0 |
| QwenBlenderBench | 62.4 | 69.5 | 23.0 | 68.6 | 41.5 | 69.9 |
| Parametric CAD Bench | 85.1 | 87.5 | 73.5 | 86.2 | 73.8 | 91.5 |
| RecreationBench | 48.0 | 56.1 | 16.2 | 47.6 | 30.2 | 51.7 |
| PresentBench | 80.9 | 79.8 | 55.4 | 82.9 | 65.7 | 79.6 |
| 文档与办公智能 | ||||||
| CharXiv(RQ) | 78.5 / 89.9 | 87.9 / 93.5 | 84.4 / 89.9 | 85.1 / 89.1 | 85.8 / 85.9 | 88.4 / 93.5 |
| OmniDocBench 1.5 | 86.5 | 89.5 | 90.0 | 86.7 | 91.4 | 92.1 |
| OCR-Bench-V2(英文/中文) | 53.9 / 55.3 | 65.3 / 58.1 | 64.6 / 58.2 | 69.0 / 57.3 | 70.7 / 67.1 | 74.2 / 68.3 |
| CC-OCR-Bench-V2 | 60.3 | 72.4 | 68.9 | 68.0 | 72.7 | 79.6 |
| MTVQA-Test | 48.1 | 41.6 | 54.3 | 52.7 | 51.2 | 56.6 |
| MADQA | 86.8 | 86.0 | 81.1 | 87.8 | 87.1 | 91.8 |
| QwenVisualOffice | 34.5 | 32.4 | 39.6 | 29.5 | 32.4 | 44.6 |
| 真实世界与空间理解 | ||||||
| RealWorldQA | 76.6 | 85.9 | 83.5 | 83.7 | 86.9 | 88.0 |
| ERQA | 57.2 | 70.0 | 68.0 | 70.0 | 69.8 | 77.8 |
| LingoQA | 73.8 | 77.4 | 66.8 | 72.6 | 83.4 | 84.8 |
| SURDS | 62.2 | 79.4 | 64.0 | 63.0 | 77.2 | 77.8 |
| 视觉感知与定位 | ||||||
| SimpleVQA | 67.3 | 73.4 | 73.1 | 66.6 | 70.3 | 75.0 |
| WorldVQA | 33.9 | 53.5 | 54.0 | 45.1 | 43.9 | 53.2 |
| MMStar | 76.7 | 80.5 | 84.0 | 82.5 | 83.2 | 85.9 |
| PerceptionBench | 47.2 | 57.2 | 56.2 | 59.7 | 51.1 | 63.5 |
| CountQA | 41.3 | 63.1 | 72.8 | 68.6 | 77.0 | 82.4 |
| RefAdv-S | 61.7 | 68.6 | 71.9 | 69.2 | 73.0 | 80.2 |
| Dense200 | 20.8 | 31.1 | 69.7 | 55.3 | 60.7 | 87.0 |
| COCO | 50.7 | 56.4 | 72.4 | 61.2 | 74.2 | 78.7 |
| VisFactor | 30.1 | 54.5 | 39.8 | 62.8 | 42.8 | 60.8 |
| VLMsAreBiased | 43.8 | 61.2 | 74.1 | 59.8 | 36.6 | 88.3 |
| 视频智能与智能体 | ||||||
| VideoMME(含字幕) | 85.4 | -- | 86.7 | 89.5 | 88.0 | 90.4 |
| VideoMME v2(含字幕) | 49.0 | 52.2 | 66.9 | 71.1 | 59.7 | 68.3 |
| VideoMMMU | 75.3 | 81.2 | 85.3 | 85.0 | 85.4 | 88.7 |
| MMVU | 67.4 | 72.0 | 77.9 | 81.2 | 76.6 | 82.4 |
| MLVU (M-Avg) | 53.4 | -- | 84.7 | 87.6 | 87.4 | 90.8 |
| TVBench | 61.5 | -- | 73.0 | 83.2 | 78.2 | 81.9 |
| LVBench | 67.3 | -- | 75.1 | 78.8 | 76.2 | 81.8 |
| LVBench(含记忆) | 84.3 | 90.1 | -- | 84.2 | 74.5 | 85.6 |
| EgoLife(带记忆) | 78.3 | 82.3 | -- | 70.8 | 68.8 | 80.3 |
| VideoDR(带搜索) | 65.6 | 77.1 | -- | 71.3 | 41.0 | 73.2 |
MathVision、BabyVision、CharXiv(RQ)和 ZeroBench:分数以“无 CI / 有 CI”形式报告。MathVision 和 CharXiv(RQ)中少量错误的真值标注已在人工核验后予以更正。
MathVision:我们的模型使用固定提示词进行评估,例如“请逐步推理,并将最终答案放在
\boxed{}内。”对于其他模型,我们报告在带与不带\boxed{}格式要求两种运行方式下所取得的较高分数。MMMU-Pro:Gemini3.1-Pro 和 GPT5.6-Sol 的结果取自官方模型报告或系统卡。所有其他模型均为内部评估。
ClawEval-MM:分数以“Pass@3 / 平均分”形式报告。Pass@3 衡量三次试验中至少一次通过的百分比,平均分是三次试验得分的均值。
Vision2Web:分数在前端、网页和网站三个类别上取平均,使用 Claude Code harness 并以 gpt-5.4-2026-03-05 作为评判模型。
HLE-VL(带工具):分数在工具使用条件下评估,包括 Code Interpreter(CI)和 Search。Gemini3.1-Pro 和 GPT5.6-Sol 启用工具版本的分数通过其官方原生工具调用 API 进行端到端测量。
OSWorld 2.0:分数以“二值 / 部分”形式报告。二值分数是获得完整任务奖励的任务百分比,而部分分数则汇总所有任务中获得的部分奖励。
ScreenSpot Pro:Opus4.8 和 Fable5 的分数取自官方系统卡。Fable5 的结果指对应的 Mythos Preview 分数。所有其他模型均为内部评估。
WebArena-Verified:分数使用官方 WebArena 评分器在 OSWorld 框架内报告。
RecreationBench:一个内部的长时程应用复刻基准,用于评估混合智能体在五个平台上的能力:Ubuntu、macOS、Windows、Android 和 web。
PerceptionBench:对比模型的分数取自该基准的官方发布报告,而我们的模型则在内部进行评估。
VideoMME(含字幕)和 VideoMME v2(含字幕):分数在启用字幕的情况下评估。
QwenBlenderBench 和 QwenVisualOffice:两者均为内部基准。
LVBench 和 EgoLife(含记忆):分数使用基于 Qwen-MM-Plugins 构建的记忆系统进行评估,可实现细粒度、长时程的视频记忆。
VideoDR(含搜索):分数在可访问搜索工具的情况下评估。
空白单元格(--):分数尚不可用或不适用。
使用 Qwen3.8 构建#
Qwen3.8-Max 现已通过 QwenCloud 提供。你可以将其与主流智能体框架和编程助手集成。模型权重将于下周在 Hugging Face 和 ModelScope 上开源——敬请关注。
API 使用#
Qwen3.8-Max 官方支持 reasoning_effort,可用于调整推理深度并控制成本:
xhigh(默认):适用于需要深入分析的复杂任务medium:兼顾准确性与速度low:高效推理,针对速度与成本进行优化
此外,所有工作负载默认启用 preserve_thinking,以提供最佳开箱即用体验。
QwenCloud#
QwenCloud 支持行业标准协议,包括兼容 OpenAI 规范的 chat completions 和 responses API,以及兼容 Anthropic 的 API 接口。
"""
Environment variables:
DASHSCOPE_API_KEY: Your API Key from https://home.qwencloud.com/
DASHSCOPE_BASE_URL: (optional) Base URL for compatible-mode API.
- Beijing: https://dashscope.aliyuncs.com/compatible-mode/v1
- Singapore: https://dashscope-intl.aliyuncs.com/compatible-mode/v1
- US (Virginia): https://dashscope-us.aliyuncs.com/compatible-mode/v1
"""from openai import OpenAIimport osapi_key = os.environ.get("DASHSCOPE_API_KEY")if not api_key: raise ValueError( "DASHSCOPE_API_KEY is required. " "Set it via: export DASHSCOPE_API_KEY='your-api-key'" )client = OpenAI( api_key=api_key, base_url=os.environ.get( "DASHSCOPE_BASE_URL", "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", ),)messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]completion = client.chat.completions.create( model="qwen3.8-max", messages=messages, extra_body={ "enable_thinking": True, # "preserve_thinking": True, }, reasoning_effort="xhigh", # supported levels are xhigh, medium, and low stream=True,)reasoning_content = ""answer_content = ""is_answering = Falseprint("\n" + "=" * 20 + "Reasoning" + "=" * 20 + "\n")for chunk in completion: if not chunk.choices: print("\nUsage:") print(chunk.usage) continue delta = chunk.choices[0].delta if hasattr(delta, "reasoning_content") and delta.reasoning_content is not None: if not is_answering: print(delta.reasoning_content, end="", flush=True) reasoning_content += delta.reasoning_content if hasattr(delta, "content") and delta.content: if not is_answering: print("\n" + "=" * 20 + "Answer" + "=" * 20 + "\n") is_answering = True print(delta.content, end="", flush=True) answer_content += delta.content
编程助手#
Qwen3.8-Max 可与主流智能体框架和编程助手无缝集成:
Claude Code#
Qwen API 支持 Anthropic API 协议,可直接配合 Claude Code 使用:
npm install -g @anthropic-ai/claude-code
export ANTHROPIC_MODEL="qwen3.8-max"export ANTHROPIC_SMALL_FAST_MODEL="qwen3.8-max"export ANTHROPIC_BASE_URL=https://dashscope-intl.aliyuncs.com/apps/anthropic
export ANTHROPIC_AUTH_TOKEN=<your_api_key>
claude
Codex#
Qwen API 支持 OpenAI Responses 协议,因此可与 Codex 配合使用:
在 ~/.codex/model-catalog.local.json
{ "models": [ { "slug": "qwen3.8-max", "display_name": "qwen3.8-max", "description": "Model Studio: Qwen3.8-Max", "default_reasoning_level": "xhigh", "supported_reasoning_levels": [ { "effort": "low", "description": "Fast responses with lighter reasoning" }, { "effort": "medium", "description": "Greater reasoning depth for complex problems" }, { "effort": "xhigh", "description": "Extra high reasoning depth for complex problems" } ], "context_window": 1000000, "effective_context_window_percent": 95, "supports_parallel_tool_calls": true, "supports_image_detail_original": true, "input_modalities": ["text", "image"], "shell_type": "default", "visibility": "list", "supported_in_api": true, "priority": 1, "base_instructions": "", "support_verbosity": false, "supports_reasoning_summaries": false, "experimental_supported_tools": [], "truncation_policy": { "mode": "bytes", "limit": 10000 } } ]}
在 ~/.codex/config.toml
toml
model_catalog_json = "~/.codex/model-catalog.local.json"model_provider = "ModelStudio"model = "qwen3.8-max"[model_providers.ModelStudio]name = "Model Studio"base_url = "https://dashscope-intl.aliyuncs.com/compatible-mode/v1"env_key = "OPENAI_API_KEY"wire_api = "responses"
npm install -g @openai/codex
export OPENAI_API_KEY=<your_api_key>
codex
Qoder CLI#
Qoder 与 Qwen 协同演进,面向智能体编程:
curl -fsSL https://qoder.com/install | bash
qoder
Qwen Code#
Qwen Code 针对 Qwen 系列进行了深度优化:
npm install -g @qwen-code/qwen-code@latest
qwen
OpenClaw#
curl -fsSL https://molt.bot/install.sh | bash
export DASHSCOPE_API_KEY=<your_api_key>
openclaw dashboard
配置 ~/.openclaw/openclaw.json:
{ "models": { "mode": "merge", "providers": { "modelstudio": { "baseUrl": "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", "apiKey": "DASHSCOPE_API_KEY", "api": "openai-completions", "models": [ { "id": "qwen3.8-max", "name": "qwen3.8-max", "reasoning": true, "input": ["text", "image"], "contextWindow": 1000000, "maxTokens": 65536 } ] } } }, "agents": { "defaults": { "model": { "primary": "modelstudio/qwen3.8-max" } } }}
摘要#
Qwen3.8-Max 是我们迄今为止能力最强的模型,也是首个达到 Max 规模的开放权重模型。其参数规模扩展至 2.4 万亿,在编程、真实世界工作、长周期任务以及多模态智能体方面均带来全面提升——能够以极少的人工介入,从头到尾完成复杂、开放式的目标,并产出可靠的交付成果。开放权重将于下周发布。我们欢迎社区反馈,并期待看到你们的构建成果。
引用#
@misc{qwen38, title = {{Qwen3.8}: A New Bar for Coding and Cowork}, url = {https://qwen.ai/blog?id=qwen3.8}, author = {{Qwen Team}}, month = {August}, year = {2026}}
来源:Qwen:Blog Retrieval(API) · qwen.ai