Qwen3.7-Plus:多模态智能体模型发布
Qwen3.7-Plus: Multimodal Agent Intelligence
阿里云通义千问推出 Qwen3.7-Plus,基于 Qwen3.7 文本骨干,增强视觉语言能力,保留编码、工具使用和生产工作流的智能体能力。它支持感知现实场景、读取并操作 GUI、从视觉参考编写代码、端到端导航手机应用、基于网络知识回答视觉问题,融合 GUI 与 CLI 交互,跨 Claude Code、OpenClaw、Qwen Code 等框架泛化。在 Terminal Bench 2.0-Terminus 得分 70.3,SWE-Verified 77.7,QwenWorldBench 62.1,GPQA Diamond 90.3,MMLU-Pro 88.5。通过阿里云 Model Studio API 提供。
Qwen3.7-Plus 把视觉感知、GUI 操作和编码能力整合进同一个 agent 模型,在 ScreenSpot 和浏览器操作上的提升很实在,做自动化的开发者值得上手试试。
DISCORD 今天我们推出 Qwen3.7-Plus —— 一个多模态智能体模型,将视觉与语言统一为单一、多功能的智能体基础。基于 Qwen3.7 强大的文本主干,Qwen3.7-Plus 在视觉-语言能力上实现了全面升级,同时完整保留了在编码、工具使用和生产力工作流方面的全部智能体能力。
Qwen3.7-Plus 的独特之处在于它能够作为一个多模态交互式混合智能体运行。它感知真实世界场景,读取屏幕并操作 GUI,根据视觉参考编写代码,端到端地导航移动应用,并回答基于网络知识的视觉问题 —— 在单一智能体循环中无缝融合 GUI 与 CLI 交互。作为一个多功能的编码智能体和生产力助手,它能够处理从前端原型设计到复杂软件工程以及多步骤工作流自动化的全谱系任务,并支持全模态输入。它能够跨智能体脚手架泛化,无论是通过 Claude Code、OpenClaw、Qwen Code 还是其他框架部署,都能保持一致的表现。
Qwen3.7-Plus —— 现可通过阿里云 Model Studio 使用:多模态交互式混合智能体:跨视觉与文本任务的统一 GUI 与 CLI 操作 多功能编码智能体与生产力助手,支持全模态输入 视觉智能体:感知、推理、定位与搜索增强问答 跨多种智能体框架的跨脚手架泛化
通过阿里云 Model Studio 上的 API 调用。
文本基准测试#
| Opus-4.6 Max | K2.6 Thinking | GLM-5.1 Thinking | DeepSeek-V4-Pro Max | Qwen3.6-Plus | Qwen3.7-Plus | |
|---|---|---|---|---|---|---|
| 编程智能体 | ||||||
| Terminal Bench 2.0-Terminus | 65.4 | 66.7 | 63.5 | 67.9 | 61.6 | 70.3 |
| SWE-Verified | 80.8 | 80.2 | -- | 80.6 | 78.8 | 77.7 |
| SWE-Pro | 57.3 | 59.5 | 58.8 | 59.0 | 56.6 | 57.6 |
| SWE-Multilingual | 77.5 | 76.7 | -- | 76.2 | 73.8 | 75.8 |
| NL2repo | 47.6 | 42.8 | 41.0 | 35.5 | 34.4 | 41.1 |
| SciCode | 51.9 | 52.2 | 45.1 | -- | 41.4 | 51.3 |
| QwenWebDev | 1617 | -- | 1564 | 1570 | 1500 | 1536 |
| QwenSVG | 1541 | 1325 | 1605 | 1506 | 1432 | 1588 |
| 通用智能体 | ||||||
| Qwenclaw | 65.5 | 54.7 | 58.7 | 59.2 | 57.2 | 61.8 |
| CoWorkBench | 68.2 | 58.2 | 66.0 | 66.3 | 64.5 | 65.1 |
| ClawEval | 70.4 | 61.5 | 62.7 | 58.4 | 57.1 | 62.7 |
| Skillsbench | -- | 56.2 | 53.1 | 52.3 | 45.7 | 54.9 |
| BFCL-V4 | 76.7 | 71.3 | 70.9 | 70.6 | 68.9 | 72.9 |
| MCP-Mark | 56.7 | 55.9 | 57.5 | 57.1 | 48.2 | 58.7 |
| MCP-Atlas | 75.8 | 66.6 | 71.8 | 73.6 | 74.1 | 73.2 |
| Vitabench | -- | 39.1 | 45.1 | 51.9 | 42.8 | 45.6 |
| Deep-Planning | 58.9 | 42.3 | 34.1 | 44.6 | 40.9 | 62.3 |
| SpreadSheetBench-v1 | 89.3 | 84.5 | 85.2 | 84.9 | 80.2 | 86.3 |
| Kernel Bench L3 | 2.63/98% | 1.41/80% | 2.00/78% | 1.07/54% | 1.03/48% | 2.06/98% |
| QwenWorldBench | 56.1 | 50.9 | 50.2 | 52.3 | 47.6 | 62.1 |
| STEM 与推理 | ||||||
| GPQA Diamond | 91.3 | 90.5 | 86.2 | 90.1 | 90.4 | 90.3 |
| HLE | 40.0 | 36.4 | 34.7 | 37.7 | 28.8 | 34.7 |
| LiveCodeBench | 88.8 | 89.6 | -- | 93.5 | 87.1 | 89.6 |
| HMMT 2026 Feb | 96.2 | 92.7 | 89.4 | 95.2 | 87.8 | 92.9 |
| IMOAnswerBench | 75.3 | 86.0 | 83.8 | 89.8 | 83.8 | 86.0 |
| CritPT | 12.6 | 8.0 | 4.6 | 12.9 | 2.9 | 6.0 |
| Apex | 34.5 | 24.0 | 11.5 | 38.3 | 8.8 | 22.7 |
| 通用能力 | ||||||
| MMLU-Pro | 89.7 | 87.1 | 86.3 | 87.5 | 88.5 | 88.5 |
| MMLU-Redux | 95.2 | 95.3 | 94.3 | 94.8 | 94.5 | 94.5 |
| SuperGPQA | 72.5 | 71.3 | 68.0 | 69.9 | 71.6 | 71.4 |
| IFEval | 91.9 | 94.5 | 94.5 | 91.9 | 94.3 | 94.6 |
| IFBench | 62.5 | 76.0 | 76.0 | 77.0 | 74.2 | 79.1 |
| MRCR-v2 128k | 84.0 | 63.1 | 62.0 | 74.4 | 85.9 | 91.7 |
| 多语言能力 | ||||||
| WMT24++ | 82.7 | 81.6 | 81.8 | 82.2 | 84.3 | 84.6 |
| MAXIFE | 81.3 | 87.7 | 87.7 | 88.9 | 88.2 | 88.8 |
| MMMLU | 90.6 | 87.5 | 87.2 | 87.9 | 89.5 | 89.0 |
| MMLU-ProX | 86.1 | 83.7 | 83.9 | 83.9 | 84.7 | 85.4 |
| NOVA-63 | 59.1 | 56.7 | 54.6 | 52.8 | 57.9 | 58.8 |
| INCLUDE | 87.4 | 84.2 | 84.3 | 86.1 | 85.1 | 83.0 |
| Global PIQA | 91.2 | 89.2 | 89.5 | 90.5 | 89.8 | 90.3 |
| PolyMATH | 80.2 | 82.7 | 67.6 | 72.0 | 77.4 | 84.0 |
Terminal-Bench 2.0:Harbor/Terminus-2 测试框架;5 小时超时,12 CPU/24 GB RAM;temp=1.0,topp=0.95,topk=20,maxtokens=80K,256K 上下文;取 5 次运行的平均值。所有实验在每一轮开头都预置一个 token,让模型自行决定是否启用扩展思考。
SWE-Bench 系列:内部智能体脚手架(bash + 文件编辑工具);temp=1.0,topp=0.95,200K 上下文窗口。
SWE-bench Pro:已修正有问题的任务,所有基线均在改进后的基准上重新评估。
QwenClawBench:一个基于真实用户分布的 Claw 智能体基准;已开源:https://github.com/SKYLENAGE-AI/QwenClawBench。
CoWorkBench:一个内部协作基准;涵盖计算机科学、金融、法律、医疗及其他生产力领域的长周期任务。
SkillsBench:通过 OpenCode 在 78 个任务上评估(排除 9 个依赖外部 API 的任务);取 5 次运行的平均值。
MCP-Mark:GitHub MCP v0.30.3;Playwright 响应在 32K token 处截断。
MCP-Atlas:公开集得分;由 gemini-2.5-pro 担任评判。
VITA-Bench:各子领域得分的平均值;使用 claude-4.5-sonnet 作为评判,因为较旧的官方评判已不再可用。
Kernel Bench L3:报告指标:在 50 道题目上,每题相对 PyTorch eager 参考实现的加速比中位数 / 比 torch.compile 更快的题目占比。每个测试样本在隔离的 Docker 容器中运行,配备一块 H100 80GB GPU,网络访问仅限 CUTLASS 代码库和官方 CUDA 文档,最多 500 次工具调用,连续 100 轮无改进后提前停止。使用 GPT-5.4(xhigh)检测潜在的作弊行为。使用 CUPTI 进行内核级计时。
推理场景:推荐系统提示词:“推理强度设置为 xhigh。请仔细思考任务,验证关键假设,考虑合理的替代方案,并在最终答案中优先保证正确性、一致性和清晰度。”
WMT24++:更难的 WMT24 子集;通过 XCOMET-XXL 在 55 种语言上的平均得分。
MAXIFE:在英文 + 多语言提示词上的准确率(共 23 种设置)。
MMLU-ProX:在 29 种语言上的平均准确率。
空白单元格(--)表示分数尚不可用。
Qwen3.7-Plus 在文本性能上极具竞争力,全面逼近 Max 级模型。在编码智能体方面,它在 Terminal Bench 2.0、SWE-bench 系列和 SciCode 上表现强劲,能够有效处理真实世界的软件工程和科学编程任务。在通用智能体方面,它在 MCP-Mark、Deep-Planning 和 Kernel Bench L3 上展现出强大的工具使用和规划能力,在复杂多步规划和 GPU kernel 优化方面尤为突出。其在 GPQA Diamond、HMMT 和 IMOAnswerBench 上的推理表现,使其跻身 Plus 级模型中最强的硬核 STEM 基准之列。在指令遵循和多语言任务方面,它在 IFBench、WMT24++ 和 PolyMATH 上均能提供一致的质量,并对多种语言有强大的覆盖能力。
多模态基准#
| GPT-5.4 (xhigh) | Opus-4.6 Max | Gemini-3.1 Pro | Qwen3.6-Plus | Qwen3.7-Plus | |
|---|---|---|---|---|---|
| 多模态推理 | |||||
| MMMU-Pro | 81.2 | 73.9 | 81.8 | 78.8 | 79.0 |
| MathVision | 91.0 | 65.5 | 87.4 | 88.0 | 90.3 |
| BabyVision | 53.1 | 12.6 | 55.9 | 37.4 | 70.4 / 64.7 |
| CharXiv(RQ) | 84.5 | 66.0 | 84.4 | 81.5 | 85.9 / 84.4 |
| HiPhO | 65.0 | 40.8 | 85.4 | 80.4 | 84.1 |
| ERQA | 67.8 | 40.8 | 68.0 | 65.7 | 69.8 |
| VisFactor | 40.8 | 24.4 | 39.8 | 36.0 | 42.8 |
| MedXpertQA-MM | 77.3 | 64.4 | 80.7 | 68.7 | 71.0 |
| 视觉智能体与编程 | |||||
| ScreenSpot Pro | 67.4 | 49.5 | 68.1 | 68.2 | 79.0 |
| OSWorld-Verified | 75.0 | 72.7 | -- | 62.5 | 73.3 |
| AndroidWorld | -- | 62.0 | 70.7 | 67.2 | 81.0 |
| QwenVision2Code | 1884.0 | 1518.0 | 1632.0 | 1522.0 | 1772.0 |
| ClawEval-MM | 54.4 | 54.7 | 45.7 | 49.1 | 55.7 |
| 多模态搜索与知识问答 | |||||
| SimpleVQA | 69.4 | 79.6 | 76.9 | 69.4 | 81.7 |
| WorldVQA | 45.9 | 65.4 | 56.1 | 33.6 | 61.1 |
| MMSearchPlus | 19.7 | 38.9 | 42.0 | 19.6 | 41.4 |
| BC-VL | 48.1 | 51.5 | 49.9 | 26.1 | 51.1 |
| MMBC | 18.8 | 46.3 | 28.2 | 18.3 | 46.3 |
| 通用视觉理解 | |||||
| RealWorldQA | 83.8 | 73.9 | 83.5 | 85.4 | 86.9 |
| CountQA | 58.4 | 32.5 | 72.8 | 71.7 | 77.0 |
| OmniDocBench1.5 | 85.5 | 86.6 | 90.0 | 91.2 | 91.4 |
| OCR-Bench-V2(EN) | 59.1 | 54.3 | 64.6 | 67.0 | 70.7 |
| OCR-Bench-V2(ZH) | 57.7 | 54.9 | 58.2 | 63.6 | 67.1 |
| ODinW13 | -- | -- | -- | 51.8 | 51.1 |
| 自动驾驶 | |||||
| LingoQA | 78.2 | 77.6 | 66.8 | 76.0 | 83.4 |
| Ego3D-Bench↓ | 6.9 | 8.1 | 10.4 | 6.1 | 5.9 |
| SURDS | 64.6 | 58.3 | 64.0 | 73.2 | 77.2 |
| VLADBench | 77.1 | 48.0 | 73.1 | 75.6 | 77.2 |
| 视频理解 | |||||
| VideoMME(含字幕) | 89.5 | 86.1 | 88.4 | 87.8 | 88.0 |
| VideoMMMU | 82.4 | 85.2 | 85.3 | 84.0 | 85.4 |
| MLVU(M-Avg) | 86.1 | 81.7 | 84.7 | 86.7 | 87.4 |
| TVBench | 82.5 | 69.8 | 73.0 | 76.0 | 78.2 |
| LVBench | 77.4 | 63.0 | 75.1 | 74.8 | 76.2 |
多模态搜索与知识问答:所有模型均在启用搜索增强的情况下进行评估。
BabyVision 和 CharXiv(RQ):分数以“含 CI / 不含 CI”的形式报告。
VideoMME(含字幕):分数为带字幕情况下的报告结果。
BC-VL 和 MMBC:分数为在 BC 任务中使用推荐的存在惩罚值 1.5 时的报告结果。
ScreenSpot Pro 和 OSWorld-Verified:分数为在“enablethinking=False”情况下的报告结果。
空白单元格(--)表示分数尚不可用。
Qwen3.7-Plus 的多模态改进并不局限于视觉理解方面的孤立提升。相反,它们体现了对多模态智能体所需核心能力的系统性增强:理解复杂的视觉输入、对视觉信息进行推理、使用工具解决问题,并最终在代码或 GUI 环境中执行任务。
在多模态推理方面,Qwen3.7-Plus 在 BabyVision、MathVision、HiPhO、ERQA 和 VisFactor 等具有挑战性的视觉推理基准上表现出强劲性能。这些结果证明了该模型整合细粒度视觉感知、空间关系、物理常识和多步逻辑推理的能力。尤其是,它在 BabyVision 上相较 Qwen3.6-Plus 的显著提升,表明其在更接近人类早期视觉认知和空间推理的任务上具有更强的泛化能力。
在视觉智能体与编程方面,Qwen3.7-Plus 在 ScreenSpot Pro、OSWorld-Verified 和 AndroidWorld 上展现出大幅提升。这表明该模型不仅能识别屏幕内容,还能定位关键 UI 元素、理解任务意图,并完成多步交互。在 QwenVision2Code 上,该模型还展现出强大的视觉到代码生成能力,能够将图像、视频和设计参考转化为可执行代码。这些能力构成了多模态智能体从“理解界面”迈向“操作界面”乃至“构建界面”的基础。
在多模态搜索与知识问答方面,Qwen3.7-Plus 在 SimpleVQA、WorldVQA、MMSearchPlus、BC-VL 和 MMBC 上取得了明显提升。该模型能够将视觉输入与外部知识检索相结合,回答仅凭图像内容无法解决的问题。这使其更适合真实世界任务,在这些任务中,用户并非只是问“图像里有什么”,而是期望模型结合视觉证据、常识和最新知识来提供可靠的答案。
在通用视觉理解方面,Qwen3.7-Plus 在真实世界场景、文档解析、图表理解、OCR、计数和空间定位等任务上保持了强劲表现。它在 RealWorldQA、CountQA、OmniDocBench、CharXiv 和 OCR-Bench-V2 等任务上表现出色。这些能力对于稳健处理真实业务输入至关重要,包括截图、收据、表格、报告、海报、产品图片和复杂的 UI 页面。
除图像之外,Qwen3.7-Plus 还进一步增强了视频理解和驾驶场景理解。在 VideoMMMU、MLVU、TVBench 和 LVBench 等视频基准上,它能够对短视频和长视频中的事件、动作、时间动态和语义关系进行推理。在 LingoQA、Ego3D-Bench、SURDS 和 VLADBench 等驾驶相关评测上,它也展现出对动态场景、交通参与者和空间关系的强大理解能力。这些能力为真实世界多模态智能体、自动驾驶理解和具身 AI 场景奠定了重要基础。
使用 Qwen3.7-Plus 构建#
Qwen3.7-Plus 现已通过阿里云百炼平台提供。
作为一款多模态模型,Qwen3.7-Plus 同时接受文本和图像/视频输入。它还支持 preservethinking 功能:在 messages 中保留所有前序轮次的思考内容,这推荐用于智能体任务。
阿里云百炼平台支持行业标准协议,包括与 OpenAI 规范兼容的 chat completions 和 responses API。
""" 环境变量:DASHSCOPEAPIKEY:你的 API Key,来自 https://modelstudio.console.alibabacloud.com DASHSCOPEBASEURL:(可选)兼容模式 API 的 Base URL。 - 北京:https://dashscope.aliyuncs.com/compatible-mode/v1 - 新加坡:https://dashscope-intl.aliyuncs.com/compatible-mode/v1 - 美国(弗吉尼亚):https://dashscope-us.aliyuncs.com/compatible-mode/v1 """from openai import OpenAIimport osapikey = os.environ.get("DASHSCOPEAPIKEY")if not apikey: raise ValueError( "DASHSCOPEAPIKEY is required. " "Set it via: export DASHSCOPEAPIKEY='your-api-key'" )client = OpenAI( apikey=apikey, baseurl=os.environ.get( "DASHSCOPEBASEURL", "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", ),)messages = [{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}]completion = client.chat.completions.create( model="qwen3.7-plus", messages=messages, extrabody={ "enablethinking": True, # "preservethinking": True, }, stream=True)reasoningcontent = ""answercontent = ""isanswering = Falseprint("\n" + "=" 20 + "Reasoning" + "=" 20 + "\n")for chunk in completion: if not chunk.choices: print("\nUsage:") print(chunk.usage) continue delta = chunk.choices[0].delta if hasattr(delta, "reasoningcontent") and delta.reasoningcontent is not None: if not isanswering: print(delta.reasoningcontent, end="", flush=True) reasoningcontent += delta.reasoningcontent if hasattr(delta, "content") and delta.content: if not isanswering: print("\n" + "=" 20 + "Answer" + "=" 20 + "\n") isanswering = True print(delta.content, end="", flush=True) answercontent += delta.content
多模态交互式混合智能体#
Qwen3.7-Plus 具备多模态混合智能体能力,专为真实世界任务的闭环执行而设计。它不仅能理解可视化界面、感知屏幕内容,并执行 GUI 交互与 CLI 操作,还能借助环境反馈进行代码生成、应用操控、测试、验证与迭代优化。通过将“看、想、写、做、验”的完整工作流整合进统一的智能体循环,它实现了复杂软件任务从初步理解到最终交付的端到端自动化。
我们基于 Qwen3.7 构建了 Hybrid-Agent 智能体系统,将大语言模型的代码生成能力与 GUI 自动化执行深度融合,实现了从需求分析到版本迭代的全链路 APP 开发。该智能体连续稳定运行超过 11 小时,全自动完成了英语词汇学习 APP 的完整研发周期。它生成了 10,000+ 行代码,触发 1,000+ 次智能体调用,并覆盖了软件开发生命周期中的各个核心阶段:需求文档生成、自动化编码、安装与部署、测试用例创建、基于 GUI 的自动化测试、多场景并行测试、产品文档自动更新,以及自主版本演进。
面向专业桌面应用场景,Hybrid-Agent 系统深度融合了模型的 GUI 感知与代码生成能力,实现专业桌面应用的一键自主复刻。该 Agent 自主完成了对原生 macOS Stocks 应用的高保真复刻,覆盖从需求理解到交付验证的完整流程:自主与原生应用交互以理解 UI 布局与功能细节,根据交互记录生成 SwiftUI 源代码,接入 LongBridge 真实市场 API 以获取实时数据,自动编译并启动复刻后的应用,最后自主执行 10 项功能验证测试——包括实时行情加载、股票选择与切换、多周期视图切换、搜索过滤以及详细统计面板展示——全部通过。交付的应用忠实还原了原生 Stocks 应用的深色主题、分栏视图布局、实时市场数据以及完整的交互能力。
视觉 Agent#
Qwen3.7-Plus 可作为强大的视觉 Agent,将视觉理解与工具使用相结合,解决复杂的视觉任务。通过与代码解释器集成,它可以分析图像以发现差异、补全缺失的拼图块、解决滑块拼图、走迷宫以及拼装拼图——这一切都通过自主生成并执行代码来完成。借助搜索增强,它还能利用网络知识对真实世界的视觉问题进行推理,并针对单图、多图和视频输入提供多模态答案。
下面,我们展示几个示例,以演示 Qwen3.7-Plus 的多模态 Agent 能力。
多模态推理#
在多模态推理方面,我们引入代码执行来进一步增强模型的问题求解能力。模型首先理解视觉输入中的结构和约束,然后将视觉任务转化为可计算的表示,最后编写并执行代码来求解、搜索或验证答案。
在找不同、缺失方块补全、滑块拼图、迷宫和拼图游戏等任务中,模型需要超越对视觉内容的识别。它还必须执行空间建模、路径搜索、状态模拟和结果验证。这些示例凸显了 Qwen3.7-Plus 从视觉感知迈向程序化问题求解的能力。
演示1 找不同
多模态搜索#
在搜索增强的视觉问答中,Qwen3.7-Plus 可以将图像、视频或多图像输入与网络搜索相结合,回答现实世界的知识性问题。模型首先从视觉输入中提取关键实体、场景、文本和上下文线索,然后通过搜索检索外部知识,最后将视觉证据与检索到的信息综合起来生成答案。
这使模型能够处理广泛的开放世界问题,例如识别地点、理解事件背景、分析产品或物体,以及回答依赖最新知识的视觉问题。
演示1 真实世界 VQA
视觉编码#
Qwen3.7-Plus 展现出强大的视觉到代码生成能力。它可以将图像、视频、UI 截图和设计参考转化为可执行代码,覆盖从 SVG 重建到完整网页生成的广泛场景。
图像/视频转 SVG#
在图像/视频转 SVG 任务中,模型需要理解视觉内容中的几何结构、颜色、布局、层级关系和动态变化,然后用代码精确表达这些元素。这不仅需要视觉理解,还需要结构化表示和代码生成。
对于图标、插画、动画、平面设计和信息可视化,这一能力可以显著降低将视觉参考转化为可编辑代码资产的成本。
演示1 视觉转 svg
请根据图像生成 svg 代码。
Qwen3.7
视觉驱动的网页设计#
在视觉驱动的网页设计中,Qwen3.7-Plus 可以根据视觉参考、视频素材或设计意图生成完整的交互式网页。该模型还可以使用生成工具为网页设计制作素材。
它不仅复现了参考页面的视觉风格,还组织布局、编写前端代码、处理交互逻辑,并将多模态素材整合到最终页面中。这展现了 Qwen3.7-Plus 作为视觉编程助手的潜力:从“给定一张参考图”迈向“生成可运行的网页原型”。
Demo1 结合视频生成的网页设计
浏览器智能体#
该浏览器智能体基于 Qwen3.7-Plus 构建,通过 Qwen for Chrome 进行演示和录制,后者是一款嵌入 Chrome 的浏览器扩展。用户可以直接从浏览器侧边栏与 Qwen 交互,并在授权后将其切换为智能体模式。在该模式下,Qwen 能够感知当前网页、理解用户任务、规划后续步骤,并作为浏览器智能体在真实浏览器环境中直接执行点击、输入、导航、配置和验证操作。
通过这一设置,Qwen3.7 浏览器智能体整合了页面理解、任务规划和 GUI 自动化,能够在真实的基于 Web 的工作环境中进行操作。面对非技术用户购买最便宜 ECS 服务器的请求,该智能体可以浏览云控制台、比较实例选项、选择低成本配置、设置镜像、存储、安全组和订单详情,同时在价格变动、库存有限或出现购买限制时动态调整策略。在后续任务中,该智能体进一步处理实例扩缩容和维护,完成关机、配置更新、磁盘扩容、服务恢复和最终验证。该场景涵盖了从服务器购买到升级的真实云工作流程,将复杂的基于控制台的过程转变为连续、高效且可交付的浏览器自动化任务。
真实世界感知与推理#
Qwen3.7-Plus 在真实世界感知和多模态推理方面也展现出强劲性能。真实世界场景往往比标准视觉问答复杂得多。它们可能涉及遮挡、杂乱背景、小物体、多实体之间的关系、跨图像比较以及隐式的物理常识。
为了可靠地回答这些问题,模型必须首先稳健地识别视觉细节,然后将其与空间关系、常识知识和逻辑推理结合起来。
Demo1 真实世界计数
编程助手#
Qwen3.7-Plus 可与主流智能体框架和编程助手无缝集成:
Claude Code#
Qwen API 支持 Anthropic API 协议,可直接配合 Claude Code 使用:
npm install -g @anthropic-ai/claude-code export ANTHROPICMODEL="qwen3.7-plus"export ANTHROPICSMALLFASTMODEL="qwen3.7-plus"export ANTHROPICBASEURL=https://dashscope-intl.aliyuncs.com/apps/anthropic export ANTHROPICAUTHTOKEN= claude
OpenClaw#
通过 Model Studio 连接 OpenClaw:
curl -fsSL https://molt.bot/install.sh | bash export DASHSCOPEAPIKEY= openclaw dashboard
配置 ~/.openclaw/openclaw.json:
{ "models": { "mode": "merge", "providers": { "modelstudio": { "baseUrl": "https://dashscope-intl.aliyuncs.com/compatible-mode/v1", "apiKey": "DASHSCOPEAPIKEY", "api": "openai-completions", "models": [ { "id": "qwen3.7-plus", "name": "qwen3.7-plus", "reasoning": true, "input": ["text"], "contextWindow": 1000000, "maxTokens": 65536 } ] } } }, "agents": { "defaults": { "model": { "primary": "modelstudio/qwen3.7-plus" } } }}
Qwen Code#
Qwen Code 针对 Qwen 系列进行了深度优化:
npm install -g @qwen-code/qwen-code@latest qwen
Qwen3.7-Plus 是我们能力最强的多模态智能体模型,将视觉理解与语言推理统一为一个多才多艺的智能体基础。它作为一个多模态交互式混合智能体运行——感知真实世界场景、操作图形界面、根据视觉参考编写代码,并在 GUI 和 CLI 环境中完成端到端任务。作为一个多才多艺的编程智能体和生产力助手,它能够处理从前端原型设计到复杂软件工程和多步骤工作流自动化的各类任务。它能够跨智能体脚手架泛化,无论通过 Claude Code、OpenClaw、Qwen Code 还是其他框架部署,都能保持一致的性能。我们欢迎社区反馈,并期待看到你们构建的作品。
@misc{qwen37plus, title = {{Qwen3.7-Plus}: Multimodal Agent Intelligence}, url = {https://qwen.ai/blog?id=qwen3.7-plus}, author = {{Qwen Team}}, month = {May}, year = {2026}}
来源:Qwen:Blog Retrieval(API) · qwen.ai