OpenRouter融合预算模型面板超越GPT-5.5和Claude Opus 4.8
通过OpenRouter融合的一组预算模型,在100个复杂研究任务上得分超过GPT-5.5和Claude Opus 4.8。
推荐理由:OpenRouter 的 Fusion API 用多个模型合成输出,基准测试里预算模型组合能接近前沿,这个思路对有质量要求又在意成本的开发者挺实用。
通过OpenRouter融合的一组预算模型,在100个复杂研究任务上得分超过GPT-5.5和Claude Opus 4.8。
推荐理由:OpenRouter 的 Fusion API 用多个模型合成输出,基准测试里预算模型组合能接近前沿,这个思路对有质量要求又在意成本的开发者挺实用。
GitHub Copilot CLI 通过更好的编排实现了更少的任务交接和更快的进度,且没有新增任何配置选项。
推荐理由:官方博客把子代理从默认操作变成了需要权衡的决策,23% 的工具失败减少和明显的等待时间下降,说明 AI 工具的体验升级不一定要加新按钮,改好调度逻辑一样有用。
OpenAI 在开发者文档网站上线了新的文档智能体,可帮助查找产品相关信息并直接跳转到对应文档。Greg Brockman 表示这是一种强大且酷的网站导航方式,让交互更加直观。
推荐理由:OpenAI 在开发者文档里嵌了个问答代理,能让开发者直接问文档,对常翻阅 API 的人挺实用。虽然不算大突破,但改善了开发体验,值得一试。
olmo-eval 是基于 OLMES 标准构建的评估工作台,专为 LLM 持续开发中的反复评测场景设计。相比 OLMES,它减少了新增评测的实现工作量,支持 agentic 和多轮评测作为一等用例,并允许根据基准需求选择轻量直接运行或容器化隔离运行。采用模块化架构,模型、工具、容器环境、辅助模型均可独立替换。评测结果同时报告分数、标准误差和最小可检测效应。与 Harbor 侧重于发布不同,olmo-eval 聚焦开发阶段快速迭代,可逐问题对比检查点输出以区分真实改进与噪声。
推荐理由:做模型训练的人会感谢这个工具,它把评估从一次性打分变成能持续对比的流程,按题对比两个 checkpoint 的功能很实用,但如果你不训模型,这篇可以跳过。
6月12日,字节跳动旗下AI应用豆包大范围上线“任务模式”,支持定时执行、零代码网页生成、一键PPT生成、数据可视化分析等全链路Agent执行。原“思考模式”升级为“专家模式”,调用豆包大模型2.0 Pro版本,强化深度推理能力。App顶部模式切换改为“快速、专家、任务”。基础功能免费,高阶服务付费,专业版三档:标准版68元/月或688元/年,加强版200元/月或2048元/年,专业版500元/月或5088元/年。
推荐理由:豆包从对话助手转向能自主规划执行的任务模式,这是国产 AI 应用向 Agent 演进的一个明确信号,产品人该看看它如何用「快速、专家、任务」三种模式重塑用户预期。
苹果在 iOS 27 中优化健康 App,将列表改为卡片布局并增加导航栏。新增视觉智能营养识别,用户通过相机 Siri 模式拍摄食物可获取加工程度、蛋白质、含糖量等信息及营养价值评级,不提供精确卡路里,需 iPhone 15 Pro 及以上。经期追踪扩展支持围绝经期,可分析长期周期异常模式并推送提醒与指导。Fitness+ 新增围绝经期和绝经期课程。数据同步速度提升,GymKit 扩展至 iPhone,无需 Apple Watch 即可与健身设备配对同步数据。
推荐理由:视觉智能营养识别不能给精确卡路里,但那个“深度加工食品”提醒对普通人很实用,健康App这次更新算得上近年最有用了。
为 Chrome 和 Codex 内置浏览器引入开发者模式。 Codex 可以使用 Chrome DevTools 协议(CDP)来调试浏览器问题,通过分析 JavaScript 性能、检查控制台输出、网络流量和页面状态。
推荐理由:Codex 现在能直接调用 Chrome DevTools 调试浏览器问题,做前端和全栈的同行可以试试,省得在应用和调试工具之间来回切。
我们听说您希望能在自己方便的时候使用 Codex 速率限制重置。 从今天起,我们开始推出将速率限制重置保留到以后使用的功能。 我们从 Go、Plus、Pro 和 Business 用户开始,每人提供一次免费重置:
推荐理由:OpenAI 给 Codex 加了个攒速率重置的小功能,没用完的可以存起来以后用,适合偶尔深夜冲刺的开发者。不算大更新,但挺实用。
vLLM 宣布对 MiniMax M3 的 day-0 支持,覆盖 BF16 与 MXFP8 检查点,支持 1M-token 上下文、原生图像视频输入、minimax_m3 工具与推理解析器、EAGLE3 推测解码(草稿模型 Inferact/MiniMax-M3-EAGLE3)以及 TP/EP 部署和 Docker 镜像。
推荐理由:官方团队拆解了 MSA 稀疏注意力、MXFP8 MoE 与 EAGLE3 在推理引擎中的落地细节,部署者可以照此选择 NVIDIA 或 AMD 配置并理解瓶颈所在。
Replit 与 @databricks 集成刚刚升级了。 构建应用,让每个用户只看到他们应该看到的内容。你的 HR 分析师可以为 CEO 构建完整的组织视图,而无需访问底层数据。 公开预览已开放注册!了解更多 → https://replit.com/blog/databricksjune2026
推荐理由:Replit 跟 Databricks 打通安全预览,能让非技术角色直接搭应用而不碰底层数据,对已经用这两家的团队是个实用更新,其余人可以等等正式版。
OpenRouter 推出 advisor 服务器工具,允许快速、便宜的模型在生成过程中向更强模型咨询。用户可用 GPT-4o Mini 处理常规任务,在关键环节调用 Claude Fable 进行更高质量的推理。
推荐理由:让 GPT-4o Mini 在关键时刻请教 Claude,用 1/10 的成本得到相近质量,这种跨模型顾问把“模型路由”做成了开箱即用的工具,做 agent 的值得试。
AI 智能体很强大,但它们不记得你的偏好。 所以你总是重复指令——如何组织项目、你的品牌指南。 现在你可以通过自定义指令和技能让 Replit Agent 学会你的惯例。 它会在每个项目中自动将这些考虑进去。
推荐理由:Replit Agent 终于学会记住你的偏好了,自定义指令能让它更像一个了解你工作习惯的同事,不用每次重复项目结构、品牌规范,做 side project 的效率会明显提升。
Linear Agent 推出编码会话、自动分类和 Diffs 代码审查,使智能体可直接从 issue 进入代码实现、自动调查并修复问题,并在 Linear 内完成代码审查与合并。编码会话基于 Claude Code 或 Codex 在云端运行,结果归组织所有。过去一个月,Linear Agent 已合并近 700 个 PR。
推荐理由:Coding sessions 让 Linear Agent 直接从 issue 跳到实现,团队可以共享和介入,比单人编程 agent 有意义得多,是开发流程的进化。
我们正在将 Deep Research 作为原生技能集成到 Computer 中。 它现在连接到驱动 Computer 的智能体框架,可访问搜索即代码生成、长运行沙箱、连接器、工具和授权数据。 Pro 和 Max 订阅者现已可用。
推荐理由:Perplexity 把深度研究直接嵌进 Computer 的 agent 层,等于给自主代理加了个研究引擎,Pro 用户现在就能用,对需要大量调研的开发者或产品人来说是个效率飞轮。
Cursor 近日推出 Auto-review,通过一个专门的分类器智能体在工具调用前审查动作风险。该分类器根据上下文判断动作是否与用户意图一致,高风险时阻止并返回解释给父智能体,低风险时放行。分类器采用小模型,运行在智能体循环内以避免额外延迟,并能读取工作区文件辅助判断。测试基于约12小时内部开发会话生成的6122条标签数据,以及针对读取密钥、操作生产数据等危险场景的合成数据。设计目标是在不频繁阻断日常开发的前提下,拦截风险动作。
推荐理由:Cursor把agent监管从"是/否"开关变成了可调节的刻度盘,一个专用小模型实时判断操作风险,高风险时给反馈让父agent换个安全方案,而非频繁打断用户。用Cursor的开发者都得了解这个逻辑。
@MongoDB 插件已在 Grok Build 插件市场上线。 通过单个提示词,探索数据、优化数据库性能并构建高性能向量搜索系统。
推荐理由:Grok 插件市场开始落地,MongoDB 插件让开发者可以用自然语言直接操作数据库,这是 Grok 从聊天工具转向开发助手的关键一步。
终于能一目了然地查看你的顶级人类与顶级 AI 智能体了。 附带一个 API,可随时间查询你所有的数据 📊
推荐理由:如果你团队在用 OpenRouter 接各种模型,这个 Activity Explorer 终于让你能看清每个人和每个 Agent 分别花了多少 token、命中了多少缓存,费用透明了,对工程管理很有用。
2026年6月11日,小米旗下 MiMo Code 项目正式发布并开源,相关代码已托管于 mimo.xiaomi.com 供社区访问。
推荐理由:小米下场做 AI 编程工具,直接开源,121 个 HN 点赞说明社区有期待,对标 Cursor 还是自成一路,得看实际体验。
xAI 今日发布 Grok Build 内置插件市场。插件将技能、斜杠命令、AI 智能体、钩子、MCP 服务器和 LSP 打包为可安装包,用户无需离开终端即可浏览、安装和更新。首发合作伙伴包括 MongoDB、Vercel、Sentry、Chrome DevTools、Cloudflare 和 Superpowers。在 Grok Build 中输入 `/marketplace` 或使用 CLI 即可安装,每个远程插件均固定到特定 commit SHA 并经过验证。开发者可提交 PR 到 xai-org/plugin-marketplace 发布自己的插件。
推荐理由:Grok Build 这下可以像浏览器装扩展一样装插件了,涵盖数据库、部署、调试,开发者不必离开终端,这类集成对 AI 编程环境的体验影响挺大的。
OpenRouter指出,企业不应只依赖一家LLM供应商,而应采用多模型路由策略以平衡成本与效果。Anthropic Opus 4.7的“tokenizer税”导致输入token增加35%,新模型Fable定价$10/M输入、$50/M输出,OpenAI GPT-5.5 Pro更高达$30/M输入、$180/M输出。用户正主动跨模型族分配任务,平台3月至4月新增90个模型。OpenRouter作为统一市场,通过标准化API消除切换成本,使路由成为“一等公民”。
推荐理由:OpenRouter 放出的多模型使用数据很实在,成本压力正推动企业从专一走向多模型路由,新分析 API 让这个趋势可度量。
Grok Build 插件市场现已进入 Beta 测试阶段。 从终端使用 MongoDB、Vercel、Sentry、Cloudflare 和 Chrome DevTools 插件进行构建。 了解更多 https://x.ai/news/grok-plugin-marketplace
推荐理由:Grok Build 有了插件市场,你可以直接在终端里调 MongoDB、Vercel、Sentry 这些,Beta 阶段已经开了口子,做 Grok 开发的朋友可以先摸一遍,看看能不能把常用工作流串起来。
使用我们的基准探索器,为10个不同基准绘制帕累托曲线。 更多功能即将推出!https://openrouter.ai/rankings#benchmarks
推荐理由:老是纠结选哪个模型又便宜又好用?OpenRouter 这个基准浏览器把性能和价格画成帕累托曲线,一眼看出性价比之王,选型党必备。
Gemini 的 Notebooks 功能现已面向欧洲经济区、英国和瑞士用户开放。Notebooks 提供一个独立专注的空间,可记忆用户的来源、指令和聊天记录,用于组织项目。用户可通过 gemini.google 或应用创建自己的 notebook。该功能旨在将用户常聊的话题归入独立空间,帮助保持条理。
推荐理由:地区解锁而非新功能,EEA 用户终于能用 Notebooks 整理会话了,其他地区的人看看就好。
推出生成式滑块。 现在您可以控制使用 Krea 2 生成的任何图像的强度、复杂度和运动。 你希望看到哪些新控制?👇
推荐理由:Krea 2 终于加上了控制强度、复杂度和运动轨迹的滑块,以前调参靠抽卡,现在能精准控制了,做图的人应该会喜欢。
阿里云今日推出 Meoo(秒悟)开源命令行工具 Meoo CLI,面向开发者,支持 Claude Code、Codex、Cursor 等本地 AI 编程助手。通过调用阿里云云端能力,可自动完成数据库接入、用户登录、文件存储及项目发布,将本地项目一键部署上线并生成可分享的访问链接。该工具定位为本地 Agent 与秒悟云端能力的连接入口,已开放下载,支持主流 Linux、macOS 及 Windows 平台。
推荐理由:本地AI编程工具产出的项目终于有了一条直通云端的管道,Meoo CLI 把数据库、鉴权、部署这些脏活全包了,非前端也可以把原型直接变成产品。
千问上线首个足球预测AI助手,基于海量大数据(含历史比赛、球员数据、伤病、美加墨地貌及天气等)。以6月22日挪威对塞内加尔为例,预测“1:1平局”,理由为气候差异。活动:参与全部104场竞猜,预测超80场且准确率超千问可抽万元大奖(100个名额);预测超32场可抽千问AI眼镜G1(1000副),该眼镜支持赛后分析、拍屏识球员及赛事结果订阅。累积积分将向乡村学校捐建足球场,目标至少50所。
推荐理由:千问把AI预测和世界杯热点捆绑,玩法不算新鲜,但捐球场的设计让这件事多了点人情味。如果你对预测模型感兴趣,可以看看它怎么处理天气和地貌数据,虽然实际准确率还得踢了才知道。
腾讯混元 AI Infra 团队开源升级 HPC-Ops 推理算子库,推出五大核心算子。Attention 采用运行时动态负载调度,长文本最高加速 2.95x,端到端 QPM 提升 17%;Router GEMM 以双 BF16 组合实现 FP32 精度,对比 CuBLAS FP32 最高提速 3.22x;FusedMoE 相对 vLLM、SGLang 性能提升 1.2x~1.6x;Fused AllReduce+Norm 对比主流方案最高提速 1.68x;Sampler 将解码采样融合为 2 个 CUDA Kernel,相对 vLLM 提速 4.0x~7.5x。所有能力均来自生产实践并完全开源。
推荐理由:腾讯混元把推理全链路的瓶颈都加速了一遍,Sampler 算子比 vLLM 快 4-7 倍,Attention 动态调度根治长尾延迟,这套开源算子库可以直接用,做推理部署的可以抄作业。
Deezer 将扫描用户在其它流媒体平台的播放列表,检测其中的 AI 生成音乐。Deezer 是最早标记 AI 生成音乐的大型流媒体服务之一,曾向其他平台提供该技术但少有采纳。Deezer CEO Alexis Lanternier 表示,由于没有其他公司跟进,他们决定让用户无论使用哪个平台,都能检查自己的播放列表中是否包含合成音乐。
推荐理由:Deezer这手挺狠,自家技术没人买账就做成免费跨平台工具,现在用Spotify和Apple Music的人也能扫歌单了,对在意音乐‘血统’的人来说是个刚需小功能。
小米发布并开源终端AI编程助手MiMo Code V0.1.0,采用MIT协议。内置限时免费MiMo-V2.5多模态模型,性能比肩Claude Sonnet 4.6;支持接入DeepSeek、Kimi、GLM等模型。核心能力包括持久记忆系统(项目记忆、会话检查点、任务进度)和无限上下文——通过独立subagent自动保存状态解决长会话遗忘。独创Compose模式实现模型与Agent协同优化,SWE-Bench Pro达62%(Claude Code 57%),Terminal Bench 2达73%(68%)。内置语音输入和/dream命令,每7天自动合并记忆。终端输入`mimo`即可使用,所有设置中文汉化。
推荐理由:小米悄悄发了MiMo Code,开源且免费,用记忆系统和Compose模式解决了AI编程两大顽疾:健忘和跑偏,实测比同模型Claude Code更强,开发者现在就能装上试。
子智能体现可创建自己的子智能体,最多嵌套5层。Amazon Bedrock 在未设置 AWS_REGION 时从 ~/.aws/config 读取区域。插件市场新增搜索栏。修复了使用1M上下文且无使用额度的会话永久卡住的问题,现会自动压缩回标准上下文限制。修复了多个图片导致重复报错等问题。改进了长对话性能,减少冗余消息归一化和不必要的UI重绘,降低空闲CPU占用。Claude in Chrome 工具加载改为单次批量调用。/code-review 在未登录时保留 ultra 选项并提示需要 claude.ai 账户。
推荐理由:子代理现在可以递归生成子代理(最多 5 层),这个特性让复杂的多 agent 编排成为可能,但总体还是以 bug 修复为主,Bedrock 的区域读取也更顺手了,Claude Code 用户直接升级即可。
Cursor 的代码审查工具 Bugbot 迎来重大更新:运行速度提升超 3 倍,成本降低 22%,每轮审查多发现 10% 的 bug,90% 的运行在三分钟内完成。新增 `/review` 命令,可在推送代码前运行 Bugbot 和安全审查,并与 GitHub/GitLab 同步——若已通过 `/review` 审查过同一 diff,打开 PR 时 Bugbot 会自动跳过并备注。支持配置仅审查 PR 中新增内容。性能提升源于驱动 Bugbot 的 Composer 2.5 模型训练改进。Bugbot 遵循模型阻止列表,若组织禁用 Composer 2.5 则自动回退。该功能已在 Cursor 3.7+ 和 cursor.com/agents 上线,CLI 支持即将推出。
推荐理由:Cursor 的 Bugbot 三倍速跑 review 还便宜了 22%,这次更新让「commit 前先审一遍」变得几乎无痛,对日常开发流是个实在提升。
M3 在 @0G_labs 上链。 可验证 + 私有计算,6 月 15–18 日免费运行。
推荐理由:M3 自己是开源榜头名,现在拉到链上跑还免费用四天,做隐私计算和链上 agent 的开发者可以直接冲。
Claude Fable 5 现已在 Computer 中作为编排模型可用。 这是Anthropic最先进的模型,适用于长而复杂的任务。仅限 Computer 的 Pro 和 Max 订阅用户使用。
推荐理由:Claude Fable 5 在 Comet 里当指挥,Pro 用户现在能用上 Anthropic 最擅长长任务的模型,做复杂研究流的可以试试看能不能真的替代手动编排。
Anthropic 推出 Claude Managed Agents,一套可组合 API 套件,用于构建和部署生产级智能体。该产品从早期简单 API 演进至 Claude Agent SDK,再到将智能体调度层与代码执行沙箱解耦的 Managed Agents。通过只追加日志的会话机制,Managed Agents 解决了托管伸缩、会话持久化、文件系统管理、执行隔离、凭证安全与可观测性等生产部署挑战。团队借助该方案可在数天内完成从原型到生产环境的转化,无需自建基础设施。
推荐理由:Claude Managed Agents 把代理部署的复杂基础设施打包成了 API,让团队从原型到上线只需几天而不是几个月,尤其凭证隔离和延迟优化对生产环境很关键,想部署可靠代理的团队可以认真看看。
小米发布并开源终端 AI 编程助手 MiMo Code V0.1.0,基于 OpenCode 二次开发,采用 MIT 协议。其内置限时免费的 MiMo-V2.5 多模态模型,支持接入 DeepSeek、Kimi、GLM 等,并配备持久记忆系统与独创 Compose 模式。
推荐理由:MiMo Code与Claude Code的实测对比,展示了「慢写快验」规划型Agent比快速生成但欠测试的方式总成本更低,这一结果可为评估编程助手工作流提供参照。
Apple开发者新消息:Foundation Models支持现在可让开发者使用Apple的Foundation Models框架来调用Claude,进行多步骤推理、代码生成和更长上下文处理。
推荐理由:Apple 的 Foundation Models 框架终于纳入 Claude,iOS/macOS 开发者可以直接在原生环境调用强推理和长上下文能力,做 AI 应用的值得去试试集成效果。
大多数人在发布项目前会运行安全扫描以检测恶意包 但风险从安装的那一刻就已开始 今天,我们正式推出 Package Firewall,与 Socket 合作构建 它在恶意软件到达你的应用之前就将其拦截
推荐理由:Replit 跟 Socket 合作搞了个包防火墙,自动拦截恶意依赖,对经常在 Replit 上跑项目的开发者是个实用补丁,但算不上大版本更新,普通用户可能无感。
Google更新搜索交互数据保存方式,新增“Search Services History”设置,用于保存用户搜索时使用的图片、文件、音频和视频,包括Google Lens搜索的图片、实时搜索工具Search Live的录音、语音搜索和Translate中的语音片段。这些数据将被用于“提供、改进和开发AI模型”。用户可关闭该设置并禁用“Save Media”选项以避免保存。
推荐理由:Google这回悄悄把图片、录音存下来训练AI,默认开启,虽然可以关,但灰度操作值得每个用搜索的人看一眼。
Suno 对音轨分离功能进行重构,推出三种拆分方式:Auto Split 将歌曲自动拆分为最多 12 个音轨(鼓、贝斯、吉他等);Split from Mix 可隔离或移除特定乐器/人声并生成伴奏轨道;Advanced Split(仅 Premier 订阅)支持从近 100 种乐器中精确提取目标音轨。与常规切割算法不同,Suno 使用最新模型从零重新生成每个音轨,而非从混音中切割,以消除串音和音质损失。该功能适用于 Pro 和 Premier 订阅用户,可用于 Suno 创作或上传的音乐。
推荐理由:Suno 重写了 stem separation,不再是旧路子切音频,而是用模型重新生成干净的干声,鼓点有劲、人声没杂音,还能拆上百种乐器,做混音的人可以试试。
今天,我们在 OpenRouter 上推出了新的 Activity explorer。 这是查看你和团队在每个模型上花费了多少的最佳方式,还包括 token、缓存命中率、智能体以及趋势。所有数据实时更新。 看看我们的团队如何使用 Fable 和其他模型 👇
推荐理由:OpenRouter 把花费追踪做成实时面板,对重度依赖模型路由的开发者是个实用小升级,但零账户用户直接跳过。