OpenAI 将收购 Astral
OpenAI 收购 Astral,加速 Codex 发展以支持下一代 Python 开发工具。Astral 是 Python 生态重要工具开发商,此次收购将整合其技术能力,强化 OpenAI 在开发者工具领域的布局。
推荐理由:OpenAI收购Astral加强Codex Python工具链,Agent能力再升级
让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。
OpenAI 收购 Astral,加速 Codex 发展以支持下一代 Python 开发工具。Astral 是 Python 生态重要工具开发商,此次收购将整合其技术能力,强化 OpenAI 在开发者工具领域的布局。
推荐理由:OpenAI收购Astral加强Codex Python工具链,Agent能力再升级
Qwen3.5-Max-Preview 已登陆 LMSYS Chatbot Arena。Qwen Studio 提供聊天机器人、图像与视频理解、图像生成、文档处理、网页搜索、工具调用及 artifacts 等全栈功能。
推荐理由:阿里 Qwen3.5-Max 预览版上线 Arena,支持多模态理解与工具调用
Cognition 宣布 Devin 可将大型任务拆解并委派给多个并行运行的 managed Devins。每个子 Devin 在独立虚拟机中运行,拥有自己的终端、浏览器、开发环境和会话链接,主 Devin 负责拆分任务、分配工作、监控进度并汇总结果,还能读取子会话轨迹以改进后续任务拆解。用户可监控 ACU 消耗、发送中途指令、暂停或终止子会话。功能现已对所有用户开放。
推荐理由:原文给出了多智能体协作的能力细节和适用场景,读者可以据此判断它是否适合拆解自己的大型编码任务。
LlamaIndex 开源 LiteParse,一个完全本地运行的 CLI 和 TS 原生库,可从 PDF、Office 文档和图片中提取布局感知文本,无需 Python 依赖,内置 Tesseract.js OCR 并支持外接 PaddleOCR、EasyOCR 等 OCR 服务。
推荐理由:开源工具主打本地快速解析加截图兜底的 Agent 模式,并自建评测对比 PyPDF 等基线,读者可评估是否迁移现有解析流程。
PromptArmor 汇总其对电子表格 AI 功能的提示词注入与数据外泄研究,涉及 Claude for Excel、ChatGPT for Google Sheets 和 Ramp Sheets AI 三条已记录攻击链,其中 Ramp 案例已于 2026 年 3 月 16 日修复。
推荐理由:原文基于多起已披露攻击链,归纳出电子表格 AI 的间接提示词注入风险面,并给出可复用的威胁模型和风险来源清单。
一套包含MCP、A2A等六种协议的新工具集正式发布,旨在通过标准化AI代理的数据访问与通信方式,消除定制集成代码的需求。以“厨房管理员”代理为例,这些协议能实时核查库存、通过UCP进行批发交易,并借助AP2完成安全支付授权。开发者使用Agent开发套件(ADK)还可实现A2UI与AG-UI,为用户提供交互式仪表板与无缝流式界面。
推荐理由:开发者能快速掌握AI代理通信标准,提升集成效率。
GPT-5.4 mini 现已登陆 ChatGPT、Codex 和 API。 针对编程、计算机使用、多模态理解和子智能体进行了优化。而且它的速度是 GPT-5 mini 的 2 倍。 https://openai.com/index/introducing-gpt-5-4-mini-and-nano/ https://t.co/sirArgn37L
推荐理由:OpenAI 发布 GPT-5.4 mini,针对编码和 Agent 优化且速度翻倍
GPT-5.4 mini 今日在 ChatGPT、Codex 和 API 中可用。针对编程、计算机使用、多模态理解和子代理场景优化,推理速度比 GPT-5 mini 快 2 倍。
推荐理由:OpenAI 发布 GPT-5.4 mini,支持子代理且速度翻倍
M2.7是M2系列中首个深度参与自身进化的模型。它能构建复杂的智能体框架,完成精细的生产力任务,尤其在软件工程方面表现突出,其SWE-Pro基准测试得分56.22%,接近Opus的最佳水平。模型的办公软件处理能力在开源模型中领先,GDPval-AA的ELO分数为1495。M2.7能保持97%的技能遵循率,处理超过40个、每个超过2000 token的复杂技能。该模型通过内部研究智能体框架,实现了“分析-修改-评估”的自主迭代优化循环,在内部评估中提升了性能。
推荐理由:MiniMax M2.7 让模型参与自身进化,在 SWE-Pro 和 VIBE-Pro 上接近 Opus 水平,Agent Teams 设计也值得看,但整体仍是追赶者姿态。
H公司发布了多模态计算机使用模型Holotron-12B。该模型基于NVIDIA开源的Nemotron-Nano-12B-VL模型,使用专有数据混合进行训练,专注于在交互环境中高效感知、决策和行动。其采用混合状态空间模型与注意力机制架构,在单张H100 GPU上实现了比前代Holo2-8B高2倍以上的吞吐量,在100并发基准测试中达到每秒8900个token。在WebVoyager基准测试中,性能从基线的35.1%提升至80.5%,在定位和导航基准上也显著提升。模型已通过NVIDIA开放模型许可在Hugging Face发布。
推荐理由:高效推理的计算机使用代理模型,适合生产部署,开发者可直接试用。
GPT-5.4 mini 与 nano 发布,为 GPT-5.4 的轻量高速版本,针对编程、工具调用、多模态推理及高并发 API 和子代理任务优化。
推荐理由:OpenAI 发布 GPT-5.4 mini/nano,针对编码与 Agent 场景优化
Codex 新增 Subagents 功能,支持创建专业子代理并行处理任务,保持主上下文窗口整洁,并可实时引导单个代理,让工作流大幅提速。
子代理现已在 Codex 中可用。 你可以通过启动专门的代理来加速你的工作流程,以便: • 保持你的主上下文窗口干净 • 并行处理任务的不同部分 • 随着工作进展,分别引导各个代理 https://t.co/QJC2ZYtYcA
推荐理由:OpenAI Codex 正式支持子代理,可并行处理复杂编程任务
Sam Altman 称赞 Codex 团队是硬核构建者,产品实力过硬,圈内硬核开发者已纷纷转向使用,使用量正快速增长。
Codex 团队是硬核的构建者,这一点在他们的作品中体现得淋漓尽致。我认识的硬核构建者全都转投了 Codex,这毫不意外。 Codex 的使用量正在飞速增长:https://t.co/lRKcNJDY8n
推荐理由:OpenAI 高层确认 Codex 使用量激增,硬核开发者正集体迁移
远程控制 - 会话生成: 运行 claude remote-control,然后在移动应用中生成一个新的本地会话。 * 面向 Max、Team 和 Enterprise 推出(>=2.1.74) *已在移动端设置好 GH(即将放宽) * 正在努力加快会话启动时间 https://t.co/tFEe9hcZL6
推荐理由:Claude Code 支持手机远程启动桌面会话,随时随地开启 Vibe Coding
YC 孵化的 Compresr 发布 Context Gateway,在 AI Agent 与 LLM 间自动压缩过长对话历史。后台预计算实现即时压缩,支持 Claude Code、Cursor 等,默认 75% 上下文阈值触发。curl 一键安装,TUI 向导配置。
推荐理由:YC背书的Agent上下文压缩工具,自动优化长对话,支持Claude Code等主流Agent
100 万上下文窗口:现已面向 Claude Opus 4.6 和 Claude Sonnet 4.6 全面开放。https://t.co/jreruGukcm
推荐理由:Claude Code 默认启用 Opus 4.6 百万上下文,长代码处理能力大幅提升
Claude Opus 4.6 和 Claude Sonnet 4.6 的 100 万 token 上下文窗口现已正式开放(GA),用户可在这两款模型上使用百万级上下文处理能力。
推荐理由:Claude 4.6 系列百万 token 上下文正式开放,长文本 Agent 能力再升级
推荐理由:Claude办公套件新增跨文件上下文同步,Agent多文档协作能力再升级
@nummanali tmux 网格很棒,但我觉得需要一个合适的“代理指挥中心”IDE,用于管理成队的代理,我可以按显示器将其最大化。例如,我想要显示/隐藏切换它们,查看是否有任何处于空闲状态,弹出相关工具(例如终端)、统计信息(使用情况)等。
推荐理由:Karpathy 提出 Agent 时代 IDE 演进方向:从文件到 Agent 的编程范式转变
LlamaIndex 发文解释 AI 智能体读 PDF 难的根本原因:PDF 源自 1982 年的 PostScript,只存绘图指令而非字符,文本编码、表格、图表和阅读顺序都需要启发式推断。
推荐理由:文章从 PDF 格式底层设计讲清解析困难的根源,并给出文本提取与视觉模型结合的可迁移架构思路。