AI 日报 · 2026 年 4 月 25 日 · 星期六
由来科技
GPT-5.5正式登陆GitHub Copilot
gpt-5.5 现已登陆 GitHub Copilot! [引用 @github]:🆕 @OpenAIDevs GPT-5.5 现已全面推出,并正在 GitHub Copilot 中逐步上线。 我们的早期测试显示 ➡️ 它在复杂的智能体编码任务上表现出最强的性能 ➡️ 它解决了以往 GPT 模型无法应对的实际编码挑战 请在 Copilot CLI 或 @code 中试用。👇 https://github.blog/changelog/2026-04-24-gpt-5-5-is-generally-available-for-github-copilot/
产品发布/更新
Sakana AI发布多智能体协调系统Sakana Fugu并开启Beta测试
Sakana AI推出其首款商用AI产品Sakana Fugu,这是一个多智能体协调系统,现已开放Beta测试。该系统能动态协调多个前沿基础模型,为每个任务自主选择最优的智能体组合与角色分配,并在SWE-Pro、GPQA-D和ALE-Bench等基准测试中取得了领先成绩。产品提供OpenAI兼容API,便于集成。包含两个版本:Fugu Mini针对低延迟优化,注重高速协调;Fugu Ultra则利用完整模型池,适用于深度复杂推理任务。
Sakana AI发布多智能体编排系统Fugu测试版
Sakana AI推出其首款商用AI产品Sakana Fugu的Beta测试,这是一个多智能体编排系统。该系统能动态协调多个前沿基础模型,为每个任务自主选择最优的智能体组合与角色分工,并在SWE-Pro、GPQA-D和ALE-Bench等基准测试中取得了新的SOTA成绩。产品提供OpenAI兼容API,便于集成到现有工作流。其包含两个版本:侧重低延迟的Fugu Mini和利用完整模型池进行深度推理的Fugu Ultra。
Sakana公司推出商业AI产品Sakana Fugu测试版:多智能体编排系统
Sakana公司正式推出其商业AI产品Sakana Fugu的测试版,这是一个多智能体编排系统。该系统在SWE-Pro、GPQA-D和ALE-Bench等多个基准测试中达到了业界领先水平,能够动态协调前沿模型,为每个任务自主选择最优的智能体组合与角色。Fugu提供与OpenAI兼容的API,便于用户以最小改动集成到现有工作流中。产品线包括针对低延迟优化的Fugu Mini,以及利用完整模型池进行深度复杂推理的Fugu Ultra。目前可通过申请链接参与测试。
Agent SDK:在 OpenRouter 上构建多轮智能体工作流
OpenRouter 发布 Agent SDK,其核心是 callModel 函数。该函数可将一次聊天完成转化为具备工具调用、停止条件与成本追踪功能的多步骤智能体工作流。这一工具兼容平台上的 300 多个模型,使开发者能够便捷地构建复杂的多轮交互智能体应用。
使用 Agent SDK 构建你自己的 Harness
Anthropic 发布了 Agent SDK,开发者可利用 `create-agent-tui` 和 `create-headless-agent` 技能,在几分钟内搭建个性化的编码智能体。该 SDK 支持两种模式:一是提供终端用户界面的交互式代理,二是无界面的“headless”代理,便于集成到自动化脚本和流水线中。这显著降低了为特定编码任务定制 AI 助手的门槛。
微软/GitHub Copilot-加拿大
该GitHub仓库涉及Microsoft GitHub Copilot在加拿大的配置项目,目前需要用户完成初始设置。用户必须访问指定网站URL来配置仓库并设置访问控制权限,以确保项目安全和管理协作。这一步骤包括仓库初始化、权限分配和安全管理措施,完成后仓库将支持后续开发或功能部署。设置过程强调访问控制的重要性,以维护代码安全和团队协作效率。
行业动态
SGLang与Miles在发布首日为DeepSeek-V4提供全栈支持
SGLang团队宣布,在DeepSeek-V4发布首日即通过SGLang推理引擎和Miles训练框架为其提供全栈支持。该开源技术栈针对DeepSeek-V4的混合稀疏注意力、流形约束超连接和FP4专家权重等新架构特性进行了系统优化。在推理侧,推出了ShadowRadix前缀缓存、HiSparse分层内存加速、多令牌预测推测解码等关键技术。在强化学习训练侧,Miles支持包括DP/TP/SP/EP/PP/CP在内的全并行策略、TileLang注意力及FP8训练,显著提升了训练稳定性。该技术栈支持多种主流硬件平台。
AI时代的竞争战略:商品化互补品
本文以Google和Anthropic为例,阐述了“商品化互补品”的竞争战略。Google通过免费提供地图、邮箱、浏览器和移动操作系统,扫清了用户使用其核心搜索服务的障碍。Anthropic效仿此策略,发布了一系列免费或强大的互补产品(如MCP数据标准、Claude代码安全工具等),以推动其核心AI模型的应用。该战略的核心在于通过广泛使用收集更多数据,从而训练出更智能的模型,形成增长飞轮,但同时也可能抑制互补品领域的独立创新。
关于我们选举保障措施的更新
Anthropic宣布了针对2024年美国中期选举及全球其他主要选举的Claude模型安全保障措施更新。核心举措包括:通过宪法原则和系统提示训练模型保持政治中立,最新评估显示Opus 4.7和Sonnet 4.6在政治话题平衡性上分别获得95%和96%的高分。模型严格执行使用政策,在包含600个提示的选举相关测试中,Opus 4.7和Sonnet 4.6对合法请求的遵守率分别为100%和99.8%,对有害请求的拒绝率也接近100%。针对影响力操作的多轮模拟测试中,两款模型恰当回应率分别达94%和90%。此外,Claude.ai平台将继续通过选举横幅功能,在用户查询投票信息时提供指向TurboVote等权威非党派资源的链接。
NousResearch/Anonymizer
NousResearch发布了NeMo Anonymizer工具,旨在检测和保护文本中的个人身份信息。该工具通过上下文感知的替换与重写技术,自动识别PII数据,如姓名、地址、电话号码等,并用安全等效内容进行替换或改写,以保障数据隐私。它支持多种PII类型,并能适应不同语境,确保匿名化后的文本保持可读性和实用性。这一工具适用于数据处理、模型训练等场景,帮助用户合规地处理敏感信息。
8 个使用 Gemini 整理空间(与生活)的技巧
Gemini 提供了利用 AI 整理家居和数字空间的一系列技巧。这些建议包括制定智能清洁计划、高效整理收件箱以及管理季节性家务。用户可以通过这些 AI 驱动的功能,系统化地优化物理和数字环境,从而提升日常生活的条理性和效率。
NousResearch/NemoClaw:在 NVIDIA OpenShell 中通过托管推理更安全地运行 OpenClaw
NousResearch 发布了 NemoClaw,这是一个在 NVIDIA OpenShell 环境中运行 OpenClaw 的解决方案。其核心变化是引入了“托管推理”模式,旨在显著提升运行过程的安全性。该方案通过将推理任务交由受管理的、隔离的环境执行,来减少潜在的安全风险,使得开发者能够更安全地利用 OpenClaw 模型的能力。
Anthropic与NEC合作,共建日本最大AI工程团队
Anthropic与NEC达成战略合作,旨在打造日本规模最大的AI原生工程团队。NEC将成为Anthropic在日本的首个全球合作伙伴,为集团全球约3万名员工部署Claude AI工具。双方将针对金融、制造和地方政府等领域,联合开发安全的行业专用AI解决方案,并将Claude集成到NEC的安全运营中心及下一代网络安全服务中。NEC内部将设立卓越中心,通过技术培训构建AI工程团队,并广泛应用Claude Code等工具。目前,全球员工的工具部署与行业解决方案的联合开发已同步启动。
huggingface/hlh-server 独立私有服务器仓库
hlh-server 是为“Humanity's Last Hackathon”提供的独立私有服务器仓库,主要暴露用于健康检查、用户配置和提交的API端点。运行要求服务器主机安装Python 3.12+、完成认证的popcorn CLI,并在启用捆绑包上传时配置Hugging Face凭证。服务支持两种性能剖析运行模式:默认的“service”模式在服务器主机上直接运行,而“github”模式则通过gh CLI分派GitHub Actions工作流。提交功能在服务端运行`popcorn submit`,并可选择启用后续的捆绑包上传至Hugging Face Hub。
论文研究
能动世界建模:基础、能力、法则与超越
随着AI系统从生成文本转向通过持续交互实现目标,环境动态建模成为核心瓶颈。研究提出“能力层级×法则体系”二维分类框架:能力层级包括L1预测器(学习单步转移)、L2模拟器(多步推演)和L3演化器(自主修正模型);法则体系涵盖物理、数字、社会与科学四大领域,约束模型并标识失效场景。基于此,综合分析了400多项工作和100多个系统,涉及基于模型的强化学习、视频生成、网络智能体等。研究还提出决策中心评价原则、最小可复现评估包,并概述架构指导、开放问题与治理挑战,规划了从被动预测到模拟并最终重塑环境的世界模型路线图。
通过深度学习驱动的IRES发现与从头生成实现可编程RNA翻译
研究人员开发了一个端到端的人工智能框架,用于精确控制蛋白质表达。该框架包含三个核心模型:IRES-LM语言模型在46,774条序列上训练,预测线性mRNA内部核糖体进入位点的曲线下面积和F1分数比现有方法提升15%,并能准确识别全部21个已验证的环状RNA IRES。IRES-EA进化算法对37,293个非IRES序列的计算评估显示60%被预测获得功能,并通过12,000条突变序列的大规模平行报告实验验证,其中98.4%确实获得了IRES功能。IRES-DM扩散模型从头生成的新IRES序列性能超越现有最佳方法,另一组12,000条生成序列的实验验证显示99.3%具有可检测的IRES活性。该框架能生成从类天然到结构保守但序列各异的设计…
DeepDrugDiscovery平台发现可穿透血脑屏障的阿尔茨海默病自噬增强剂
针对自噬功能障碍这一阿尔茨海默病的关键驱动因素,研究团队开发了名为DeepDrugDiscovery的AI驱动药物发现平台。该平台整合ADMET与血脑屏障穿透性预测,成功识别出新型、不依赖mTOR通路的自噬增强化合物。其中两种先导化合物在蠕虫和小鼠模型中,能有效穿透血脑屏障、清除疾病相关蛋白聚集体并恢复记忆功能。该平台已作为开源工具发布,为快速发现机制导向疗法提供了一个可扩展且整合跨物种验证的AI筛选流程。
利用统一多模态嵌入系统解码病理形态和分子图谱
Multi-Embed是一个统一且可解释的多模态学习框架,用于整合多级病理形态和多层分子图谱。该框架在形态-分子推断与整合、细粒度组织架构识别和时空轨迹建模等多项基准任务中表现出卓越性能,覆盖12种癌症类型的数据集。它通过跨模态学习提升疾病生物学理解,为疾病发病机制研究提供新工具,代码和在线交互平台已公开可用,支持精准医学应用。
Learning Long-Term Motion Embeddings for Efficient Kinematics Generation
研究提出了一种通过长时运动嵌入来高效生成运动学的方法,直接对从追踪器模型获取的大规模轨迹中学习到的嵌入进行操作,将场景动态建模效率提升了数个数量级。该方法能够根据文本提示或空间戳指定的目标,高效生成长而真实的运动序列,避免了传统全视频合成在探索多种可能未来时效率低下的问题。