跳到正文
北京时间

全部动态

今日 155 条
4月15日周三
  1. Google Blog:AI(RSS)71

    Chrome 推出 Skills 功能:将优质 AI 提示词变为一键工具

    Chrome 浏览器新增 Skills 功能,支持用户发现、保存和重新组合 AI 工作流,实现一键即时复用。该功能可将常用 AI 提示词转化为可重复调用的自动化工具,避免重复输入复杂指令,提升浏览器内的 AI 使用效率。用户能够保存优质提示词并灵活改造,在 Chrome 中快速构建个性化 AI 工具库。

    推荐理由:把AI prompt存成浏览器一键工具,这个思路很直接但确实管用,省掉了每次重新输入的麻烦,对常用AI任务的效率提升是实打实的。

  2. Mistral AI:News(网页)67

    Mistral AI在Studio中发布Connectors功能,通过内置和自定义MCP连接企业数据到AI应用

    2026年4月15日,Mistral AI在Studio中推出Connectors功能,允许开发者通过可复用的连接器、直接工具调用和人工审批控制,安全地将企业数据集成到AI应用程序。所有内置连接器及自定义MCP均支持API/SDK调用,并集中注册,可在LeChat和AI Studio等平台使用。直接工具调用提供更精确的控制,而人工审批流程能在工具执行前进行安全审查。该功能旨在解决企业集成中重复构建、维护成本高和安全风险等问题,简化AI代理开发流程。

    推荐理由:Mistral 把 MCP 集成做成了平台级功能,一次注册就可在所有应用里复用,加上直接工具调用和人在环审批,对用 Mistral 构建企业 agent 的团队是实打实的生产力提升。

4月14日周二
  1. Cognition 模型 / Devin 博客(网页)61

    Cognition 调整 Devin 自助订阅:推出 Free/Pro/Max/Teams/Enterprise 五档并开始对 Ask Devin、DeepWiki、Devin Review 收费

    Cognition 更新 Devin 自助定价,淘汰原 Core 和 Team 计划,改为 Free、Pro($20/月)、Max($200/月)、Teams(用量计费、最低 $80/月)和 Enterprise 定制价。

    推荐理由:官方公布了具体档位价格和老用户迁移安排,想要评估 Devin 采用成本变化的团队可以据此对照现有用法。

4月13日周一
  1. Together AI 研究与产品博客(RSS)62

    Together AI 发布 EinsteinArena,AI 智能体协作刷新 11 项数学问题纪录

    Together AI 发布 EinsteinArena,一个供 AI 智能体在开放问题(从数学起步)上互动、讨论与竞争的平台,包含实时 API、公开排行榜和验证器,已完全开源。

    推荐理由:原文给出了平台机制与真实数学发现案例,读者可以据此了解多智能体协作如何推进开放问题的求解。

4月9日周四
  1. Hugging Face:Blog(RSS)81

    基于 Sentence Transformers 的多模态嵌入与重排序模型

    Sentence Transformers 开源社区发布了支持多模态的嵌入与重排序模型。新模型能够同时处理文本和图像输入,生成统一的语义向量表示,并可通过交叉编码器实现细粒度相关性重排序。该版本显著扩展了原框架的纯文本能力,支持图像-文本检索、跨模态匹配等场景,所有代码与预训练模型均已开源,延续了其推动AI民主化的目标。

    推荐理由:Sentence Transformers v5.4 把多模态嵌入和重排变成统一 API,跨模态 RAG 从试验品变成开箱即用,做多模态搜索的开发者可以直接上手复制。

  2. Claude:Blog(网页)64

    Claude Cowork 正式上线企业版功能

    Claude Cowork 向所有付费用户正式开放,并推出企业级管理控制功能。企业版管理员现可配置基于角色的访问权限、团队支出预算及 OpenTelemetry 可观测性,通过面板追踪 DAU/WAU/MAU 等使用数据。新增 Zoom MCP 连接器及按工具细分的权限控制。数据显示,目前大部分使用来自工程团队以外的运营、市场、财务和法务部门,主要用于项目更新、协作文档等任务。

    推荐理由:Claude Cowork 正式 GA 并补上企业治理拼图,角色权限、预算分析和 OTEL 日志让 IT 团队有底气推广,但它的杀手应用场景是已经被验证的非工程工作流,不是概念验证。

  3. Claude:Blog(网页)79

    顾问策略:为智能体提供智能升级

    Anthropic 在 Claude Platform 推出 advisor tool 测试版,实现"顾问策略":以 Opus 为顾问模型,Sonnet 或 Haiku 为执行模型。执行模型全程主导任务,仅在遇到决策难题时咨询 Opus 获取指导。该方案让 Sonnet 在 SWE-bench Multilingual 基准上性能提升 2.7 个百分点,同时成本降低 11.9%;Haiku 搭配 Opus 在 BrowseComp 得分达 41.2%,是单独 Haiku(19.7%)的两倍多,且比单独 Sonnet 成本低 85%。开发者只需在 API 请求中添加 advisor_20260301 工具即可启用,无需额外上下文管理。

    推荐理由:我觉得这个 advisor 模式是今年最实用的 API 设计之一,用最小的架构改动换来近 Opus 级的 agent 智能,账单却和 Sonnet 差不多,做复杂 agent 的团队可以直接套用。

4月8日周三
  1. Cursor Blog66

    Bugbot 现可通过学习规则实现自我改进

    Bugbot 的 bug 解决率已从 2025 年 7 月正式推出时的 52% 提升至近 80%,领先其他 AI 代码审查产品。其核心改进在于引入了规则学习机制,能够从实时代码审查反馈(如开发者反应、回复和人工评审意见)中自主学习,取代了原先依赖离线实验的更新模式。自测试版推出以来,已有超过 11 万个仓库启用该功能,生成了逾 4.4 万条规则。这些规则可根据信号积累被激活或禁用,帮助 Bugbot 更精准地识别问题。用户可在 Cursor Dashboard 中管理学习规则,以优化审查效果。

    推荐理由:AI code review 赛道卷了两年,Bugbot 78% 的解决率终于把第二名甩开 15 个点,关键不是分数而是它开始从真实 PR 反馈里自动学规则,做 code review 工具的该认真看看这套闭环逻辑。

  2. Factory 研究 / 产品(RSS)64

    Factory 发布桌面应用,为 Droids 提供原生界面并支持本地模型运行

    Factory 发布桌面应用,为 Droids 提供原生界面,今日上线 macOS 和 Windows。主要功能包括多智能体会话、持久化 Droid Computers(含 Cloud Computers 与 BYO Machine)、计算机操作能力、VS Code 集成、动态可视化、移动端支持,以及通过 Ollama、vLLM 等端点在本地 GPU 上运行模型、数据不出内网。

    推荐理由:官方发布给出了多智能体会话、持久化 Droid Computer 和本地模型等关键能力变化,读者可以据此评估它对现有工作流的影响。

  3. Claude Platform:开发者版本说明(RSS)67

    Claude 推出 Managed Agents 公开测试版与 ant CLI 命令行客户端

    Claude 发布 Managed Agents 公开测试版,这是一个完全托管的智能体框架,支持通过 API 创建智能体、配置容器并运行会话,具备安全沙箱、内置工具和 SSE 流式传输。同时推出 ant CLI 命令行客户端,可加速与 Claude API 的交互,原生集成 Claude Code,并支持以 YAML 文件管理 API 资源版本。

    推荐理由:Claude Managed Agents 把沙箱化代理从第三方方案变成了平台原生能力,ant CLI 则把 API 调用纳入了版本控制,这对习惯了 Claude Code 的开发团队是个自然升级,beta 阶段值得先占坑。

  4. 蚂蚁百灵:Developer Blog(网页)66

    cuLA:用 CUDA 重写线性注意力

    cuLA是一套面向GLA、KDA等线性注意力变体的高性能CUDA内核库。它通过手工优化的CuTe DSL与CUTLASS C++实现,深度适配NVIDIA Hopper和Blackwell等新一代GPU架构,旨在将复杂算法转化为可直接调用的高性能算子。其接口与flash-linear-attention保持一致,开发者仅需修改一行import即可低成本接入。性能测试显示,其内核在Blackwell和Hopper GPU上相比Triton基线实现,平均加速比最高达1.52倍。该项目已开源,并计划未来集成至FLA的统一调度机制中。

    推荐理由:蚂蚁百灵把线性注意力的 CUDA 内核做成了开箱即用的库,性能超过 Triton 基线,对于做长上下文推理优化的团队挺实用,但受众面比较窄。

4月7日周二
  1. Google Developers Blog(RSS)67

    TorchTPU:在谷歌规模上原生运行 PyTorch 于 TPU

    TorchTPU 是一个新的工程栈,旨在让 PyTorch 工作负载以最小代码改动在谷歌 TPU 基础设施上获得原生高性能体验。它采用“Eager First”设计,提供多执行模式,并利用 XLA 编译器优化大规模集群的分布式训练。项目计划到 2026 年进一步降低编译开销,扩展对动态形状和自定义内核的支持,以确保下一代 AI 实现无缝扩展。

    推荐理由:Google 终于把 PyTorch 和 TPU 拉平了,TorchTPU 用 eager 优先的设计解决了 XLA 编译的别扭感,对依赖 PyTorch 又想啃 TPU 算力的人是个实在利好。

3月30日周一
  1. Claude Platform:开发者版本说明(RSS)68

    Claude Opus 4.6 与 Sonnet 4.6 的 Message Batches API 将 max_tokens 上限提升至 300k

    Claude 将 Message Batches API 中 Opus 4.6 和 Sonnet 4.6 的 max_tokens 上限提升至 300k,需添加 `output-300k-2026-03-24` beta header 以生成长篇内容、结构化数据和大规模代码。

    推荐理由:Claude把max_tokens提到30万,对需要生成长篇内容的开发者是个实打实的解放,之前被输出长度卡住的产品可以放开了。虽然旧版1M上下文窗口被淘汰,但迁移到新模型路径清晰,不算坏事。

3月25日周三
  1. Anthropic:Engineering(事故复盘 + 工程实践 · 网页)77

    Claude Code 自动模式:在安全与效率间取得平衡

    Anthropic 为 Claude Code 推出“自动模式”,旨在解决用户因频繁手动批准而产生的“批准疲劳”。该模式介于完全手动审批和危险的无权限跳过之间,采用两层防御机制:输入层通过服务器端提示注入探测器扫描工具输出;输出层则利用基于 Sonnet 4.6 模型的转录分类器,在执行前评估操作风险。分类器采用高效的两阶段设计,先快速过滤,必要时才启动思维链推理。其目标是拦截危险操作(如过度积极行为、无心之失、提示注入等),同时让大部分安全操作无需确认即可运行,内部测试显示用户原本会批准约93%的手动提示。

    推荐理由:这是 Claude Code 从「手动审批」跳到「AI 自审」的关键一步,双层防御设计坦诚到连 17% 漏检率都公开讲,做 coding agent 的团队该把这篇当安全设计参考。

3月20日周五
  1. Cognition 模型 / Devin 博客(网页)65

    Devin 推出 Scheduled Devins,可自主安排定时任务

    Cognition 宣布 Devin 新增定时会话功能,用户只需描述周期性需求,Devin 会自行设定节奏并自动执行,无需配置 cron 或工作流。

    推荐理由:官方介绍了 Devin 定时任务的具体玩法,包括跨运行记忆和与 Managed Devins 组合并行执行,对想自动化例行工程工作的团队有直接参考。

3月19日周四
  1. Cognition 模型 / Devin 博客(网页)67

    Cognition 推出 managed Devins:Devin 可拆解任务并并行调度多个子 Devin

    Cognition 宣布 Devin 可将大型任务拆解并委派给多个并行运行的 managed Devins。每个子 Devin 在独立虚拟机中运行,拥有自己的终端、浏览器、开发环境和会话链接,主 Devin 负责拆分任务、分配工作、监控进度并汇总结果,还能读取子会话轨迹以改进后续任务拆解。用户可监控 ACU 消耗、发送中途指令、暂停或终止子会话。功能现已对所有用户开放。

    推荐理由:原文给出了多智能体协作的能力细节和适用场景,读者可以据此判断它是否适合拆解自己的大型编码任务。

  2. LlamaIndex:产品、工程与评测69

    LlamaIndex 开源 LiteParse:面向 AI Agent 的本地文档解析工具

    LlamaIndex 开源 LiteParse,一个完全本地运行的 CLI 和 TS 原生库,可从 PDF、Office 文档和图片中提取布局感知文本,无需 Python 依赖,内置 Tesseract.js OCR 并支持外接 PaddleOCR、EasyOCR 等 OCR 服务。

    推荐理由:开源工具主打本地快速解析加截图兜底的 Agent 模式,并自建评测对比 PyPDF 等基线,读者可评估是否迁移现有解析流程。

3月18日周三
  1. X:Sky Computing Lab (@haoailab)65

    FastVideo推出Dreamverse原型,实现“氛围导演”式实时视频生成

    FastVideo团队发布Dreamverse原型界面,引入创新的“氛围导演”工作流。该模式允许用户通过自然语言实时、迭代地引导视频生成,如更换背景或调整运镜,无需编写复杂的长提示词。其核心是全新的实时推理栈,能在单GPU上以约4.55秒生成5秒1080p视频,速度快于观看时间,从而将生成过程从被动等待转变为实时导演体验。团队认为,视频生成的未来在于让创作速度跟上想象速度,快速的反馈循环比单纯追求模型性能更能催生优质作品。

    推荐理由:视频生成从「等一分钟看结果」变成「边看边改」,这个交互范式转变比模型本身更值得关注。做内容创作工具的产品人,这个 demo 值得花五分钟体验一下实时迭代的手感。

3月17日周二
  1. Manus:Blog(网页)61

    Manus 升级 Google Workspace 连接器,支持 Docs、Sheets 和 Slides 的精准编辑

    Manus 发布 Google Workspace 连接器重大升级,集成 Google Workspace 团队在 GitHub 开源(非 Google 官方支持)的 Google Workspace CLI,从创建和读取文件扩展到对 Docs、Sheets、Slides 的精准编辑。

    推荐理由:原文说明升级基于开源的 Google Workspace CLI,并给出了具体操作能力与入门提示词,可对照评估自己的文档工作流。

3月16日周一
  1. Manus:Blog(网页)68

    Manus 发布桌面应用"我的电脑",让 Agent 直接操作本地机器

    Manus 发布 Manus 2.0 桌面应用的核心功能"我的电脑",将 Agent 从云端扩展到用户本地电脑,通过在本地终端执行命令行指令来读取、编辑文件和控制应用,现已面向所有 macOS 和 Windows 用户开放。

    推荐理由:Manus 官方说明桌面端如何通过终端命令操作本地文件与应用,并保留逐条审批机制,可帮读者评估本地 Agent 工作流的收益与权限代价。

3月13日周五
  1. Claude Platform:开发者版本说明(RSS)69

    Claude Opus 4.6 和 Sonnet 4.6 的 1M token 上下文窗口正式可用

    Claude Opus 4.6 和 Sonnet 4.6 的 1M token 上下文窗口现已正式可用,按标准定价计费,超过 200k token 的请求无需 beta header 即可自动生效。同时,所有支持模型的专用 1M 速率限制已移除,改用标准账户限制;使用 1M 上下文窗口时,每请求的媒体上限从 100 提升至 600 张图片或 PDF 页面。

    推荐理由:Claude 的百万 token 上下文终于从 beta 转正,200k token 以上请求不再需要 beta 头,媒体文件限制一口气提到 600 页,做长文档处理的开发者可以直接切生产。

2月26日周四
  1. OpenAI Developers:Blog(网页)66

    Codex 接入 Figma MCP server,支持设计与代码双向转换

    OpenAI 宣布 Codex 现可通过 Figma MCP server 生成和读取 Figma 设计文件。

    推荐理由:原文给出从设计到代码、再从代码回画布的双向流程和具体工具名,读者可以照此判断是否接入自己的工作流。

2月24日周二
  1. Cognition 模型 / Devin 博客(网页)64

    Cognition 发布 Devin 2.2,支持桌面端测试与自动修复

    Cognition 发布 Devin 2.2,智能体现在可用 computer use 在自己的 Linux 桌面上端到端测试网页和桌面应用,并在开 PR 前自查代码、自动修复问题,完成后回传屏幕录制供用户审阅。

    推荐理由:官方公告给出自主测试、自动修复和启动提速等具体能力变化,读者可以据此评估对现有开发流程的影响。

2月19日周四
  1. Claude Platform:开发者版本说明(RSS)60

    Claude API 推出自动缓存功能,并退役 Sonnet 3.7 与 Haiku 3.5 模型

    Claude Messages API 新增自动缓存功能,只需在请求体中添加 `cache_control` 字段,系统即可自动缓存最后一个可缓存块,无需手动管理断点,并可与现有块级缓存配合使用。

    推荐理由:自动缓存把提示缓存从手工档变成自动档,对 Messages API 高频场景的开发者是个实在的省心更新,模型退役通知则是硬切换信号,用旧模型的该迁移了。

2月11日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库61

    inclusionAI 发布高性能量化推理 GEMM 内核库 Humming

    inclusionAI 开源了 Humming,这是一个专为量化推理设计的高性能、轻量级即时编译 GEMM 内核库。它支持在 FP16、BF16、FP8 等多种激活数据类型下进行 8 比特以下任意权重类型的推理,兼容多种量化策略与缩放类型,并同时支持稠密 GEMM 和混合专家 GEMM 运算。该库兼容 SM75+ 及以上的所有 NVIDIA GPU,在多种计算场景下能提供业界领先的吞吐量和效率。其依赖极简,仅需 PyTorch 和 NVCC,软件包大小仅约 100 KB,便于超轻量化部署。

    推荐理由:蚂蚁 inclusionAI 开源了一个 100KB 级的量化 GEMM 库,支持从 INT1 到 FP8 全家桶,SM75+ 全覆盖,做推理部署的工程师值得花半小时跑一下 benchmark,看看能不能替换掉现有的 Marlin 方案。

  2. Modal 官方工程博客(RSS)71

    Modal 上线 Z.ai GLM-5 免费端点并提供自部署代码

    Z.ai 发布开源权重模型 GLM-5(MIT 许可,面向长程 Agent 和系统工程),Modal 与其合作上线免费体验端点,4 月底前可用,限单并发请求。FP8 精度下模型约 700 GB,需多 GPU 部署,Modal 用 8 张 B200 单节点配合 SGLang 运行,内部实测每用户 30-75 tokens/秒。

    推荐理由:Modal 官方给出 GLM-5 的部署细节、免费端点限制和前端接入配置,读者可直接照做在自己常用的 Agent 框架里试用。

2月10日周二
  1. Cognition 模型 / Devin 博客(网页)66

    Cognition 推出 Devin 自动修复 PR 审查评论功能

    Cognition 宣布 Devin 现在可自动修复 Devin Review 及其他审查机器人留下的 PR 评论,包括 linter、CI/CD、安全扫描和依赖管理机器人。用户可在 Settings > Customization > Autofix settings 中配置;该功能大幅增加了内部 token 消耗,但团队称 PR bug 明显减少,并缩小了人类只需处理需判断的工作。

    推荐理由:原文给出具体配置入口和适用范围,读者可以了解如何让 Devin 自动修复 PR 上的机器人评论。

  2. Prime Intellect(网页)65

    Prime Intellect 发布 Lab 全栈后训练平台,向所有人开放

    Prime Intellect 发布 Lab 平台,将 Environments Hub 与 Hosted Training、Hosted Evaluations 整合为覆盖大规模智能体 RL、推理与评估的后训练全栈平台,即日起向所有人开放。

    推荐理由:原文交代了平台构成、已开放状态和训练配置方式,读者可以判断它能否替代自建 GPU 集群做智能体后训练。

2月7日周六
  1. FireRedTeam:原创语音与多模态项目63

    FireRedTeam 开源 FireRed-OpenStoryline 对话式视频创作工具

    FireRedTeam 于 2026-02-10 正式开源 FireRed-OpenStoryline,将视频创作变为自然语言对话,支持素材搜索下载、脚本生成、BGM 与配音字体推荐,以及全流程剪辑。

    推荐理由:官方开源的对话式视频剪辑项目,覆盖素材检索、脚本生成到剪辑全流程,并可直接通过 Claude Code 等 Agent Skills 安装使用。

2月6日周五
  1. Suno:Blog(网页)57

    Suno Studio 1.2 新功能介绍

    Suno Studio 1.2 现已面向 Suno Premier 订阅用户发布。此次更新旨在为创作者提供更强大的创作与制作控制能力。主要新增功能包括:Remove FX,可移除音频片段中的效果;带量化功能的 Warp Markers,用于调整音频的时间与律动;Alternates 功能,允许在同一轨道内创建并预览声音的不同变体;以及新增对 6/8、7/8 等非 4/4 拍号的支持。这些功能让用户无需离开 Suno 平台,即可更精细地控制音乐创作过程。

    推荐理由:这是Suno为专业创作者铺的路,Warp Markers和Remove FX让AI生成音乐能真正进入后期流程,但113天前的更新,现在看更适合补课而非抢鲜。

2月2日周一
  1. OpenAI Developers(RSS)62

    OpenAI 发布 Codex 应用并演示核心工作流

    OpenAI 发布 Codex 应用,并提供了介绍性演示视频,展示该应用及其核心工作流。

    推荐理由:官方演示了 Codex 应用的核心工作流,想了解这款编码工具实际用法的读者可以从中看到直接的操作示例。

1月30日周五
  1. 蚂蚁 inclusionAI:GitHub 新仓库61

    高效离线推理框架 Flood:吞吐量显著领先,支持多模态与量化

    Flood 是一款面向离线应用的高效大语言模型推理框架。它采用流水线并行降低通信开销,并通过分段式KV缓存管理提升连续性。框架支持连续批处理、分块预填充、FP8/INT8量化及多模态模型推理。性能测试表明,其在多种模型和硬件上的吞吐量最高可达 vLLM 的 2.4 倍。其专用内核 SegmentAttention 在处理长序列时,解码速度较 FlashAttention 最高提升 3.16 倍。该项目于 2025 年 3 月开源并快速迭代,已支持前瞻解码等新特性。

    推荐理由:蚂蚁的 FLOOD 框架用流水线并行替代张量并行来压通信开销,实测吞吐比 vLLM 高 1.4 到 2.4 倍,做离线推理部署的团队值得花半小时跑一下 benchmark 看看自家场景能不能吃这个红利。

1月29日周四
  1. Claude Platform:开发者版本说明(RSS)67

    Claude API 结构化输出功能正式上线

    Claude API 结构化输出功能现已对 Claude Sonnet 4.5、Claude Opus 4.5 和 Claude Haiku 4.5 全面开放。GA 版本扩展了 schema 支持、改进了语法编译延迟,并简化了集成路径(无需 beta header)。该功能在 Amazon Bedrock 和 Microsoft Foundry 上仍为公开 beta。

    推荐理由:结构化输出终于 GA,去掉了 beta 的不确定性,对依赖 JSON 模式的生产应用是个好消息,但功能上不算重大突破,只是工程完善。

1月21日周三
  1. Cognition 模型 / Devin 博客(网页)66

    Cognition 发布 AI 代码审查工具 Devin Review

    Cognition 发布 Devin Review,一款针对 GitHub PR 的 AI 代码审查工具,称代码审查已成为 AI 编程时代的瓶颈。

    推荐理由:原文给出三项具体能力和免登录试用入口,读者可以直接对照现有 GitHub 审查流程判断是否值得替换。

12月18日周四
  1. OpenRouter:Announcements(RSS)57

    OpenRouter 推出 Response Healing:将 JSON 缺陷减少 80% 以上

    OpenRouter 推出 Response Healing 新功能,可在响应到达应用前自动修复大语言模型产生的格式错误的 JSON,从而将 JSON 缺陷减少 80% 以上。

    推荐理由:如果你无数次被 LLM 返回的残缺 JSON 搞到崩溃,OpenRouter 这个 response healing 能自动修复 80% 的缺陷,以后 debug 可以少肝半小时。

  2. OpenRouter:Announcements(RSS)61

    Response Healing:将 JSON 缺陷减少 80% 以上

    OpenRouter 推出新功能 Response Healing,可在 LLM 生成的畸形 JSON 响应抵达用户应用前自动修复。该功能旨在将 JSON 格式错误减少超过 80%,直接提升 API 响应的结构完整性与可靠性,减少下游应用的处理负担。

    推荐理由:做 Agent 的人最怕 JSON 解析炸掉整个 pipeline,OpenRouter 这个 Response Healing 相当于在网关层加了自动纠错,接入成本几乎为零,值得试试。

12月12日周五
  1. Thinking Machines Lab:News(网页)67

    Thinking Machines Lab 宣布 Tinker 全面开放并支持视觉输入

    Thinking Machines Lab 宣布 Tinker 正式开放(GA),取消候补名单,并新增四项更新:支持微调 Kimi K2 Thinking(万亿参数。

    推荐理由:官方宣布 Tinker 全面开放并新增视觉输入,附上 VLM 与传统视觉基线在少样本分类下的对比数据,可作选型参考。

12月3日周三
  1. 蚂蚁 inclusionAI:GitHub 新仓库63

    蚂蚁集团开源AState:面向强化学习的高性能状态管理系统

    蚂蚁集团开源了AState,这是一个专为强化学习设计的高性能通用状态数据管理系统。它旨在解决RL训练与推理中的I/O效率低下、权重同步性能不足及状态恢复不鲁棒等核心挑战。系统采用三层架构:提供张量原生接口的API层、支持多种部署模式的服务层以及具备高效可扩展传输能力的基础层。其关键特性包括统一的张量级API、高性能权重同步和拓扑感知设计。在万亿参数规模下,AState能在约6秒内完成权重同步,远低于业界常见的分钟级延迟,目前已作为ASystem的关键组件在蚂蚁内部生产环境部署。

    推荐理由:蚂蚁把万亿参数 RL 训练的权重同步从分钟级压到 6 秒,这套 AState 系统是真刀真枪的工程解法,做大规模 RL infra 的团队值得拆一拆它的 RDMA P2P 架构。

11月25日周二
  1. Together AI 研究与产品博客(RSS)64

    Together AI 上线 Black Forest Labs 的 FLUX.2 多参考图生图模型

    Together AI 将 Black Forest Labs 的 FLUX.2 图像模型接入 Model Library,面向 100 万以上开发者提供多参考输入、hex 色号颜色匹配和文本渲染能力。

    推荐理由:原文列出了多参考输入、hex 色号匹配和三个型号的具体参数,读者可据此判断是否接入现有生成工作流。