跳到正文
北京时间

全部动态

今日 86 条
5月6日周三
  1. Claude Code:GitHub Releases(RSS)58

    Claude Code v2.1.129 版本更新

    Claude Code 发布 v2.1.129 版本,带来多项功能新增与问题修复。新增功能包括支持通过 `--plugin-url` 从 URL 获取插件压缩包、新增 `CLAUDE_CODE_FORCE_SYNC_OUTPUT` 环境变量以强制启用终端同步输出,以及为 Homebrew 或 WinGet 安装提供后台自动更新提示。功能调整方面,插件清单中的 `themes` 和 `monitors` 现在建议在 `"experimental"` 下声明;网关模型发现功能改为通过环境变量手动启用;Ctrl+R 历史记录选择器恢复为默认搜索所有项目的提示。此外,修复了约 20 项问题,涉及 `/clear` 命令、会话标题显示、外部编辑器切换、令牌浪费、OAuth 凭证刷新、缓存警告等多个方面。

    推荐理由:Claude Code 用户最烦的 session 消失、token 浪费和缓存降级问题这次都修了,还支持从 URL 加载插件,日常体验会顺滑不少。

  2. IT之家(RSS)70

    苹果 iOS 27 将允许用户选择第三方 AI 模型,支持谷歌与 Anthropic 等

    据报道,苹果计划在秋季发布的iOS 27等系统中,推出名为“Extensions”的新功能,允许用户自行选择已通过App Store集成的第三方AI模型(如谷歌、Anthropic的模型),来驱动设备上的文本生成、图像编辑等AI功能。此举将打破此前ChatGPT作为唯一第三方选项的独占地位。同时,Siri将支持更换不同音色以区分内外模型,并迎来独立App及更深度的系统整合。苹果将在App Store设立专区展示兼容应用,并对第三方模型生成的内容免责。

    推荐理由:苹果放开 AI 模型底层的选择权,让谷歌和 Anthropic 进入原先 OpenAI 独占的地盘,这比发一个新模型更有生态意义——手机 OS 正在变成 AI 的分发渠道。

  3. X:ChatGPT (@ChatGPT)83

    ChatGPT is now available as an add-on in Excel and Google Sheets. It can help analyze messy data, w...

    ChatGPT 现已作为插件在 Excel 和 Google Sheets 中使用。 它可以帮助分析杂乱的数据、编写公式、更新电子表格,并在此过程中解释其操作——无需离开您的电子表格。 由 GPT-5.5 驱动。 https://chatgpt.com/apps/spreadsheets/

    推荐理由:直接在 Excel 里用 GPT-5.5 分析数据、写公式,不是新模型,但对每天和表格打交道的普通人来说比任何 benchmark 都实在。装个插件就能用。

  4. X:Google AI for Developers (@googleaidevs)68

    Gemini API 文件搜索工具推出三项新更新,助力多模态 RAG 系统开发

    Gemini API 文件搜索工具近日扩展三项功能更新,旨在帮助开发者更轻松地构建高精度多模态检索增强生成系统。更新包括:多模态支持,通过Gemini Embedding 2模型实现对图像和文本的同步推理;自定义元数据过滤,允许为文件添加键值标签以结构化非结构化数据,从而提升搜索速度;精确引用功能,能够捕获并返回每条索引信息的精确来源,如页码。开发者可通过Google AI Studio的示例应用体验这些功能,与图像和文档库交互,提问并追溯答案来源。

    推荐理由:如果你在用 Gemini 搭 RAG 系统,这三项更新能直接改善搜索精度和可解释性,多模态搜索终于把图片和文档打通了,值得马上试试。

  5. X:OpenAI Developers (@OpenAIDevs)73

    Agents SDK TypeScript版更新发布

    更新后的 Agents SDK 现已提供 TypeScript 版本,支持沙盒代理并内置开源测试框架。 [引用 @OpenAIDevs]:构建可长期运行的代理,获得更多对代理执行的控制权。 Agents SDK 的新功能: • 在受控沙盒中运行代理 • 检查并自定义开源测试框架 • 控制记忆创建时机及存储位置

    推荐理由:OpenAI 把 Agents SDK 带到了 TypeScript,而且直接上了沙箱和开源 harness,做 Node.js 代理的可以扔掉自研的调度层了。

  6. X:Sam Altman (@sama)69

    ChatGPT今日迎来5.5即时版重大升级

    5.5 instant 今日登陆 ChatGPT! 在我看来这是一个相当大的升级,我真的很喜欢使用它。 [引用 @ericmitchellai]:Excited that we're updating the default model in ChatGPT today! 5.5 instant 在智能、图像感知和事实准确性方面都有显著提升。 它还更新了写作风格,使其更平实、更直接。 你的愿望清单上有什么?

    推荐理由:ChatGPT 默认模型悄悄换上了 5.5 instant,图像感知和事实性提升明显,写作风格也更直接,每天用它的人今天会感觉到差异,不是小修小补。

  7. OpenAI:官网动态(RSS · 排除企业/客户案例)64

    购买ChatGPT广告的新方式

    OpenAI扩展ChatGPT广告服务,推出自助广告管理平台测试版,新增CPC竞价功能和增强的广告效果测量工具。新平台注重隐私保护,确保广告内容与用户对话相互独立,帮助广告主更精准地定位目标受众并优化广告投放效果。

    推荐理由:OpenAI 把广告变成了自助服务,CPC 竞价和 Ads Manager 是商业化一大步,对开发者生态影响不小,但对话里塞广告会不会翻车,还不好说。

  8. X:Perplexity (@perplexity_ai)71

    Perplexity与Computer接入顶级医学资源

    Perplexity和Computer现已接入优质健康资源,首批包括NEJM和BMJ集团,另有9种医学期刊和临床数据库即将上线。 提出健康问题,即可获得来自医院和研究机构所信赖的相同来源的引用答案。

    推荐理由:医疗信息最怕不靠谱,Perplexity 直接接进 NEJM 和 BMJ 这种顶刊,等于把医生的参考资料装进 AI,查健康问题终于不用在营销文里盲人摸象了。

  9. X:Satya Nadella (@satyanadella)82

    Copilot Cowork新增移动端与跨系统功能

    Copilot Cowork 新增功能:移动端、技能与插件。 现已在 iOS 和 Android 平台推出,您可通过手机委派工作,在桌面端继续处理,保持任务流畅推进。 借助全新连接器,Cowork 可跨业务系统与数据运作。

    推荐理由:Copilot Cowork 把委托工作从桌面延伸到了手机,加上 skills 和插件,办公自动化终于能随时丢任务随时捡起来,这是微软把 agent 落地的关键一步。

5月5日周二
  1. Anthropic:Newsroom(网页)77

    金融与保险智能体解决方案

    Anthropic发布了十个针对金融服务耗时任务的预置智能体模板,涵盖制作推介书、撰写信贷备忘录、KYC文件筛查及月末关账等。这些模板可作为Claude Cowork和Claude Code的插件,或作为Claude托管智能体的配置指南,帮助团队在数天内部署应用。Claude现通过Microsoft 365插件支持在Excel、PowerPoint等Office应用间无缝工作,并扩展了合作伙伴生态,新增数据连接器和MCP应用,使智能体能直接调用实时金融数据。这些更新与Claude Opus 4.7模型搭配效果最佳,该模型在金融任务上达到先进水平。

    推荐理由:Anthropic 一口气放出十个金融模板,从 pitchbook 到月底关账全包,加上 Excel、PPT、Word 的深度集成,做金融的可以少写很多重复性胶水代码,直接套模板干活去了。

  2. Runway:News(网页)80

    从单张图像构建实时视频智能体:Runway Characters技术解析

    Runway公司推出“Characters”实时视频智能体,它能将任意单张参考图像(如真人、卡通或幻想生物照片)实时转化为具有自然对话表现力的视频角色。该技术基于其通用世界模型GWM-1,无需微调即可生成每秒24帧的高清视频,并同步口型、表情和头部运动。其核心突破在于通过自回归逐帧生成、流程优化与并行化,实现了每帧仅37毫秒的模型处理时间,以及从用户停止说话到角色开始响应仅1.75秒的服务器端延迟,从而满足了实时交互对话的严苛要求。

    推荐理由:把单张图变成实时对话角色这件事,Runway 做到了 24fps 且 1.75 秒响应。不是预录,是真实时,还带了知识库和工具调用,做虚拟角色产品的可以直接拿来集成。

  3. X:SpaceXAI (@SpaceXAI)66

    Grok语音API上线情感化声音克隆功能

    两种声音。一种来自人类。一种来自AI。你能猜出哪个是AI克隆的吗?👇 具备丰富自然情感的语音克隆功能,现已在Grok Voice API上线。 http://x.ai/news/grok-custom-voices

    推荐理由:Grok 的语音克隆带着自然情绪上线 API,不只是复读机,而是带感情的合成。想给应用加个有人味的 AI 语音,开发者可以试试这套新接口。

  4. Claude Code:GitHub Releases(RSS)60

    v2.1.128版本更新

    本次更新包含多项功能优化与错误修复。主要功能上,`/color` 命令支持无参数随机选色,`/mcp` 命令显示已连接服务器的工具数量,`--plugin-dir` 参数新增支持 `.zip` 插件包。用户体验方面,优化了 `/model` 选择器的显示。关键问题修复包括:解决了通过标准输入传输超大文件时导致的崩溃循环、修复了长 URL 在全屏模式下无法逐行点击的问题,以及修正了并行 Shell 工具调用中一个命令失败会错误取消同级调用的问题。此外,还处理了 MCP 服务器重连时工具列表刷屏等多个稳定性问题。

    推荐理由:Claude Code 的日常维护版本,修了一堆小 bug 并给了 /color 随机色、插件支持 zip 等细节提升,重度用户建议升,非用户不必关注。

  5. X:SpaceXAI (@SpaceXAI)79

    语音克隆技术上线 真假难辨

    两种声音。一种来自人类。一种来自AI。你能猜出哪个是AI克隆的吗?👇 具备丰富自然情感的声音克隆功能,现已在Grok Voice API上线。 http://x.ai/news/grok-custom-voices

    推荐理由:Grok Voice API 终于支持声音克隆,关键是能带自然情感,做语音产品的开发者可以直接接入了,这是 xAI 在语音交互上的一次重要补齐。

  6. X:Google AI for Developers (@googleaidevs)72

    Gemini API支持Webhooks简化长时应用开发

    告别持续轮询!在构建复杂、长期运行的智能体应用时,使用 Gemini API 中的 Webhooks 来消除 API 流量的浪费,并简化编排逻辑。🙌

    推荐理由:长期轮询是agent开发的隐形税,Gemini API这次内置webhooks,把编排逻辑简化了一大截,做复杂agent的开发者今晚就能删掉一堆轮询代码。

  7. Google Blog:AI(RSS)71

    通过 Gemini API 中的 Webhooks 减少长时任务的摩擦与延迟

    Gemini API 引入了事件驱动的 Webhook 功能,这是一种基于推送的通知系统。它旨在消除低效的轮询需求,为长时运行的任务(如文件处理或复杂推理)提供更优的解决方案。当任务完成时,系统会自动将结果推送到用户指定的端点,从而显著降低延迟并减少资源消耗,提升开发效率与响应速度。

    推荐理由:Gemini API 终于补上 Webhooks 这块拼图,长任务不用再轮询等待,对做自动化流程和 Agent 的开发者是实打实的效率提升。

  8. X:SemiAnalysis (@SemiAnalysis_)71

    GB300 NVL72实测性能达GB200的2.7倍,凸显端到端实测价值

    在行业标准推理引擎vLLM上的测试显示,NVIDIA GB300 NVL72的实测端到端性能已达GB200 NVL72的2.7倍。尽管其纸面参数仅显示NVFP4算力提升约1.5倍、HBM容量增加1.5倍且带宽相同,但在大多数服务商实际运行的中段负载区间,凭借全栈优化的复合增益,GB300实现了远超理论算力提升的性能飞跃。此次测试基于NVIDIA、Inferact和CoreWeave为开源项目提供的临时GB300系统完成,结果印证了端到端实测性能才是衡量硬件效能的黄金标准,而非单纯的纸面理论算力。

    推荐理由:纸面 FP4 算力只多 50% 的 GB300,实际推理却快了 2.7 倍,全栈优化的复合增益比参数表好看太多,做推理服务的该重新算算 TCO 了。

  9. X:Claude Devs (@ClaudeDevs)76

    Claude平台推出无密钥验证方案

    管理API密钥是我们从客户那里听到的最主要的安全顾虑之一。 今天我们为Claude平台推出无密钥认证:通过CLI在浏览器中进行身份验证,或让工作负载使用其现有的云身份(AWS、GCP、Azure或任何OIDC令牌提供者)。

    推荐理由:无密钥认证直接解决了 API 密钥泄露这个高频痛点,而且支持主流云身份,企业部署门槛降了一大截,做 AI 集成的团队明天就可以试。

  10. X:Gemini (@GeminiApp)67

    创意速成:Nano Banana 2助力产品原型实现

    从构想到原型,借助Gemini中的Nano Banana 2,将您独特的产品愿景变为现实。🪀

    推荐理由:Google Gemini塞进一个Nano Banana 2创意工具,把想法转原型只需几句话,产品经理脑暴草案利器,算不上重磅但够实用。

  11. X:Rohan Paul (@rohanpaul_ai)74

    桌面AI代理KroWork发布:将对话转化为持久本地软件,解决会话即失痛点

    新推出的桌面AI代理KroWork旨在解决传统AI代理工作流随会话结束而消失的核心痛点。用户通过自然语言描述任务,AI即可自动构建并执行端到端工作流,最终可将完整流程保存为名为“Kro App”的持久性本地应用程序。该软件可一键安装至系统菜单,像常规软件一样运行,后续使用无需消耗tokens或重新构建。所有流程均在用户本地设备运行,无云端依赖,不泄露数据,且无需编程背景。其核心理念是实现从“聊天”到“交付”的跨越,将对话转化为用户真正拥有的可重用资产。

    推荐理由:KroWork 把 AI 会话固化成本地软件,一键安装,这个思路解决了 Agent 最大的痛点,每次重跑都得重新教它。做个人自动化的可以立即上手试试。

  12. X:Runway (@runwayml)69

    实时视频对话代理诞生

    实时视频智能体已到来。 今天,我们将分享如何构建Runway Characters,让你能将一张图片转化为一个完全富有表现力、可对话的视频智能体,以每秒24帧的高清画质流畅播放。端到端延迟仅需1.75秒。 了解更多信息请见下文。

    推荐理由:Runway 把 AI 视频从生成拉入实时对话时代,1.75 秒的延迟让视频代理第一次有了「对话感」,做交互设计的同学可以认真看一眼。

5月4日周一
  1. X:OpenClaw (@openclaw)72

    OpenClaw发布重大更新 强化文件传输与插件安全

    OpenClaw 2026.5.3 🦞 📁 配对节点间的文件传输 🧭 使用 /steer + /side 进行实时智能体控制 🔌 插件安装/更新已加固 🛠️ 频道与升级修复 重大发布,减少琐碎问题。 https://github.com/openclaw/openclaw/releases/tag/v2026.5.3

    推荐理由:OpenClaw 这个版本把 agent 协同和实时控制做得更顺手了,如果你在用多节点 agent,这个升级能省不少调试功夫。

  2. Claude Platform:开发者版本说明(RSS)67

    Claude Platform 正式推出 Workload Identity Federation

    Claude Platform 的 Workload Identity Federation 现已正式可用。该功能允许用户使用来自 AWS IAM、Google Cloud、GitHub Actions 等身份提供商的短期 OIDC 令牌认证 Claude API,替代长期静态 API 密钥。

    推荐理由:用 OIDC 短期令牌代替 API 密钥,对企业级部署是刚需级安全改进,做生产环境集成的可以告别密钥轮换脚本了。

  3. X:Peter Steinberger (@steipete)74

    开源维护机器人自动化处理流程

    这是我迄今为止为 OpenClaw 构建的最有用的工具。它是开源的,运行在 codex 上,你可以 fork 并将其用于任何代码库。 献给所有在 issue 和 PR 中辛勤工作的开源贡献者们,这是为你们准备的。

    推荐理由:开源维护者的救命稻草,把 issue 到 automerge 的冗长循环扔给 ClawSweeper 自动修复,保守但足够实用,fork 就能用在任何仓库。

  4. X:Tibo (@thsottiaux)75

    OpenAI发布Auto-Review模式,审批效率提升200倍

    上周,我们在 Codex 中发布了 *Auto-Review* 模式!它现已成为 OpenAI 内部的默认设置,并将所需的批准数量减少了约 200 倍。我们的对齐团队完成了出色的工作。 阅读博客:https://alignment.openai.com/auto-review

    推荐理由:Codex 这个自动审查模式把审批量砍了 200 倍,而且已经成了 OpenAI 内部默认设置。这意味着 AI 编程 Agent 真正开始被信任,做 Agent 工作流的人可以认真研究一下。

5月3日周日
  1. X:OpenRouter (@OpenRouter)65

    推出响应缓存功能 节省测试成本

    推出响应缓存功能:在测试和智能体重试上节省大量资金与时间。 博客文章:https://openrouter.ai/announcements/response-caching 免费提供。了解更多 👇

    推荐理由:OpenRouter 的 Response Caching 直击测试和 agent 重试的浪费痛点,免费能用,做 API 集成的开发者可以立刻省下一笔预算。

  2. X:OpenRouter (@OpenRouter)65

    模型别名新增"-latest"指向最新版本

    新功能:"-latest" 模型别名 🔀 将请求路由至 "~anthropic/claude-opus-latest"、"~openai/gpt-latest" 等,以获取各主要模型的最新版本。(灵感来自语义化版本。)https://openrouter.ai/models?q=latest

    推荐理由:OpenRouter 这个 -latest 别名很实用,不用每次都改模型版本号,对大量调用 API 的团队是个省心更新,痛点精准。

5月2日周六
  1. X:SpaceXAI (@SpaceXAI)67

    xAI语音克隆API正式上线

    语音克隆功能现已通过 xAI API 上线! 不到2分钟即可创建自定义语音,或从我们涵盖28种语言的80多种语音库中选择,为您的语音助手、有声读物、视频游戏角色等注入个性化色彩。 http://x.ai/news/grok-custom-voices

    推荐理由:xAI 正式下场语音克隆,2 分钟克隆加 80 多种声音库,API 直接可调,做语音 agent 和有声书的团队得多关注一下,这对 ElevenLabs 们是个不大不小的冲击。

  2. X:Sam Altman (@sama)71

    可用ChatGPT账户登录OpenClaw

    现在你可以用你的ChatGPT账户登录OpenClaw,并在那里使用你的订阅服务! 祝你捕龙虾愉快。

    推荐理由:Sam Altman用一条推文轻描淡写地扔出了OpenAI的新产品OpenClaw,ChatGPT用户可以直接登录用订阅,没发布会没博客,但既然是他亲自发的,大概率是个值得试试的新玩具。

  3. X:OpenAI (@OpenAI)68

    一键迁移工作流至Codex

    只需点击几下,即可将您的工作流程带入Codex。 导入设置、插件、代理、项目配置等,以便您能更少中断地继续工作。 该您行动了。

    推荐理由:Codex 这个导入功能,把迁移成本降到了最低,对已经在用其他 IDE 的开发者算是个贴心的零门槛入口,虽然不算重大更新,但够实用。

  4. OpenRouter:Announcements(RSS)63

    面向语音与转录的全新 Audio API

    OpenRouter 正式上线文本转语音和音频转录功能。平台通过两个新的 API 端点,集成了多家供应商的语音合成与音频转录服务。用户现在可以统一调用单一 API,便捷访问多提供商的高质量语音生成与语音转文本能力,无需再为不同服务商单独集成。这简化了开发流程,为应用添加语音交互与内容转录功能提供了更高效的一站式解决方案。

    推荐理由:OpenRouter把语音合成和转录也接进来了,以后做语音应用的开发者可以少对接几个API,这是把‘省事’写进DNA的典型更新。

  5. X:Runway (@runwayml)68

    Runway全平台上线 移动端创作无界限

    创造一切。无论身处何地。使用任何设备。Runway 现已登陆 Android 和 iOS 平台。 通过下方链接开始使用。

    推荐理由:Runway 终于有了移动端,对于随手需要 AI 生成视频的创作者是个实在的提升,但本质上还是从 Web 到 App 的延伸,没改变创作内核。

5月1日周五
  1. xAI:News(网页)60

    自定义语音与语音库

    xAI于2026年4月30日推出自定义语音和语音库功能。用户可通过约1分钟录音快速克隆声音,并在Grok文本转语音及语音代理API中即时使用,整个过程仅需2分钟。语音库提供集中管理平台,内置语音已超80种,支持28种语言。为确保安全,系统采用两阶段验证,包括实时转录匹配和说话人嵌入确认,以防止未经授权的克隆。这些功能适用于品牌代理、内容创作、无障碍辅助、多语言团队及游戏娱乐等多种场景,且使用自定义语音无需额外费用。

    推荐理由:xAI 这波‘声音克隆+管理’的更新很实用,安全验证做得细,创作品类和品牌方应该会喜欢,对开发者来说是个加分项,但不是那种能改变格局的大招。

  2. Claude Code:GitHub Releases(RSS)55

    Claude Desktop v2.1.126 版本更新

    本次更新增强了模型网关集成,当配置指向兼容网关时,可直接在模型选择器中列出可用模型。新增了 `claude project purge` 命令,用于彻底清理项目状态数据。OAuth登录流程得到优化,支持在浏览器回调失败时手动粘贴授权码,并修复了多种网络环境下的登录问题。安全方面,修复了 `allowManagedDomainsOnly` 等设置可能被忽略的漏洞。此外,还解决了图像粘贴过大导致会话中断、远程会话误报“流空闲超时”、Windows系统下特定文本渲染乱码以及多项工具在特定场景下不可用等数十项错误。

    推荐理由:这是 Claude Code 一次‘生活质量’大更新,OAuth、Windows 权限、流超时等痛点都被修了,如果你在用 Claude Code,今天就该升级。

  3. X:Replit (@Replit)73

    Replit十周年庆 免费开放Agent功能

    Replit 即将迎来十周年,我们正让 Agent 免费开放 准备好享受构建的乐趣吧! 想要奖品?参加我们与 Anthropic 联合举办的构建马拉松 奖品由 Replit 和 RevenueCat 赞助

    推荐理由:Replit 把 Agent 免费了,还联手 Anthropic 搞 buildathon,这招会让 Cursor 和 Copilot 紧张一下吗?做 AI 编程的都该看看。

  4. Midjourney:Updates(RSS)56

    V8.1 更新

    Midjourney V8.1 版本现已登陆 Discord 平台及其官方网站。本次更新重点提升了图像的清晰度与整体画质,这一改进在风格参考(SREF)和情绪板(Moodboards)功能中效果最为显著,同时所有类型的图像生成质量均有所增强,为用户带来更精细的视觉体验。

    推荐理由:Midjourney V8.1 只是个小版本迭代,主要提升锐度和图像质量,用惯了 V8 的可以不急着换,但玩 SREF 和 Moodboard 的值得试一下,细节确实有提升。

  5. X:Luma AI (@LumaLabsAI)60

    Luma Agents:一键生成高转化网站设计

    为你的网站寻找外观。同时探索每个方向。 定义目标,设定美学风格,然后让Luma Agents构建每个元素。英雄区域。文案。视觉效果。布局。所有内容都经过结构化设计,从首次滚动开始就旨在实现转化。 立即构建 → http://lumalabs.ai/app

    推荐理由:Luma 从视频生成跨到建站,用 Agent 一次性生成整站,描述即站点,对想快速验证品牌页面的创业者是个有趣的新工具。

  6. Claude:Blog(网页)64

    构建企业级AI智能体:领先企业的转型指南

    2025年数据显示,美国员工工作AI使用率已从2023年的20%升至40%。真正获得持续竞争优势的企业正将智能体AI深度嵌入工作流程,并将机构知识编码成可累积的系统。本指南以欧莱雅、Lyft和乐天为例,提出企业AI转型三大支柱:跨越“智能体思维鸿沟”、基于实际工作流程培训员工、在压缩信息密集型流程时保留人工判断,以及构建能创造收入的新产品能力。Claude Cowork平台为此提供了无需定制开发的团队级解决方案,并包含六个月的落地框架。

    推荐理由:从 L'Oréal、Lyft 这些案例看,企业怎么把 AI 智能体扎进业务流程,比泛泛而谈的 AI 转型文章实在得多。

  7. X:OpenAI (@OpenAI)70

    Codex简化日常办公流程

    使用Codex处理日常工作从未如此简单。 选择你的角色,连接你每天使用的应用,并尝试建议提示。 Codex能在研究规划、文档、幻灯片、电子表格等方方面面提供帮助。

    推荐理由:OpenAI 的 Codex 把 AI 助理塞进了你的日常工作流,直接连通你每天用的应用,不用折腾配置,看一眼提示就能上手,做运营和产品的可以试试。

  8. Google Developers Blog(RSS)62

    基于Gemini Embedding 2构建:智能多模态RAG及其他应用

    Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。

    推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。