跳到正文
北京时间

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 241–260 条 · 共 316 条
5月5日周二
  1. Google Developers Blog(RSS)66

    在谷歌TPU上实现3倍加速:UCSD利用扩散式推测解码优化LLM推理

    加州大学圣地亚哥分校的研究团队在谷歌TPU上成功部署了DFlash,一种基于块扩散的推测解码方法。该方法突破传统自回归草稿生成的序列性瓶颈,通过单次前向传播并行“绘制”整个候选令牌块,而非逐个预测。系统平均实现了3.13倍的推理加速,峰值性能接近EAGLE-3等现有方法的两倍。这一开源方案已集成至vLLM生态系统,通过利用“免费”的并行验证能力和针对复杂推理任务的高质量草稿预测,显著优化了TPU硬件的利用效率。

    推荐理由:把扩散式的 speculative decoding 在 TPU 上跑出了 3 倍推理加速,峰值快到 EAGLE-3 的两倍,还直接集成了 vLLM,做推理优化的赶紧试一下。

5月2日周六
  1. Demis Hassabis67

    DeepMind创始人Demis Hassabis在访谈中回顾了从国际象棋神童到获得诺贝尔化学奖的生涯,并探讨了实现AGI仍需解决的关键挑战,如记忆、推理与持续学习。他分析了小模型能力提升、多模态Gemini设计以及推理成本下降的趋势,强调AI已成为科学研究的强大工具,从蛋白质预测扩展到虚拟细胞研究。Hassabis还为创业者提供了前瞻性建议,指出在AGI到来前应关注的方向及AI驱动科学发现的潜力。

    引用Y Combinator@ycombinator

    Demis Hassabis(@demishassabis)拥有科技界最非凡的职业生涯之一。 他最初是一名国际象棋神童,17 岁时成为电子游戏设计师,之后获得神经科学博士学位,并创立了 DeepMind。他的实验室攻克了围棋,用 AlphaFold 解决了蛋白质结构预测,然后将其免费提供给地球上每一位科学家。这项工作为他赢得了 2024 年诺贝尔化学奖。如今他领导着 @GoogleDeepMind,朝着他十几岁时就设定的同一个目标推进:AGI。 在 How to Build the Future 这期特别直播节目中,他与 YC 的 @garrytan 坐下来交谈,讨论了要实现 AGI 还需要发生什么、他给创始人关于如何保持领先的建议,以及下一个重大科学突破可能是什么。 01:48 — 在实现 AGI 之前,还缺什么? 03:36 — 为什么记忆问题仍未解决 06:14 — AlphaGo 如何塑造了 Gemini 08:06 — 为什么更小的模型变得如此强大 10:46 — 1000 倍工程师 12:40 — 持续学习与智能体的未来 13:32 — 为什么 AI 在基础推理上仍然失败 15:33 — 智能体是被过度炒作了,还是才刚刚开始? 18:31 — AI 能变得真正有创造力吗? 20:26 — 开放模型、Gemma 与本地 AI 22:26 — 为什么 Gemini 被构建为多模态 24:08 — 当推理变得廉价时会发生什么? 25:24 — 从 AlphaFold 到虚拟细胞 28:24 — AI 作为科学的终极工具 30:43 — 给创始人的建议 33:30 — AlphaFold 突破的模式 35:20 — AI 能做出真正的科学发现吗? 37:59 — 在 AGI 到来之前该构建什么

    推荐理由:Demis 这次没聊虚的,直接把 AGI 的瓶颈摊开讲——记忆、推理、持续学习,每个点都是创业者的机会清单,做 Agents 的可以反复看。

5月1日周五
  1. Google Developers Blog(RSS)62

    基于Gemini Embedding 2构建:智能多模态RAG及其他应用

    Google正式发布Gemini Embedding 2统一嵌入模型,该模型能将文本、图像、视频、音频和文档映射到同一语义空间。开发者可通过单请求处理交织多模态输入,显著提升智能RAG、视觉搜索等内容审核任务的性能。模型支持超100种语言,并提供任务特定前缀和马特廖什卡降维等特性,为构建复杂AI智能体提供高效精准的基础。

    推荐理由:开发者做多模态RAG的苦日子结束了,Gemini Embedding 2把文本、图片、视频塞进同一个语义空间,还自带Matryoshka降维,直接省掉一堆胶水代码。

  2. Google AI69

    谷歌上周正式向公众发布了其首个原生多模态嵌入模型Gemini Embedding 2。该模型如同“通用翻译器”,能将文本、图像、视频和音频数据转化为独特的数字向量。其核心突破在于不再依赖关键词匹配,而是基于语义将不同模态的数据映射到同一空间,从而理解内容间的深层联系。开发者已利用该模型构建视频分析工具、视觉购物助手等应用,实现通过拍照或描述场景进行智能搜索的功能。模型现可通过Gemini API或Gemini Enterprise Agent平台使用。

    推荐理由:Google 第一个原生多模态嵌入模型,把文本、图像、视频拉到同一个向量空间,做跨模态搜索的开发者可以不用再手动打标签了,但离「无感理解」还有距离。

  3. NotebookLM64

    Gemini App中的Notebooks功能现已正式在移动端向免费和付费用户开放,并计划很快扩展至更多欧洲国家。此次更新标志着NotebookLM与Gemini的深度集成,用户现可直接在Gemini App内访问所有个人未共享的笔记本,并能将Gemini的聊天记录用作新笔记本或现有笔记本的资料来源。功能推出将分阶段进行:首先面向网页版的Google AI Ultra、Pro和Plus订阅用户,未来几周将逐步覆盖移动端用户、更多欧洲地区以及免费用户。

    引用NotebookLM@NotebookLM

    去年,我们通过允许你将笔记本作为来源上传,整合进了 @GeminiApp。现在,我们将这段关系提升到新的层次 🏠 ♥️ 从今天开始,你现在可以: — 直接在 Gemini App 内访问你所有个人的、未共享的笔记本 — 将你与 Gemini 的对话作为新笔记本或现有未共享笔记本中的来源 我们今天开始在 Gemini 中推出笔记本功能,首先面向网页端的 Google AI Ultra、Pro 和 Plus 订阅用户。在接下来的几周内,我们将把访问权限扩展到移动端、欧洲更多国家以及免费用户。

    推荐理由:NotebookLM的笔记功能终于彻底住进了Gemini App,免费用户也能用。这一步让Google AI助理从“外脑”变成了“内脑”,虽然不算惊天动地,但整合的体验提升是实打实的。

  4. NotebookLM64

    Google的Gemini应用正式向移动端免费和付费用户推出Notebooks功能,并即将扩展至更多欧洲国家。该功能允许用户在Gemini应用内直接访问所有个人未共享的笔记本,并能将与该AI的对话内容作为新笔记本或现有笔记本的资料来源。此次发布首先面向网页端的Google AI Ultra、Pro和Plus订阅用户,后续将逐步推广至移动端、更多欧洲地区及免费用户。

    引用NotebookLM@NotebookLM

    去年,我们通过允许你将笔记本作为来源上传,整合进了 @GeminiApp。现在,我们将这段关系提升到新的层次 🏠 ♥️ 从今天开始,你现在可以: — 直接在 Gemini App 内访问你所有个人的、未共享的笔记本 — 将你与 Gemini 的对话作为新笔记本或现有未共享笔记本中的来源 我们今天开始在 Gemini 中推出笔记本功能,首先面向网页端的 Google AI Ultra、Pro 和 Plus 订阅用户。在接下来的几周内,我们将把访问权限扩展到移动端、欧洲更多国家以及免费用户。

    推荐理由:NotebookLM 正式成为 Gemini 的原生笔记,聊天记录能直接纳入知识库,这步整合让 Gemini 从一个对话工具开始走向个人知识中枢,Google 生态用户应该高兴。

4月30日周四
  1. Google Research:Blog(网页)57

    谷歌研究团队应用实证研究辅助工具的四个领域

    自去年秋季推出实证研究辅助(ERA)工具以来,谷歌研究团队已将其应用于多个科学领域以解决实际问题。在流行病学中,它助力流感与新冠预测;在宇宙学里,协助分析星系数据以探究暗能量;在大气监测方面,提升了二氧化碳排放的追踪精度;在神经科学领域,则用于解析大脑活动数据。这些实践表明,ERA能帮助科学家生成专家级的实证软件,其成果超越了黑箱模型,可发现兼具可解释性与机制准确性的解决方案,从而有效加速科学发现进程。

    推荐理由:Google 把自家 ERA 工具在流行病学、宇宙学、气候监测、神经科学四个方向的实战案例摊开讲,虽然不是新模型发布,但对做 AI for Science 的人来说,这是一份难得的「AI 科研助手到底能干嘛」的全景参考。

  2. Google Developers Blog(RSS)57

    加速AI:通过GCSFS和Rapid Bucket将Google Colossus引入PyTorch

    Google Cloud推出了一项高性能集成方案,通过fsspec接口将Rapid Storage直接连接至PyTorch,以消除AI训练瓶颈。该方案利用Google的Colossus架构和双向gRPC流技术,可提供高达15 TiB/s的聚合吞吐量,并显著降低延迟。开发者仅需更新存储桶类型而无需修改代码,即可将总训练时间缩短23%。

    推荐理由:Google 把自家 Colossus 存储架构直接接进 PyTorch,号称零代码改动提速 23%,做大规模训练的团队值得评估一下,但对大多数人来说这更像 GCP 的护城河加固。

4月27日周一
  1. Google DeepMind:Blog(RSS)56

    宣布我们与大韩民国的合作伙伴关系

    Google DeepMind 与韩国政府建立合作伙伴关系,旨在利用前沿AI模型加速科学突破。此次合作将聚焦于将如Gemini、Claude、GPT-4等大型语言模型以及AlphaFold等科学AI工具,应用于关键研究领域,特别是生物技术和材料科学。目标是提升韩国的AI研发能力,计划在未来五年内培养超过1000名AI专家,并支持10个以上由AI驱动的大型科研项目。

    推荐理由:韩国政府和 DeepMind 的合作意向,信号意义大于实质内容,目前没有具体项目披露,做 AI 地缘分析的可以留意,其他人可以先跳过。

4月25日周六
  1. IT之家(RSS)73

    既合作又竞争,谷歌拟向 Anthropic 投资至高 400 亿美元

    谷歌宣布向人工智能公司Anthropic投资100亿美元,对应估值达3500亿美元,未来若达成业绩目标可能追加投资至总计400亿美元。作为交易的一部分,Anthropic将获得谷歌云提供的5吉瓦算力支持。双方关系密切,Anthropic是谷歌云服务的重要客户,但竞争也日益凸显,两者均致力于开发接近人类的AI工具并争夺企业市场。此次投资进一步深化了双方既合作又竞争的复杂关系。

    推荐理由:谷歌对Anthropic的400亿投资表明AI竞赛已进入巨头站队和算力军备阶段,Claude Code的爆红是直接催化剂,但合作背后的竞争也愈发微妙。

4月23日周四
  1. IT之家(RSS)74

    谷歌确认基于 Gemini AI 的苹果新版 Siri 今年亮相

    谷歌云首席执行官在谷歌Cloud Next 26大会上确认,基于Gemini AI技术构建的新一代苹果Siri将于2026年发布。双方合作源于2026年1月签署的多年期协议,谷歌作为首选云服务商提供核心技术支持。该交易年价值约10亿美元,协议严格限制谷歌接触用户数据以保障隐私。技术层面,苹果正通过知识蒸馏将大型Gemini模型精简为可在iPhone等设备端运行的版本,旨在降低云端依赖并提升响应速度。

    推荐理由:苹果终于把 Siri 大脑换成了 Gemini,每年 10 亿美金的合作不是小打小闹,这代 Siri 可能真的会变聪明。但落地得等一年,做端侧部署的可以盯一下苹果的蒸馏方案。

  2. Google Developers Blog(RSS)59

    使用 LiteRT 与 NPU 构建现实世界中的设备端人工智能

    LiteRT 是一个生产就绪的框架,旨在帮助移动开发者充分发挥神经处理单元(NPU)的效能,以突破传统 CPU 或 GPU 在性能与电池续航上的瓶颈。该框架通过提供统一的 API 来屏蔽底层硬件复杂性,已成功助力 Google Meet、Epic Games 等行业领先者高效部署复杂的 AI 模型,实现实时视频处理、动画生成与语音识别等高级功能。此外,平台还提供基准测试工具并具备跨平台兼容性,能够支持 AI 应用无缝部署于移动设备、AI PC 及工业物联网硬件等多种终端。

    推荐理由:Google 把 LiteRT 从实验品推到生产级,统一 NPU 调用 API,做端侧 AI 的开发者终于不用逐家适配芯片了。虽然不是新概念,但 Google Meet 和 Epic Games 已经在用,说明不是 PPT。

4月22日周三
  1. Google Developers Blog(RSS)61

    Agent Platform 中的 Agents CLI:从创建到生产,一栈式实现

    Google Cloud 推出 Agents CLI 工具,专为连接本地开发与生产级 AI 智能体部署而设计。该 CLI 为编码助手提供对完整 Google Cloud 技术栈的机器可读访问,显著减少脚手架过程中的上下文过载与 token 消耗。通过将评估、基础设施配置和部署流程整合至统一的程序化主干,开发者能够将项目从初始概念推进至实时服务的时间从数周缩短至数小时。

    推荐理由:对用 Google Cloud 搭智能体的开发者,这个 CLI 把碎片化的本地到云端流程压进一条命令,能省掉大量翻文档的 token,值得试试。

4月17日周五
  1. Google Blog:AI(RSS)72

    Chrome 推出 AI Mode:全新的网页探索方式

    Chrome 浏览器今日升级 AI Mode 功能,通过人工智能技术深度改变用户与网页的交互方式。此次更新提供了全新的网络探索体验,将传统浏览行为转变为智能化交互模式,使用户能够更高效地获取和处理网络信息,标志着 Chrome 在浏览器 AI 化进程中的重要进展。

    推荐理由:在Chrome里直接侧边栏浏览搜索结果,不用反复切标签,对天天用搜索的人是个小但实在的改进。

  2. Google Blog:AI(RSS)71

    Gemini 应用推出个性化图像创建新功能

    Nano Banana 2 现支持结合个人上下文与 Google Photos 数据生成图像,通过分析用户独特的生活场景,创建反映个人经历的个性化视觉内容。该功能已在 Gemini 应用中上线,使 AI 图像生成能够基于真实生活语境,输出更贴合用户个人故事的定制化结果。

    推荐理由:Gemini把个人照片和偏好直接揉进图像生成,不用再写长篇提示,对想快速出个人化图片的用户挺实用,可惜目前只对美国部分订阅者开放。

  3. Google Developers Blog(RSS)67

    A2UI v0.9:便携、框架无关的生成式UI新标准

    A2UI v0.9发布了一个框架无关的新标准,旨在帮助AI代理依据公司现有设计系统,实时生成定制化的UI组件。本次更新通过提供全新的Python版Agent SDK、共享的Web核心库,以及对React、Flutter和Angular等渲染器的官方支持,显著简化了开发体验。该版本将UI意图与具体平台解耦,实现了生成式界面在Web和移动应用间的无缝、低延迟流式传输。通过集成AG2和Vercel等更广泛的生态系统,A2UI v0.9致力于推动生成式UI从实验演示走向可用于生产环境的成熟产品。

    推荐理由:Google 把生成式 UI 推向标准化,A2UI v0.9 让代理能用任何组件库实时生成界面,前端开发者不用换轮子就能玩起来,这是 AI 应用落地的关键拼图。

4月16日周四
  1. Google Blog:AI(RSS)70

    Gemini 3.1 Flash TTS:下一代表现力AI语音技术

    Google正式发布Gemini 3.1 Flash TTS,作为下一代表现力AI语音技术,该模型现已全面上线Google旗下各产品线。此次升级标志着Google在语音合成领域的技术突破,旨在为用户提供更自然、富有情感表现力的AI语音交互体验,进一步强化其AI生态系统的语音能力。

    推荐理由:Google 把 TTS 的控制权交给了文本指令,音频标签这个设计让语音应用从'选择预设'变成'现场导演',对多模态应用是个实在的增强。

  2. TensorZero:实验与工程博客67

    TensorZero:别只比每百万 token 单价,LLM API 的隐性成本差距可达 5.3 倍

    TensorZero 测量发现同一输入在不同厂商的 token 计数相差可达 2.65 倍,按每百万 token 单价比较 LLM API 成本会产生误导。

    推荐理由:作者用各家官方 token 计数 API 实测同一输入的成本差异,给出可复用的比价方法,提醒只看每百万 token 单价会误判。

4月15日周三
  1. Google Developers Blog(RSS)67

    Subagents 已登陆 Gemini CLI

    Gemini CLI 引入了子代理功能,这是一种专门的专家代理,能在独立的上下文窗口中处理复杂或高吞吐量任务,从而保持主会话的快速与专注。用户可通过 Markdown 文件自定义这些代理,并支持并行运行以提高效率。使用 @agent 语法即可轻松调用,实现精准的任务委派。该架构通过将复杂的多步骤执行过程整合为简洁的摘要反馈给主协调器,有效防止了“上下文腐化”。

    推荐理由:Gemini CLI 把 agent 拆成了可自定义的专家小队,developer 可以把自己的开发流程切成可复用的 subagent,并行跑起来对大型代码库的效率提升会很明显。