跳到正文
北京时间

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 141–160 条 · 共 316 条
6月7日周日
  1. MarkTechPost(RSS)74

    Google 发布 Colab CLI,开发者与 AI 智能体可在终端中远程调用 Colab GPU 与 TPU 运行 Python 代码

    Google 发布 Colab CLI,允许开发者和 AI 智能体在终端中直接运行本地 Python 代码,并利用远程 Colab 的 GPU 与 TPU 运行时进行加速。通过这一命令行工具,用户无需打开浏览器即可无缝连接 Colab 计算资源,为自动化和脚本化 AI 工作流提供了更便捷的接口。

    推荐理由:Colab CLI把远程GPU接入终端,且AI Agent可直接调用,让Colab从笔记本变成计算后端,个人开发者云端算力使用方式会被改变。

6月6日周六
  1. Rohan Paul77

    SpaceX 刚刚披露了一份与 Google 的新云服务协议。 Google 将每月向 SpaceX 支付 9.2 亿美元(约合每年 110 亿美元),用于 xAI 数据中心的计算能力。 这再次表明,AI 算力正成为一种战略性商品,就像发射能力或能源一样,而那些能够为庞大的 GPU 集群提供资金、电力、冷却和运营的公司,可能会在其原有业务之外获得巨大的杠杆优势。

    推荐理由:谷歌每月斥资9.2亿美元租用xAI算力,这已经不只是一份商业合同,而是AI基础设施的定价锚点。算力正在变成战略资源,做云的和做芯片的都该重新估算自己的位置。

  2. Google Research:Blog(网页)64

    谷歌推出基于 Gemini Enterprise Agent Platform 的 Agentic RAG 框架

    Google Research 与 Google Cloud 合作推出跨语料库检索(Cross-Corpus Retrieval)框架,作为 Gemini Enterprise Agent Platform 的 Agentic RAG。该多智能体工作流将复杂企业查询分解为子任务,通过规划、重写和路由,迭代搜索多个数据源直至获得充分上下文,再生成可靠回答。与标准 RAG 相比,在事实性数据集上准确率最高提升 34%;在多个领域特定内部数据集上也实现了更好的接地与推理准确性。

    推荐理由:企业级 RAG 的新标杆,多 agent 架构加上‘足够上下文’检查,准确度提升 34%。做知识库问答的产品经理和架构师都应该认真看。

  3. Google AI78

    Google AI 本周发布多项更新:Nano Banana 2 及 Pro 正式 GA,可通过 Gemini Enterprise Agent Platform、Gemini API 和 Google AI Studio 获取;Co-Scientist 多智能体系统面向科研自动生成优化新假设;Google Labs 推出 dreambeans,根据用户 Google 应用数据每日生成个性化话题集;Gemma 4 12B 统一无编码器多模态模型可完全离线运行于笔记本;Gemma 4 系列及草稿模型引入 QAT 降低内存需求;Google Magenta RealTime 2 开源实时音乐模型,支持 MIDI 键盘、文本提示和手势演奏。

    推荐理由:周报里藏了个大号:Gemma 4 12B开源多模态且完全离线,开发者今天就能在自己笔记本上跑起来,Co-Scientist的多agent科学推理也有看头。

  4. Google Developers Blog(RSS)75

    Google Colab CLI 发布

    Google 推出 Colab 命令行界面(CLI),允许开发者和 AI 智能体将本地终端连接到远程 Colab 运行时,实现无摩擦执行。该轻量级 CLI 支持请求高性能 GPU、远程运行本地 Python 脚本,并检索工件日志或模型(如微调后的 Gemma 3 适配器)。工具可直接集成到标准终端环境,可被 Antigravity、Claude Code 等 AI 智能体调用以管理复杂机器学习流水线。

    推荐理由:对于习惯在 Colab 上薅免费 GPU 的开发者,这个 CLI 把本地开发、远程跑训练这套流程的摩擦降到了几乎为零,而且直接对接 AI agent,实验自动化往前迈了一大步。

  5. Google AI Developers72

    谷歌发布 Gemma 4 量化感知训练 (QAT) 检查点,支持在消费级 GPU 和移动设备上本地运行,质量损失极小。新检查点提供 GGUF(Q4_0)格式,覆盖所有尺寸及起草模型,实现最佳本地性能。自定义移动模式采用混合精度方案,将 Gemma 4 压缩至 1GB 以下,包含 2-bit 解码层、优化 KV 缓存和静态激活。通过在训练中模拟压缩(而非训练后量化),大幅降低内存占用并加速解码,同时保持推理质量。

    推荐理由:Gemma 4 的量化版把模型压到 1GB 以下,手机本地跑大模型的门槛又低了一大截。Google 这次没用传统的训练后量化,而是把压缩直接嵌进训练里,效果比 PTQ 好一截,搞端侧部署的可以拿 checkpoint 试起来了。

  6. Google Gemini81

    你现可直接在 Gemini Live 中创建和编辑图像。 无论是测试房间装饰、解决数学问题,还是制作可分享的梗图,所有操作都实时完成。 只需打开 Gemini 应用,点击 Live 按钮,共享摄像头,告诉 Gemini 你想看到的。

    推荐理由:Gemini Live 终于能用嘴改图了,实时对话+图像生成让装修试色、数学解题变成「聊着天就把活干了」,产品人和普通用户都该试试这个新交互。

6月5日周五
  1. NotebookLM68

    今天,我们推出又一项呼声很高的功能:来源归属!🥳 无需再猜测。现在你可以看到每个创作物背后所用的确切公式(提示词 + 来源)。想要调整?只需轻点“迭代”,随心定制 💖

    推荐理由:NotebookLM 终于开放了 Source Attribution,能看到每个 artifact 背后的 prompt 和来源,还能直接迭代,对经常用做资料整理的重度用户是个实在的升级。

  2. Google Research:Blog(网页)79

    Google Research 发布被动心率监测系统 PHRM

    Google Research 开发了一种被动心率监测系统(PHRM),利用智能手机前置摄像头在日常使用中(人脸解锁后数秒内)捕捉面部视频,通过深度学习估算心率,平均绝对百分比误差(MAPE)低于10%(对比心电图金标准),满足各肤色人群的行业精度标准。系统将全天心率测量整合为每日静息心率(RHR),平均绝对误差(MAE)低于5 bpm(对比可穿戴设备)。研究同时发布了迄今最大规模的公开智能手机视频数据集及预训练模型PHRM-mini,合格研究人员可申请访问。

    推荐理由:Google 这项发表在 Nature 上的研究,把手机前置摄像头变成了被动心率仪,而且专门解决了深肤色人群精度差的老问题,虽然离产品还远,但方向很对,穿戴设备的护城河可能又浅了一点。

  3. Google AI Developers70

    Google AI for Developers 宣布推出开放权重的实时音乐模型 Magenta RealTime 2 (MRT2)。该模型可通过 MIDI 键盘、实时文本提示甚至手势进行演奏。MRT2 在 MacBook 上原生运行,延迟低于 200ms,提供开放权重、开源推理引擎以及配套应用和插件套件。

    引用Google Magenta Project@GoogleMagenta

    介绍 Magenta RealTime 2 (MRT2):你可以像演奏乐器一样演奏的实时音乐模型。 MRT2 提供 MIDI 和提示控制,并可在 MacBook 上原生运行,延迟低于 200ms。 开放权重。开源推理引擎。一整套应用和插件。 在下方听听它能做什么,并亲自试一试 🧵

    推荐理由:Magenta RealTime 2 把音乐生成从「后期制作」拉到了「实时演奏」,开放权重且延迟低于 200ms,音乐创作者值得立刻上手试试。

6月4日周四
  1. Google Research:Blog(网页)72

    洪水韧性新篇章:Google 开源水文建模框架

    Google Research 在 GitHub 开源了其水文建模框架,这是一个基于 PyTorch 的 Python 包,采用与 Flood Hub 河段洪水预报相同的模型架构和训练数据。该框架允许研究者和预报员训练 AI 洪水预报模型、添加新模型与数据,并已与捷克水文气象研究所(CHMI)等合作测试。开放模型架构和训练管线旨在让各国气象水文部门在保留数据完全控制权的同时,整合基于 AI 的洪水预报。

    推荐理由:谷歌开源的水文模型框架,是少数真正能救命的AI应用。不是秀参数,而是把工具直接塞给一线预报员,让他们用本地数据训练。务实,值得给赞。

  2. Google Developers Blog(RSS)78

    Gemma 4 12B:开发者指南

    Gemma 4 12B 是一款密集多模态模型,专为消费级设备上的高性能本地 AI 执行而设计。其采用新颖的无编码器架构,绕过传统视觉和音频编码器,将多模态数据直接输入大语言模型主干。

    推荐理由:Google 把多模态模型直接塞进消费级设备,靠的不再是缩水而是架构层面的创新。12B 放在本地跑,这次玩法变了。

6月3日周三
  1. Google Gemini67

    参加 @GoogleDeepMind 首席工程师 @__apf__ 的演示,了解 Gemini Spark 如何帮助简化您的日常工作流程。由 Gemini 3.5 Flash 驱动,Spark 建立在 Gemini 与 @GoogleWorkspace 应用(如 Docs 和 Gmail)连接的能力之上,以执行复杂任务。

    推荐理由:这是 Gemini 把 Agent 能力真正嵌入日常工作流的一步,跟 Workspace 的深度集成会让很多不会编程的人也能用上自动化,值得关注。

  2. IT之家(RSS)86

    谷歌:Gemini App 月活超 9 亿同比翻倍,是其增长最快的产品之一

    谷歌母公司 Alphabet 公布投资者演示文稿显示,Gemini App 月活跃用户超 9 亿,一年内翻倍超过一倍。Gemini 已为谷歌 13 款超 10 亿用户产品提供支持,其中 5 款用户量超 30 亿(搜索、Gmail、Android、Chrome、YouTube)。谷歌搜索 AI Overviews 月活跃用户超 25 亿。自 Gemini 3 推出,核心 AI 响应成本降低 30% 以上。谷歌预计本月推出 Gemini 3.5 Pro 模型。

    推荐理由:9亿月活且一年翻倍,AI Overviews月活25亿,这些数字比任何benchmark都更能说明问题。谷歌本月还要推Gemini 3.5 Pro,进度比预期快,做搜索和产品的需要盯紧。

  3. PromptArmor:Threat Intelligence78

    PromptArmor 披露 ChatGPT for Google Sheets 数据外泄漏洞,OpenAI 移除 Apps Script 生成能力

    PromptArmor 披露 ChatGPT for Google Sheets 存在间接提示词注入漏洞,一次良性查询即可触发工作簿外泄、钓鱼弹窗、侧边栏劫持和恶意编辑,演示中共外泄 12 个工作簿,且在用户明确要求人工审批时攻击仍可成功。

    推荐理由:原文完整披露了攻击链、演示和 OpenAI 的修复回应,读者可以据此评估 ChatGPT for Google Sheets 的间接提示词注入风险面。

  4. Google AI Developers74

    构建用于科学发现的自主智能体?🧬🤖 @GoogleDeepMind Science Skills 现已在 GitHub 上发布。我们已开源这个专用工具包,以科学基础和更高的 token 效率加速您的智能体工作流。 立即下载 ↓ https://github.com/google-deepmind/science-skills

    推荐理由:DeepMind 把这个科学 agent 工具包开源了,核心是给 agent 工作流加科学基础、提升 token 效率,做 AI for Science 的可以直接 fork 试手,本周最值得上手的工具之一。

  5. Google DeepMind:Blog(RSS)80

    Google DeepMind 发布 Gemma 4 12B:统一的无编码器多模态模型

    Gemma 4 12B 是 Google DeepMind 最新推出的中等规模多模态模型,采用无编码器统一架构,原生支持音频输入。其基准测试性能接近 26B MoE 模型,但内存占用不到一半,仅需 16GB 显存或统一内存即可在消费级笔记本上本地运行。模型内置多 token 预测(MTP)drafter 以降低延迟,基于 Apache 2.0 开源许可发布,已累计超过 1.5 亿次下载。

    推荐理由:统一无编码器架构让 12B 模型在消费级笔记本上跑出接近 26B 的多模态 Agent 体验,开源 + Apache 2.0,本地部署门槛又压低了。

6月2日周二
  1. Logan Kilpatrick79

    我们刚刚上线了在 @GoogleAIStudio 内直接构建连接 Gmail、Drive、Sheets 等应用的功能,无需跳转其他网站,你可以直接在 AI Studio 内添加测试人员,完整的公开分享功能即将推出!!

    推荐理由:Google AI Studio 直接打通 Gmail、Drive 和 Sheets,不用跳出就能构建应用并邀请测试者,对习惯 Google 生态的开发者来说省了一大截时间,下次做原型可以试试。