跳到正文
北京时间

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 101–120 条 · 共 316 条
7月1日周三
  1. Google DeepMind:Blog(RSS)70

    Google DeepMind 发布 Nano Banana 2 Lite 和 Gemini Omni Flash

    Google DeepMind 推出 Nano Banana 2 Lite(gemini-3.1-flash-lite-image),为 Nano Banana 系列速度最快、成本最低的图像模型,文本到图像输出仅需 4 秒,每 1K 分辨率图像成本 $0.034,已上线 Google AI Studio、Gemini API 及消费者产品(AI Mode in Search、Gemini app 等)。同时推出 Gemini Omni Flash(gemini-omni-flash-preview),支持高画质视频生成与对话式编辑,视频输出定价 $0.10/秒,面向开发者开放 API。

    推荐理由:Nano Banana 2 Lite 把图像生成拉到 4 秒延迟和 0.034 美元单价,很适合高频草稿流,Omni Flash 首次对开发者开放视频生成和对话编辑,两个模型串起来的快速迭代工作流是这次最实用的更新。

6月30日周二
  1. Google Research:Blog(网页)76

    Google Research 推出 TabFM:用于表格数据的零样本基础模型

    Google Research 发布 TabFM,一种基于上下文学习(ICL)的零样本基础模型,专为表格数据的分类与回归任务设计。TabFM 将整个数据集(包含训练样本与待预测行)作为统一提示输入,在推理时直接从上下文中学习行列关系,无需模型训练、超参数调优或特征工程。与需大量人工调优的传统方法(如 XGBoost)不同,TabFM 通过单次前向传播即可在新表格上生成高质量预测。该模型已在 Hugging Face 和 GitHub 上开源。

    推荐理由:TabFM 把表格预测变成一次前向传播,不再需调参和特征工程,数据科学家可以少熬夜了。BigQuery 集成让使用门槛降到 SQL,这是表格 ML 的零样本时刻。

  2. Google Research:Blog(网页)61

    Google Research 将建筑屋顶反射率数据集扩展至全球 50+ 城市

    Google Research 发布扩展的建筑屋顶反射率数据集,覆盖全球 50 多个城市,旨在帮助城市规划者优先部署冷屋顶方案以缓解极端高温。该数据集融合 Sentinel-2 卫星数据与 30 厘米分辨率的 Airbus Pléiades Neo 卫星图像生成,可通过新的高分辨率 Heat Resilience Earth Engine App 开放获取。相关方法论发表于《Nature Communications》。此前 2024 年的试点已覆盖 14 个城市,其数据曾指导制定冷屋顶条例与适应计划。

    推荐理由:谷歌把屋顶反照率数据的精度做到30厘米,覆盖50+城市,还给了免费App,城市防暑从模糊规划变成可量化的工程,做气候韧性的人可以直接拿这个数据做方案,虽然只是特定领域应用,但AI落地真实场景的路径值得参考。

6月26日周五
  1. Google AI Developers73

    Google AI 宣布 Gemini 3.5 Flash 的 Computer Use 工具正式可用,支持构建能观察并操作浏览器、移动端和桌面环境的 AI 智能体,可处理长期任务。新特性包括:内置移动与桌面操作系统支持;所有函数调用配备 intent arguments;可定制的客户端函数实现人工接管(HITL);提示词注入检测及可配置的 action-level 安全策略。可用于自动化 QA 测试、业务流程等场景。

    推荐理由:Computer Use 从浏览器扩展到移动和桌面,Google 正式把 agent 战场拉到全部界面。安全策略的加入说明不是 demo,而是认真考虑落地。

  2. Google Blog:AI(RSS)57

    Google Finance 全新 Android 应用与投资组合功能上线

    本周,Google Finance 推出正式版 Android 应用,同步上线全球投资组合跟踪功能。用户可通过截图、CSV/PDF 上传或文字描述创建组合,并利用 AI 研究工具提问资产配置、固定收益影响等问题。新增市场情报简报功能:用户设定任务(如每日盘前简报),后台自动生成并推送至 Google 应用(Android/iOS)及网页端。Android 应用包含 watchlist、实时数据、金融新闻 feed、AI 研究工具及 AI 驱动的“关键时刻”解释股价波动。未来数月将把更多 web 功能(如财报电话、投资组合与任务)迁移至移动端,今年晚些推出 iOS 应用。

    推荐理由:虽然对 AI 行业算不上大新闻,但对散户投资者是个实用升级,能自动盯盘、生成个性化简报,还能用对话式研究挖掘持仓问题,比大多数 AI 功能都更落地。

  3. Google Research:Blog(网页)55

    冻结多token预测加速Pixel上的Gemini Nano模型

    Google Research提出一种新架构,在已冻结的Gemini Nano v3模型上改造Multi-Token Prediction(MTP),以加速Pixel 9和10系列上的设备端推理。该方法基于EAGLE框架和CALM,无需单独训练占用内存的草稿模型,通过“晚期退出”策略实现加速。AI通知摘要和校对功能因此生成文本速度显著提升、能耗降低,开发者无需为每个新任务微调独立模型。

    推荐理由:谷歌这篇技术博客值得端侧开发者细读,他们把多令牌预测硬是装进了已部署的 Nano 模型,Pixel 上生成加速五成,还省了 130MB 内存,零拷贝架构的想法挺巧,但没法直接复现,主要是开脑洞用的。

6月25日周四
  1. Google DeepMind:Blog(RSS)70

    Gemini 3.5 Flash 引入 computer use 功能

    Google DeepMind 宣布,computer use 现作为内置工具集成于 Gemini 3.5 Flash,开发者可构建跨浏览器、移动端和桌面的智能体,实现视觉感知、推理与操作。此前该功能仅以独立模型形式存在于 Gemini 2.5。3.5 Flash 已支持函数调用及 Search、Maps 等内置工具,新增的 computer use 可提升持续软件测试和跨专业应用知识工作等长周期企业自动化任务的性能。安全方面采用针对性对抗训练,并可选配两项企业防护系统:要求用户确认敏感操作,以及在检测到间接 prompt 注入时自动停止任务。可通过 Gemini API 和 Gemini Enterprise Agent Platform 使用。

    推荐理由:把 computer use 能力塞进轻量级的 Flash 模型,意味着在浏览器里跑视觉 agent 的成本会大幅降低,做企业自动化的团队可以立即试起来,安全措施也给了落地信心。

  2. Google Research:Blog(网页)69

    思考即回忆:推理如何解锁LLM中的参数化知识

    Google Research研究发现,推理(chain-of-thought)能帮助大语言模型(LLM)回忆简单事实,即使这些事实无需复杂推导。在Gemini-2.5 Flash和Pro以及Qwen3-32B上,启用推理后模型能够回答原本无法直接回答的简单问题,pass@k显示正确事实存在于输出分布中。该现象由两个机制驱动:一是生成的推理token充当计算缓冲,允许模型进行隐藏计算以提取参数化知识;二是推理过程中产生的相关事实起到启动效应(factual priming),帮助模型激活正确答案。

    推荐理由:发现一个反直觉现象,让模型推理能提升简单事实回忆,不是靠分步解题而是计算缓冲和事实预热,对理解模型知识召回机制很有启发,但中间步骤幻觉也带来风险。

6月23日周二
  1. TechCrunch:AI(RSS)70

    Google DeepMind 7500 万美元投资 A24,合作开发电影 AI 工具

    Google DeepMind 宣布向独立电影制片厂 A24 投资 7500 万美元(据《华尔街日报》),双方将合作开发电影制作 AI 工具。A24 出品过《万事俱备》《后室》等影片。Google DeepMind CEO Demis Hassabis 称,希望通过与艺术家直接合作,打造支持创意表达的 AI 功能。此举是好莱坞最新一次科技公司与电影 AI 联手,此前 Netflix 已收购 Ben Affleck 的 AI 工具公司 Interpositive,亚马逊 MGM 工作室也在去年设立了影视 AI 部门。

    推荐理由:Google DeepMind 首次在影视内容创作上投入 7500 万美元,与 A24 合作开发 AI 工具,这标志着顶尖 AI 实验室开始直接渗透好莱坞核心创意流程,做文娱 AI 工具的人和关注产业交叉点的人应该留意。

  2. Google Developers Blog(RSS)56

    Google ADK 与 A2A 协议:跨语言多智能体团队构建实战

    一篇技术博客展示了如何用 Google Agent Development Kit (ADK) 与 Agent2Agent (A2A) 协议搭建跨语言多智能体流水线:Python agent 调用 Gemini 解析合同条款,Go agent 用纯确定性逻辑校验合规性。A2A 协议通过 Agent Card 实现能力发现、JSON-RPC 2.0 完成通信、Task 状态机管理任务生命周期;ADK 的 RemoteA2aAgent 抽象可将任意 A2A 兼容服务封装成本地子智能体。文中强调将单体提示词分解为专业化微智能体,以解决上下文退化、故障爆炸半径和不可测试性问题。完整源码已在 GitHub 发布。

    推荐理由:Google 这篇教程把跨语言多智能体协作说得很实,A2A 协议像代理世界的 HTTP,不过整套方案还是绑在 Google 生态上,自己玩的话迁移成本不低。

  3. Google Developers Blog(RSS)61

    Google Labs 提出用“洞察策略”评估 AI 编码智能体的主动性

    Google Labs 提出以“洞察策略”评估 AI 编码智能体的主动性,而非仅按任务完成度打分。团队基于 Google 内部代码库 705 个 bug(1178 个 CL),通过时空近邻与语义相似度聚类还原开发者实际的高层级目标。初步实验显示:Jules 在单轮探索下洞察相关性评分平均 4.5/5;探索预算从两轮增至三轮时,Hit@5 准确率从 33% 升至 57%。团队正将评估方法扩展至公开 GitHub 数据,并探索纳入问题追踪器、对话等更丰富的上下文。

    推荐理由:AI 编码代理的评估从任务修复转向目标洞察,Google 这个思路让评估更接近真实开发场景,但实验还是内部数据,等公开 GitHub 版本再看落地效果。

6月20日周六
  1. Demis Hassabis72

    AlphaFold 团队负责人 John Jumper 宣布,在 Google DeepMind 工作近 9 年后决定离职,将加入 Anthropic(先休整一段时间)。DeepMind CEO Demis Hassabis 表示,过去 9 年与 Jumper 的非凡合作改变了世界,AlphaFold 展示了 AI 在科学与医学领域的巨大潜力,并为 AI 造福人类指明了方向。Jumper 回忆,Hassabis 在他博士毕业仅 6 个月后就大胆让他领导 AlphaFold 团队,感谢团队教会他如何做伟大的科学。

    引用John Jumper@JohnJumperSci

    一点消息:将近 9 年之后,我决定离开 Google DeepMind,加入 Anthropic(在休息一段时间充电之后)。我非常感激在 GDM 的时光。@demishassabis 在我博士毕业仅六个月后就让我领导 AlphaFold 团队,这真是一次冒险的信任,而整个 GDM 团队教会了我太多关于如何做出伟大科学的东西。GDM 是一个特别的地方,我仍然会很期待听到他们接下来发现的了不起的事情。

    推荐理由:John Jumper 是 AlphaFold 背后的关键科学家,他离开 DeepMind 转投 Anthropic,是个不大不小的信号,顶级 AI 人才正在重新站队,对安全和对齐的重视可能成为新一轮人才争夺的核心。

6月18日周四
  1. The Decoder:AI News(RSS)78

    Nature两篇研究:MIRA和AMIE诊断与治疗计划媲美甚至超越医生

    德国团队开发的MIRA智能体在模拟电子病历中操作85,000种选项,500余例急诊诊断准确率88.9%,对比测试(311例)得分87.8%,高于资深专科医生(78.1%)和混合团队(71.1%)。MIRA在阑尾炎(98.6%)和胰腺炎(92.3%)最佳,未发现危险药物交互或剂量错误,性能不受语言影响,代码已公开。谷歌AMIE采用双智能体架构,在100个多访视病例中治疗计划适切率95%(初级保健医生72%),并在药物知识基准RxQA上超过医生。两项研究均警告模拟环境与现实存在差距,实际性能可能更低。

    推荐理由:两项 Nature 研究把 AI 诊断推到了和医生掰手腕的水平,但更值得关注的是那个被埋起来的实验:更强的模型一上来,精心搭建的 double-agent 架构几乎归零。医疗 AI 的护城河可能不是架构而是接入院内系统的能力。

  2. Google DeepMind:Blog(RSS)65

    保障AI智能体的未来安全

    Google DeepMind发布AI Control Roadmap,这是一套针对内部先进AI智能体的系统级安全框架。该框架在传统模型对齐之上增加防线,假设AI智能体可能不对齐,通过威胁建模、沙箱隔离、端点安全、提示注入防御以及基于已验证行为逐步授予权限的机制建立信任。据估算,到2030年仅美国市场AI智能体就能创造2.9万亿美元经济价值。

    推荐理由:DeepMind 首次系统性地公开了内部 AI 代理安全控制路线图,把代理当潜在「内鬼」来防的思路很务实,分析了 100 万个任务轨迹的监控实践尤其值得做 Agent 安全的人细看。

  3. jason83

    Noam Shazeer 宣布将加入 OpenAI,期待与那里的优秀团队合作。离开 Google 是一个艰难的决定,他为 Google 的团队和共同取得的成就感到自豪。

    引用Noam Shazeer@NoamShazeer

    我很高兴地分享,我将加入 OpenAI,并期待与那里卓越的团队共事。 离开是一个艰难的决定。我为 Google 出色的团队以及我们共同建立的一切感到无比自豪。能与大家共事是我的荣幸,也是一件乐事。

    推荐理由:Transformer 共同发明人 Noam Shazeer 从 Google 跳槽 OpenAI,这是今年最大的人事变局之一,对两家公司的模型路线都有深远影响。

  4. Google Developers Blog(RSS)64

    Google 分享 A2UI 与 MCP Apps 三种集成架构模式

    Google 分享了三种集成 A2UI 与 MCP Apps 的架构模式,旨在结合两者优势。A2UI 采用声明式框架,通过 JSON payload 定义 UI,由宿主原生渲染,确保一致性与安全性,但受限于预定义组件库。MCP Apps 在 iframe 中使用标准 Web 技术提供自定义界面,但存在设计碎片化、性能与安全挑战。三种模式包括:通过 MCP 服务器提供 A2UI,利用 MCP Resources 或 Tool 调用传递 JSON,实现“一次编写,原生渲染”的跨平台能力;以及静态与动态交付方案。Google 正考虑扩展 MCP 以原生支持 A2UI。

    推荐理由:Google 这篇指南给出了三种具体的架构模式,帮开发者同时用上 A2UI 的原生安全性和 MCP 的定制能力,对正在做 Agent UI 的团队是直接的工程参考。

  5. TechCrunch:AI(RSS)76

    Google发布99美元Gemini智能音箱

    Google推出首款专为Gemini打造的智能音箱Google Home Speaker,售价99.99美元。支持自然语言请求和多步指令,可在说话中途纠正,并具备连续对话功能。内置10种新声音。高级AI功能需订阅Google Home Premium(月费10美元或年费100美元),包括Gemini Live自由对话、Nest摄像头活动摘要等。即日起预售,本月发货。

    推荐理由:Google 终于把 Gemini 塞进了音箱,多步指令和自然纠错是亮点,但高级功能要订阅 Home Premium。普通用户会觉得方便,智能家居玩家可以观望,AI 从业者不会有多大惊喜。

  6. Google Developers Blog(RSS)63

    谷歌发布Agentic Resource Discovery(ARD)开放规范

    Agentic Resource Discovery(ARD)是一项开放规范,用于在Web上发布、发现和验证AI工具、技能与智能体。它基于两个原语:组织在其自有域名下托管catalog描述可用能力,registry作为搜索引擎索引catalog并响应发现请求。ARD支持加密验证,使客户端与端点连接前确认发布者身份,然后直接通过原生协议调用能力。Google Cloud的Gemini Enterprise Agent Platform通过Agent Registry提供企业级支持,包括URN命名、出站策略、工具固定和基于Agent Identity的信任验证。该规范现已发布,开发者可通过托管`ai-catalog.json`文件使其服务可发现。

    推荐理由:虽然才刚发布,但 ARD 有可能成为代理网络的“robots.txt”,做 agent 开发的都该看一眼,它解决的是跨组织发现和信任这个真问题。

6月17日周三
  1. Google Blog:AI(RSS)55

    Google 医学推理 AI 系统 AMIE 新研究:从诊断迈向长期疾病管理

    今日发表在《自然》杂志上的研究展示了 Google 的医学推理 AI 系统 AMIE(Articulate Medical Intelligence Explorer)从单次诊断对话演进到长期疾病管理的能力。AMIE 利用 Gemini 模型的长上下文能力,整合共情对话智能体和深度思考管理推理智能体,可交叉引用数百页临床指南。在盲测中,AMIE 与 21 名初级保健医生相比,在整体管理推理上匹配临床医生,在计划精确性和指南一致性上得分显著更高。

    推荐理由:Google 把医疗 AI 从一次诊断推到了长期疾病管理,Nature 上的对照实验显示它在计划精确性上甚至优于初级保健医生,做数字健康的人值得认真读一下。

6月16日周二
  1. MarkTechPost(RSS)71

    Google Cloud 推出 OKF v0.1:供应商中立的 Markdown 规范,为 AI 智能体提供结构化上下文

    Google Cloud 发布 Open Knowledge Format (OKF) v0.1,一种供应商中立的 Markdown 规范,为 AI 智能体提供结构化上下文知识。OKF 将知识表示为带 YAML 前置元数据的 markdown 文件目录,每个概念对应一个文件,通过 `type`、`title`、`description` 等少量保留字段实现互操作。无需专有服务、SDK 或运行时,目录可托管在 GitHub、以 tarball 传输或挂载到任意文件系统。OKF 旨在解决组织内部知识碎片化问题——表结构、指标定义、runbook 等散落在不同 catalog 和 wiki 中,各厂商方案互不兼容。遵循最少意见原则,只强制 `type` 字段,生产者和消费者可独立实现。使用场景包括数据团队将 BigQuery 表定义导出为代码、为智能体存储 incident runbook、跨组织知识交换等。

    推荐理由:这是 Karpathy LLM Wiki 思想的首个工业级标准化尝试,把散落在各处的内部知识统一成 agent 可读的 markdown 规范,对构建 AI 应用的团队是切实的工程改进,值得加入设计检查清单。