跳到正文
北京时间

Google / Gemini

Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。

最新精选

第 261–280 条 · 共 316 条
4月15日周三
  1. Google Blog:AI(RSS)71

    Chrome 推出 Skills 功能:将优质 AI 提示词变为一键工具

    Chrome 浏览器新增 Skills 功能,支持用户发现、保存和重新组合 AI 工作流,实现一键即时复用。该功能可将常用 AI 提示词转化为可重复调用的自动化工具,避免重复输入复杂指令,提升浏览器内的 AI 使用效率。用户能够保存优质提示词并灵活改造,在 Chrome 中快速构建个性化 AI 工具库。

    推荐理由:把AI prompt存成浏览器一键工具,这个思路很直接但确实管用,省掉了每次重新输入的麻烦,对常用AI任务的效率提升是实打实的。

4月14日周二
  1. Google DeepMind:Blog(RSS)68

    Gemini Robotics-ER 1.6:通过增强具身推理赋能真实世界机器人任务

    Gemini Robotics-ER 1.6 正式发布,通过增强具身推理能力为真实世界机器人任务提供底层支持。该版本重点升级空间推理与多视角理解功能,使自主机器人能够更精准地解析三维环境、理解物体间空间关系,并在复杂场景中实现高效决策与操作执行,显著提升机器人在物理世界中的感知与交互性能。

    推荐理由:Gemini Robotics-ER 1.6 在机器人推理上迈了一大步,仪器读取和多视角成功检测是真需求,尤其是波士顿动力集成后,做具身智能的团队值得第一时间测试。

4月7日周二
  1. Google Developers Blog(RSS)67

    TorchTPU:在谷歌规模上原生运行 PyTorch 于 TPU

    TorchTPU 是一个新的工程栈,旨在让 PyTorch 工作负载以最小代码改动在谷歌 TPU 基础设施上获得原生高性能体验。它采用“Eager First”设计,提供多执行模式,并利用 XLA 编译器优化大规模集群的分布式训练。项目计划到 2026 年进一步降低编译开销,扩展对动态形状和自定义内核的支持,以确保下一代 AI 实现无缝扩展。

    推荐理由:Google 终于把 PyTorch 和 TPU 拉平了,TorchTPU 用 eager 优先的设计解决了 XLA 编译的别扭感,对依赖 PyTorch 又想啃 TPU 算力的人是个实在利好。

4月3日周五
  1. Artificial Analysis

    Google DeepMind推出Gemma 4系列四款多模态开源模型,支持文本、图像及视频输入。31B(密集架构)与26B A4B(MoE架构)拥有256k上下文窗口,可在单张H100运行;另两款较小模型支持128k上下文。GPQA Diamond测试中,Gemma 4 31B(Reasoning)获85.7%,仅次于Qwen3.5 27B,但输出token仅约1.2M,效率更优;26B A4B(Reasoning)得分79.2%,超越gpt-oss-120B。

    推荐理由:Google发布多模态开源模型Gemma 4,单卡H100可跑且科学推理能力突出

4月2日周四
  1. Google Developers Blog(RSS)81

    通过 Gemma 4 将先进的智能体能力引入边缘

    Google DeepMind 发布了 Gemma 4 系列开源模型,旨在直接在设备端实现多步骤规划和自主智能体工作流。该版本包含用于实验“智能体技能”的 Google AI Edge Gallery,以及为开发者提供显著速度提升和结构化输出的 LiteRT-LM 库。Gemma 4 采用 Apache 2.0 许可,支持超过 140 种语言,并兼容移动设备、台式机及树莓派等多种物联网硬件平台。

    推荐理由:开源 agentic 模型支持端侧运行,开发者可快速构建本地智能应用。

4月1日周三
  1. Google Developers Blog(RSS)71

    开发者指南:使用技能构建ADK智能体

    Agent Development Kit (ADK) SkillToolset 推出了“渐进式披露”架构,使AI智能体能够按需加载领域专业知识,与传统单体提示相比,可减少高达90%的令牌使用量。该系统通过四种模式——从简单的内联清单到智能体可自行编写代码的“技能工厂”——使智能体能在运行时利用通用的 agentskills.io 规范动态扩展其能力。这种模块化方法确保了复杂的指令和外部资源仅在相关时被访问,从而为现代AI开发构建了一个可扩展且能自我扩展的框架。

    推荐理由:开发者可借鉴此架构,构建更智能、更经济的AI代理。

3月31日周二
  1. Google Developers Blog(RSS)81

    Boost Training Goodput: 连续检查点功能如何优化 Orbax 和 MaxText 的训练可靠性

    Orbax 和 MaxText 引入了连续检查点新功能,旨在优化模型训练中可靠性与性能的平衡。它改变了传统固定频率检查点的模式,通过在前一个保存操作成功完成后才异步启动新操作,最大化I/O带宽并降低故障风险。基准测试表明,该方法显著缩短了检查点间隔,并实现了可观的资源节约,这在平均故障间隔时间较短的大规模训练任务中效果尤为突出。

    推荐理由:大规模模型训练的可靠性和效率提升,开发者可优化资源使用。

  2. Google Developers Blog(RSS)81

    ADK Go 1.0 正式发布:迈向生产就绪的多智能体开发框架

    Agent Development Kit (ADK) for Go 1.0 版本正式发布,标志着其从实验性脚本转向生产就绪的服务框架。本次更新核心在于强化可观测性、安全性与可扩展性,主要特性包括:原生集成OpenTelemetry以实现深度追踪;支持自愈逻辑的新插件系统;在敏感操作中引入“人在回路”安全确认机制。此外,新版本提供了基于YAML的配置以加速迭代,并优化了Agent2Agent协议,以支持跨编程语言的智能体无缝通信。该框架使开发者能够依托Go语言的高性能工程标准,构建复杂且可靠的多智能体系统。

    推荐理由:Go 语言开发者迎来官方 AI Agent 开发框架,可快速构建可靠多智能体系统。

3月30日周一
  1. Google Developers Blog(RSS)81

    Google 发布 Java 智能体开发套件 (ADK) 1.0.0 版本

    Google 正式发布了 Java 版智能体开发套件 (ADK) 的 1.0.0 版本。该版本引入了多项关键功能:支持接入 Google Maps 数据、内置 URL 抓取工具,以及用于跨框架协作的标准化 Agent2Agent 协议。其全新的“App”和“Plugin”架构增强了控制能力,实现了全局日志记录、通过事件压缩自动管理上下文窗口,以及需要人工确认的“Human-in-the-Loop”工作流。此外,该版本深度集成 Google Cloud 服务(如 Firestore 和 Vertex AI),提供了强大的会话与记忆管理功能,以处理长期状态和大型数据工件,助力开发者构建更复杂的 AI 智能体应用。

    推荐理由:Java开发者可利用官方工具快速构建集成Google服务的AI代理。

3月27日周五
  1. Demis Hassabis

    Google 发布 Gemini 3.1 Flash Live,称其迄今最高质量音频模型,具备更低延迟、更高精度和更自然的对话体验,改进了函数调用能力。现已在 Gemini App 和 Google AI Studio 上线。

    引用Google DeepMind@GoogleDeepMind

    欢迎 Gemini 3.1 Flash Live。🗣️ 我们最新的音频模型带来了更自然的对话体验,并改进了函数调用——使其更加实用且信息更丰富。以下是新功能介绍 🧵

    推荐理由:Google发布Gemini 3.1 Flash Live,支持低延迟语音交互与Agent构建

3月26日周四
  1. Demis Hassabis

    Google DeepMind 推出 Lyria 3 Pro,可生成最长3分钟的高保真音乐,支持自由编排前奏、主歌、副歌与桥段。Google AI 订阅者现可在 Gemini App 体验,开发者也能通过 Google AI Studio API 接入创作。

    引用Google DeepMind@GoogleDeepMind

    你现在可以用 Lyria 3 Pro 创作更长的曲目了。🎶 规划前奏、主歌、副歌和桥段,构建长达 3 分钟的高保真作品。🎹

    推荐理由:Google Lyria 3 Pro 支持生成 3 分钟结构化音乐,已上线 Gemini App

3月25日周三
  1. Google Developers Blog(RSS)84

    用 Agent 技能弥合知识鸿沟

    Google DeepMind 开发出一项“Gemini API 开发者技能”,使智能体能够实时获取最新文档与 SDK 指导。评估结果显示,配备该技能后,gemini-3.1-pro-preview 模型的成功率从 28.2% 大幅跃升至 96.6%。这种轻量级方法通过赋予模型强大的推理能力并接入“事实来源”,有效解决了静态模型知识与快速演进的软件实践之间的脱节问题,显著消除了过时的编码模式。

    推荐理由:通过实时文档赋能模型,编码任务成功率飙升,开发者可借鉴优化AI工具。

  2. Google Research:Blog(网页)

    Vibe Coding XR:基于 XR Blocks 与 Gemini 加速 AI + XR 原型开发

    Google XR 团队推出 Vibe Coding XR 工作流,结合 Gemini Canvas 与开源框架 XR Blocks,利用长上下文推理能力将自然语言提示在 60 秒内转化为可交互、支持物理效果的 WebXR 应用。该方案基于 WebXR、three.js 和 LiteRT.js 构建,支持手势交互与深度感知,可在桌面模拟环境或 Android XR 头显中实时预览。已展示的应用包括几何可视化数学辅导和交互式物理实验室,用户可通过捏合等手势操作 3D 对象,快速验证空间交互设计。

    推荐理由:Google推出Vibe Coding XR,用自然语言快速生成可交互的Android XR空间应用。

3月24日周二