跳到正文
北京时间
原文
Google Developers Blog(RSS)·· 6 天前精选AI 评分60

Antigravity SDK 支持本地模型,首发 Gemma 4 26B A4B 配合 LiteRT

Introducing Support for Local AI Models in the Antigravity SDK

AI 导读

Google 宣布 Antigravity SDK 支持本地工作流,首发支持通过 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B,可完全离线获得智能体辅助能力,建议机器配备超过 24GB VRAM 或统一内存。

推荐理由

官方给出完整的本地模型接入步骤和混合编排示例,开发者可以直接照此把智能体工作流搬到离线环境。

正文 · AI 翻译

2026年9月23日

今天,我们宣布 Antigravity SDK 支持在多种本地模型和执行选项上运行本地工作流,并初步支持使用 Google AI Edge 的 LiteRT 运行 Gemma 4 26B A4B。

Antigravity SDK 让开发者能够使用与 Google Antigravity 相同的智能体能力进行构建。借助这一新支持,你可以完全离线地通过本地模型启用智能体辅助。我们针对 LiteRT 和 Gemma 4 26B 优化了这一工作流,高效利用本地 GPU 和 RAM,进一步放大本地机器所能提供的性能!

为什么要在本地运行智能体?

本地模型执行可为智能体体验带来多项优势:

  • 成本效益:执行本地智能体工作流,无需 API 费用或速率限制。
  • 隐私:将你的代码和请求完全保留在本地机器上,非常适合面临严格数据隐私要求或受合规限制的企业环境的开发者。
  • 离线韧性:即使在没有稳定或持续互联网连接的环境中,也能无缝执行你的智能体工作流。
  • 混合工作流:将节省 token 的本地流程与云端流程相结合,以最大化效率,同时在需要时仍可使用更大、更强大的模型。

以下是如何开始:(我们建议使用显存或统一内存 >24GB 的机器)。

创建虚拟环境:

python3 -m venv .venv
source .venv/bin/activate

Python

已复制

安装 Antigravity SDK 和 LiteRT-LM,并下载 Gemma 4 26B A4B:

pip install google-antigravity litert-lm

litert-lm import \
  --from-huggingface-repo=litert-community/gemma-4-26B-A4B-it-litert-lm \
  gemma-4-26B-A4B-it-gpu.litertlm \
  gemma4-26b

Python

已复制

在你的目录中创建一个名为 agy_sample.py 的文件。将以下内容粘贴到其中。

import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy

# UPDATE: Point to the locally downloaded model from the previous step (litert-lm import ...)
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

async def main():
   print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

   config = LiteRTAgentConfig(model_path=MODEL_PATH).lightweight()
   async with Agent(config) as agent:
      response = await agent.chat("What files are in the current directory?")
      async for token in response:
         print(token, end="", flush=True)

if __name__ == "__main__":
   asyncio.run(main())

Python

已复制

混合编排:云端架构师遇上设备端工作团队

在许多情况下,我们发现 Architect-Builder 模式是结合云端模型规模与本地模型优势的绝佳方式。在下方使用更新版 Antigravity SDK 构建的混合演示视频中,云端架构师(Gemini 3.8 Flash)充当规划者和指挥者,而由 Gemma 4 26B 实例组成的本地集群则完全在设备端处理繁重工作。

当任务是对三个存在漏洞的模块(auth.py、billing.py 和 database.py)进行审计和修补时,该工作流保持了严格的数据隐私,并让我们充分利用 token:

  • 不上传代码:Gemini 3.8 Flash 仅根据文件名和任务描述来规划策略并分解工作——仅消耗 95 个云端 token,且任何源代码都从未离开本机。
  • 自主本地挑战:本地 Gemma 4 26B 模型接管本地 GPU,执行对抗性审计循环:复现安全漏洞、编写候选修复、评审补丁,并针对回归测试套件进行验证。
  • 巨大的成本和隐私收益:在本次记录的运行中,97.2% 的 token(3,322 个 token)在本地离线运行,未调用云端 API,交付了完全验证通过的绿色补丁,同时将专有代码完全安全地保留在设备端。

查看示例项目 here 以运行内置的 3 文件 gauntlet,或将其指向你自己的 Python 模块和测试套件。

抱歉,你的浏览器不支持播放此视频

Token Free 本地实用工具:CLI 资源监视器

Antigravity SDK 与 Gemma 4 26B A4B 擅长构建实用的系统工具。在此示例中,智能体构建了一个在终端中运行的实时更新资源监视器。只需一个提示,智能体就能自主编写一个使用 psutil 和 rich 库来跟踪 CPU 和内存使用情况的 Python 脚本,生成必要的 requirements.txt 文件,甚至测试生成的代码以确保其正常工作——所有这些都完全在你的本地机器上运行,并使用 Gemma 4 26B。

抱歉,你的浏览器不支持播放此视频

使用 Gemma 4 26B 在设备上生成的基于 Python 的 CLI 资源监视器工具

## cli_resource_monitor.py

import asyncio
import os
from google.antigravity import Agent, LiteRTAgentConfig
from google.antigravity.hooks import policy

# UPDATE: Your prompt
PROMPT = "Build a command-line interface tool using the psutil and rich libraries that displays a live-updating terminal dashboard. It should show CPU usage, memory consumption, and a sorted table of the top 5 most memory-intensive processes. Save the script as 'monitor.py' and create a 'requirements.txt' file. Test that it works."

# UPDATE: Point to the locally imported LiteRT-LM model path
MODEL_PATH = os.path.expanduser("~/.litert-lm/models/gemma4-26b/model.litertlm")

# UPDATE: Give AGY-SDK a workspace to write files
WORKING_DIR = os.path.expanduser("~/agy-test")

os.makedirs(WORKING_DIR, exist_ok=True)
os.chdir(WORKING_DIR)

async def main():
  print(f"Using local LiteRT model: {MODEL_PATH}. Please wait for local inference to complete. This could take several minutes.")

  config = LiteRTAgentConfig(
     model_path=MODEL_PATH,
     workspaces=[WORKING_DIR],
     policies=[policy.allow_all()],
  ).lightweight()

  async with Agent(config) as agent:
     response = await agent.chat(PROMPT)
     async for token in response:
        print(token, end="", flush=True)

if __name__ == "__main__":
  asyncio.run(main())

Python

已复制

Antigravity SDK 还通过 LocalOpenAIAgentConfig 为任何兼容 OpenAI 的服务器(如 Ollama、LM Studio 或 vLLM)提供无缝的即插即用支持。这让你能够灵活地试验不同的本地推理后端,同时保持智能体编排、工具和工作流完全不变。

通过查看 Antigravity Python SDK README 中的说明开始使用本地 AI,并了解如何使用 LiteRT 在边缘高效运行模型。请在 Antigravity Python SDK GitHub Issue Tracker 上分享你的反馈和功能请求。我们期待看到你的作品!

致谢:Abhi Patel、Ander Dobo、Ben Miles、Cormac Brick、Ian Ballantyne、Jingxiao Zheng、Jonathan Reay、Kimish Patel、Lu Wang、Marissa Ikonomidis、Matthias Grundmann、Olivier Lacombe、Omar Sanseviero、Rishika Sinha、Rody Davis、Taylor Mullen、Tyler Mullen、Wai Hon Law、Xiaoming Hu、Xu Chen、Yu-hui Chen

上一页

下一页

来源:Google Developers Blog(RSS) · developers.googleblog.com