For the complete documentation index, see llms.txt. This page is also available as Markdown.

Gemini 3.1 Flash Lite

Gemini 3.1 Flash Lite 截至2026年3月,它是谷歌最便宜、最快的生产模型,于2026年3月3日发布。它是 Gemini 3.1 系列中面向 API 优化的层级——专为实时聊天机器人、分类流水线和 RAG 检索层等高吞吐、成本敏感型工作负载而设计。可通过 Ollama 或 Clore.ai 上的 vLLM 在 GPU 上自托管,以实现最大的成本控制。

什么是 Gemini 3.1 Flash Lite?

于2026年3月3日发布,作为 Gemini 3.1 系列的轻量入门版本(该系列还包括2026年2月19日发布的 Gemini 3.1 Pro),Flash Lite 以牺牲一定推理深度为代价,换来大幅降低的延迟和成本。它是谷歌对“又快又便宜”层级的回应——在性价比上直接与 GPT-5.4 的 mini 变体和 Claude Sonnet 竞争。

主要规格:

  • 多模态:文本、图像、音频、视频输入

  • 上下文窗口:100万 tokens(与 Gemini 3.1 Pro 相同)

  • 输出:每个请求最多 8K tokens

  • 延迟:短提示词首 token 时间约 120ms(API)

  • 架构:通过 speculative decoding 从 Gemini 3.1 Pro 蒸馏而来

注意: Gemini 3.1 Flash Lite 是一个 仅限 Google API 的 模型——权重未公开发布。本指南涵盖:(a) 在 Clore.ai 基础设施上使用 Google Gemini API;以及 (b) 可完全自托管的类似开源替代方案。

方案 A:在 Clore.ai 服务器上使用 Gemini 3.1 Flash Lite API

即使你无法在本地运行权重,把你的 API 消费型应用托管在 Clore.ai 的廉价服务器上,对于长时间运行的进程、自动化流水线和批处理任务来说也很合理。

设置:在 Clore.ai 上部署 API 代理 + FastAPI

# 在 Clore.ai 上租用一台 CPU 或轻量 GPU 服务器
# RTX 3060($0.03–0.07/小时)对于 API 代理工作负载已经绰绰有余

pip install google-generativeai fastapi uvicorn

cat > gemini_proxy.py << 'EOF'
import google.generativeai as genai
from fastapi import FastAPI, HTTPException
from pydantic import BaseModel
import os

genai.configure(api_key=os.environ["GOOGLE_API_KEY"])
model = genai.GenerativeModel("gemini-3.1-flash-lite")

app = FastAPI(title="Gemini 3.1 Flash Lite 代理")

class ChatRequest(BaseModel):
    message: str
    system_prompt: str = "你是一个乐于助人的助手。"
    max_tokens: int = 2048

@app.post("/chat")
async def chat(req: ChatRequest):
    try:
        response = model.generate_content(
            [req.system_prompt, req.message],
            generation_config=genai.GenerationConfig(
                max_output_tokens=req.max_tokens,
                temperature=0.7
            )
        )
        return {"response": response.text, "model": "gemini-3.1-flash-lite"}
    except Exception as e:
        raise HTTPException(status_code=500, detail=str(e))

@app.post("/vision")
async def vision_chat(image_url: str, prompt: str):
    import httpx
    async with httpx.AsyncClient() as client:
        img_data = await client.get(image_url)
    
    import PIL.Image
    import io
    image = PIL.Image.open(io.BytesIO(img_data.content))
    response = model.generate_content([prompt, image])
    return {"response": response.text}

if __name__ == "__main__":
    import uvicorn
    uvicorn.run(app, host="0.0.0.0", port=8080)
EOF

GOOGLE_API_KEY=your-key uvicorn gemini_proxy:app --host 0.0.0.0 --port 8080

高吞吐批处理

方案 B:开源替代方案(在 Clore.ai 上自托管)

如果你想要完全本地推理且没有 API 成本,这些模型在“快/便宜”层级上可与 Gemini 3.1 Flash Lite 匹配:

Gemma 3 4B(谷歌的开源轻量模型)

Qwen3.5 7B(更快,且在相同规模下质量更高)

Clore.ai 硬件上的速度对比

模型
显存
每秒 tokens(RTX 4090,单流)
每 100 万输出 tokens 成本

Gemini 3.1 Flash Lite(API)

不适用

~200(API)

每 100 万 tokens 约 $0.25 输入 / $1.50 输出

Gemma 3 4B(本地)

4GB

95 tok/s

约 $0.58(RTX 4090,$0.20/小时)

Qwen3.5 7B(本地)

8GB

78 tok/s

~$0.71

Gemma 3 12B(本地)

12GB

55 tok/s

~$1.01

Gemma 3 27B(本地)

20GB

32 tok/s

~$1.74

结论: 如果一次只处理一个请求,自托管的成本大致与 API 相当。优势来自 批处理:使用 vLLM 或 SGLang 提供并发请求服务时,同一张 4090 上的总吞吐量会提升数倍,每百万 tokens 的成本也会随之下降。若你有稳定、并行的大量请求,就自托管;若流量是突发且量小,就用 API。

在 Clore.ai 上部署

适合 Flash Lite 层级工作负载的推荐 GPU

使用场景
推荐 GPU
Clore.ai 上的价格

API 代理 / 自动化

无需 GPU(CPU 服务器)

约 $0.05/小时

本地 4B 模型

RTX 3060 12GB

$0.03–0.07/小时

本地 7B 模型

RTX 3080 10GB

$0.05–0.19/小时

本地 27B 模型

RTX 4090 24GB

$0.14–0.42/小时(现货)

在 Clore.ai 上一键启动 Ollama

在 Clore.ai 仪表板中,选择 Ollama 以下模板中的

最适合 Flash Lite 层级的使用场景

  1. RAG 检索层 — 快速上下文排序,而不是最终生成

  2. 实时聊天机器人回复 — 短查询低于200ms

  3. 文档分类 — 每分钟处理数千份文档

  4. 代码自动补全 — 低延迟建议生成

  5. 翻译流水线 — 以低成本批量翻译内容

  6. 内容审核 — 大规模分类用户内容

成本估算器

月度用量
Google API 成本
Clore.ai(Gemma 3 4B)

1000万 tokens

~$8.75

约 $3.60(月 50 小时运行 RTX 3060)

1亿 tokens

~$7.00

约 $3.60(持续运行)

10亿 tokens

~$70.00

约 $26(持续运行 RTX 3060)

当月用量超过约 2 亿 tokens 时,在 Clore.ai 上自托管的成本低于 Gemini API。

监控 API 用量

相关指南


最后更新:2026年3月16日 | Gemini 3.1 Flash Lite 发布:2026年3月3日 | 权重:仅限 API(Google)

最后更新于

这有帮助吗?