Skip to main content
Os modelos Gemini Flash do Google DeepMind estão disponíveis na Tess para chat e agentes com baixa latência e bom custo. Esta página cobre Gemini 3.6 Flash (workhorse de produção) e Gemini 3.5 Flash-Lite (maior throughput / menor custo da classe 3.5 Flash).

Quando usar qual

Gemini 3.6 Flash

  • Melhor qualidade em coding e knowledge work com menor verbosidade que o 3.5 Flash (até ~17% menos tokens de output)
  • Multimodal nativo: texto, imagem, áudio e vídeo
  • Reasoning, tools (function calling / MCP) e computer use
  • Contexto grande para workflows de longo horizonte (1M input / até 64K output)

Gemini 3.5 Flash-Lite

  • Opção mais rápida e econômica da classe Gemini 3.5 Flash (até ~350 tokens/s de output)
  • Níveis de thinking configuráveis: priorize latência/custo ou profundidade
  • Ideal como worker barato em pipelines multiagente

Preços (créditos Tess)

Valores alinhados a Modelos e Custos (créditos por 100 tokens):
Placeholder de print — seletor de modelos: Capture o seletor de modelos do chat com Gemini 3.6 Flash e Gemini 3.5 Flash-Lite visíveis.
Boas práticas
  • Prefira 3.6 Flash para agentes de coding e jobs multimodais complexos.
  • Prefira 3.5 Flash-Lite para extração, classificação e sumarização em alto volume.
  • Mantenha prompts objetivos e limite o tamanho da resposta para reduzir consumo.
Veja também: Modelos e Custos.