> ## Documentation Index
> Fetch the complete documentation index at: https://docs.tess.im/llms.txt
> Use this file to discover all available pages before exploring further.

# DeepSeek V4.1 Flash

> Conheça a arquitetura, os benchmarks agênticos e os melhores cenários de uso do DeepSeek V4.1 Flash.

DeepSeek V4.1 Flash é um modelo multimodal da DeepSeek criado para **agentes, coding e workloads com grandes volumes de contexto**. Ele combina uma arquitetura Mixture-of-Experts (MoE) de 552 bilhões de parâmetros com processamento eficiente: ativa apenas 8B por token durante a leitura do contexto e 16B durante a geração.

| **Modelo do provider**<br /><br />`deepseek-ai/DeepSeek-V4.1-Flash`                         | **Contexto**<br /><br />1M tokens     | **Provider**<br /><br />DeepSeek | **Arquitetura**<br /><br />MoE · 552B                |
| :------------------------------------------------------------------------------------------ | :------------------------------------ | :------------------------------- | :--------------------------------------------------- |
| **Capacidades**<br /><br /><Icon icon="brain" /><Icon icon="image" /><Icon icon="wrench" /> | **Entrada**<br /><br />Texto + imagem | **Saída**<br /><br />Texto       | **Reasoning**<br /><br />Esforço contínuo de 1 a 100 |

## Por que este Flash chama atenção

O ganho central do V4.1 Flash está em **fazer mais trabalho agêntico sem carregar toda a arquitetura a cada token**. Sua combinação de Causal Encoder-Decoder e Compressed Sparse Attention 2 reduz o custo computacional de contextos extensos e deixa mais espaço para agentes que precisam ler, planejar, usar tools e continuar trabalhando por muitos passos.

<Info>
  O modelo aceita texto e imagem, oferece saída estruturada em JSON e function calling, e suporta até 1M tokens de contexto. Na implementação do provider, o `reasoning_effort` pode variar de 1 a 100.
</Info>

## O que mudou em relação ao DeepSeek V4 Flash

|                               | DeepSeek V4 Flash        | DeepSeek V4.1 Flash                                  |
| ----------------------------- | ------------------------ | ---------------------------------------------------- |
| Parâmetros totais             | 284B                     | **552B**                                             |
| Parâmetros ativados por token | 13B                      | **8B na leitura / 16B na geração**                   |
| Cache KV global               | Referência               | **Cerca de 4× menor**                                |
| Contexto                      | —                        | **Até 1M tokens**                                    |
| Foco                          | Modelo Flash generalista | **Coding, automações e agentes com contexto pesado** |
| Multimodal                    | —                        | **Texto + imagem**                                   |

A redução do cache KV é relevante principalmente em tarefas com muito input: repositórios, documentos extensos, histórico de ferramentas e projetos que acumulam contexto ao longo da execução.

## O que os benchmarks mostram

Os resultados publicados pela DeepSeek foram medidos com **esforço máximo** (`reasoning_effort=100`). Eles indicam um salto importante em tarefas agênticas, mas não significam liderança em todos os testes.

| Benchmark          | V4 Flash | V4.1 Flash |            Referência de mercado |
| ------------------ | -------: | ---------: | -------------------------------: |
| Terminal-Bench 2.1 |     82,7 |   **90,6** | Opus 5: 89,1 · GPT-5.6 Sol: 88,8 |
| DeepSWE v1.1       |     54,4 |   **74,2** | Opus 5: 74,0 · GPT-5.6 Sol: 73,0 |
| AutomationBench    |     37,7 |   **54,8** | Opus 5: 50,3 · GPT-5.6 Sol: 45,8 |
| Agent’s Last Exam  |     25,2 |   **31,8** | Opus 5: 28,6 · GPT-5.6 Sol: 26,7 |
| HLE com tools      |     51,5 |   **63,9** |                     Opus 5: 63,6 |
| CyberGym           |     76,7 |   **88,1** |                GPT-5.6 Sol: 84,5 |

<Tip>
  **O sinal mais importante:** o V4.1 Flash não apenas melhora sobre o V4 Flash. Em DeepSWE, Terminal-Bench 2.1 e AutomationBench, ele alcança ou supera modelos frontier maiores dentro da configuração testada.
</Tip>

### Onde ele ainda não lidera

O avanço não é uniforme. No Terminal-Bench 3.0 e 4.0, o V4.1 Flash permanece atrás de Claude Opus 5 e GPT-5.6 Sol. Em avaliações gerais de raciocínio como HLE sem tools, também não ocupa a primeira posição.

Isso torna a escolha mais clara: **use o V4.1 Flash quando o trabalho exige contexto, ferramentas e execução; compare outras opções quando a tarefa depende apenas de reasoning puro ou de máxima consistência em coding de última geração.**

## Como aplicar na Tess

O melhor teste não é uma pergunta isolada. Entregue ao agente um objetivo, as fontes necessárias, acesso às ferramentas e uma definição objetiva de pronto.

<Steps>
  <Step title="Escolha um fluxo com contexto real">
    Use um repositório, um conjunto de documentos ou uma operação que exija cruzar várias fontes. O ganho de arquitetura aparece quando há bastante informação para processar.
  </Step>

  <Step title="Dê ferramentas e limites">
    Habilite apenas as tools necessárias, determine o que pode ser alterado e exija confirmação para ações irreversíveis.
  </Step>

  <Step title="Defina como validar">
    Informe testes, campos obrigatórios, fontes que devem ser citadas ou condições que precisam ser satisfeitas antes da conclusão.
  </Step>

  <Step title="Ajuste o esforço à dificuldade">
    Comece com esforço intermediário e aumente quando o agente precisar investigar mais caminhos, manter tool loops longos ou recuperar-se de falhas.
  </Step>
</Steps>

## Três playbooks para começar

### 1. Mudança de software em um repositório grande

**Entrada:** repositório, comportamento esperado, padrões do projeto e comandos de teste.<br />**Tools:** código, terminal e suíte de testes.

```text theme={null}
Mapeie o fluxo responsável antes de editar. Faça a menor alteração capaz de
resolver o problema, adicione o teste que prova o comportamento e execute a
suíte relevante. Se algum teste falhar, investigue e corrija antes de concluir.
Entregue o diff resumido, os testes executados e os riscos restantes.
```

**Pronto quando:** a alteração está implementada, o comportamento está coberto e os testes relevantes passam.

### 2. Auditoria de documentos com evidências visuais

**Entrada:** contratos, relatórios, planilhas, diagramas e imagens.<br />**Tools:** busca nos arquivos e geração de documentos.

```text theme={null}
Cruze os documentos e as evidências visuais. Identifique divergências,
riscos e informações ausentes. Para cada conclusão, cite a fonte e indique
qual trecho ou elemento visual a sustenta. Gere uma matriz de achados e um
resumo executivo sem preencher lacunas por suposição.
```

**Pronto quando:** cada achado pode ser rastreado até a fonte e as lacunas estão explícitas.

### 3. Automação operacional com múltiplas tools

**Entrada:** objetivo, políticas internas, dados dos sistemas e critérios de aprovação.<br />**Tools:** conectores necessários para consultar e atualizar os sistemas envolvidos.

```text theme={null}
Planeje a execução, consulte as fontes necessárias e avance etapa por etapa.
Registre decisões e valide o resultado de cada tool antes de continuar.
Recupere-se de erros reversíveis; peça aprovação antes de qualquer ação de
alto impacto. Conclua somente quando todos os critérios forem verificados.
```

**Pronto quando:** os sistemas estão atualizados, as exceções estão registradas e o resultado pode ser auditado.

<Note>
  Benchmarks foram publicados pelo próprio provider e dependem do harness, das tools, dos parâmetros e do esforço usados. Valide o modelo no seu fluxo antes de substituir uma configuração em produção.
</Note>

## Boas práticas

* Use o V4.1 Flash em agentes de coding, automações e tarefas com grande volume de input.
* Não use 1M de contexto como meta: envie apenas o conteúdo necessário para a decisão.
* Exija fontes e validações em tarefas jurídicas, financeiras ou factuais.
* Compare com modelos mais fortes em reasoning puro quando o fluxo não usar tools.
* Mantenha confirmação humana para ações irreversíveis ou de alto impacto.

Veja também: [Modelos e Custos](/pt/models-and-cost) · [DeepSeek V4.1 Flash (DeepInfra)](https://deepinfra.com/deepseek-ai/DeepSeek-V4.1-Flash).
