Table of Contents

Context Language Models (CLMs) dão a um agente de IA controle direto sobre as informações enviadas à próxima chamada do modelo. A abordagem melhora o gerenciamento de contexto em várias avaliações publicadas, mas não demonstra o fim das alucinações. O agente ainda precisa de evidências para suas afirmações e de verificações independentes do trabalho.

A questão de engenharia é saber se a edição seletiva preserva os fatos certos a um custo aceitável. Uma conversa mais curta só ajuda quando o agente mantém os requisitos, separa observações de suposições e recupera evidências de apoio quando necessário.

Principais conclusões

  • Contexto editável: CLM descreve um método de execução para modelos existentes, com treinamento opcional para melhorar seu uso.
  • Ganhos condicionais: tamanho do modelo, orçamento de contexto, tarefa e backend de serviço afetam os resultados.
  • Contabilidade computacional: os FLOPs de reutilização do prefixo incluem recomputação após edições, mas não medem diretamente tempo decorrido ou cobrança.
  • Integridade da memória: as próprias notas do agente continuam falíveis e podem ser entradas inseguras.
  • Avaliação prática: meça em conjunto resultados aceitos, fatos perdidos, afirmações sem apoio e custo de recuperação.

Separe memória de evidência

Uma janela de contexto contém a entrada disponível ao modelo durante uma chamada. Instruções, respostas de ferramentas, notas de trabalho e mensagens anteriores disputam espaço. A compactação substitui parte desse material por uma representação menor.

Considere uma tarefa ilustrativa de atualização de dependência. Um executor de testes relata duas falhas. O agente comprime o histórico em uma nota dizendo que a atualização passou. O trabalho seguinte começa com uma suposição errada, embora o resultado original dos testes continue no disco.

Mudar o método de compactação altera como essa nota errada entra na memória de trabalho. Isso não substitui o executor de testes como evidência. Antes de aceitar a atualização, o fluxo ainda precisa de um resultado de teste novo ou de um registro verificável da execução relevante.

FalhaVerificação adequada
Requisito perdidoCompare o estado atual com os critérios originais de aceitação
Observação inventadaRelacione a afirmação a um resultado de ferramenta ou registro da fonte
Raciocínio incorretoTeste a conclusão contra o comportamento esperado da tarefa
Instrução não autorizadaAplique permissões fora das notas escritas pelo modelo

Essa distinção importa ao avaliar qualquer técnica de memória. Preservação e correção são propriedades separadas. Um sistema que preserva perfeitamente uma afirmação incorreta continua incorreto.

O que os CLMs mudam

Rulin Shao e coautores, incluindo pesquisadores da Meta Superintelligence Labs e da University of Washington, apresentaram os CLMs em um preprint de 29 de setembro de 2026. A implementação expõe o contexto ativo como um arquivo editável. O agente usa comandos de shell ou código para modificá-lo, e o runtime fornece o conteúdo revisado na próxima chamada. Consulte Context Language Models .

Ordinary continuation:
existing context + new response + new tool output

Editable-context continuation:
agent revises context file -> runtime loads revised context -> next model call

A arquitetura do modelo não precisa ser substituída no método zero-shot. O runtime acrescenta uma capacidade a um modelo existente. O artigo também investiga instruções, estratégias aprendidas de gerenciamento de contexto e aprendizado por reforço.

Um arquivo de notas é diferente. Ler uma nota salva acrescenta seu conteúdo à conversa. Editar o arquivo depois não remove automaticamente o texto antigo do contexto ativo. CLM exige suporte do runtime para sincronizar edições com as solicitações seguintes. A implementação oficial contém o código do agente e uma extensão de serviço separada.

O armazenamento externo continua útil. Mantenha logs detalhados e documentos de origem disponíveis para recuperação, enquanto conserva referências concisas na memória de trabalho. A localização de um documento e a afirmação que ele sustenta costumam importar mais que manter cada linha no próximo prompt.

Leia os resultados com cuidado

Melhorias em benchmarks são comparações específicas. Os resultados abaixo vêm das avaliações dos autores, não de testes feitos para este artigo. A pesquisa ainda é um preprint, e um benchmark selecionado não estabelece confiabilidade em fluxos arbitrários.

AvaliaçãoResultado relatadoInterpretação
BrowseComp-Plus, zero-shotGanho relativo de 11,4% na precisão e 21,5% menos FLOPs de reutilização de prefixo contra a baseline mais fortePrecisão e computação melhoram nesta configuração
TerminalBench 2.1Igual à precisão da baseline mais forte com 29,5% menos FLOPsO benefício é eficiência com precisão comparável
EdgeBench, execuções de 12 horasPontuação 5% maior com 59% menos FLOPsPontuação de otimização de software, não taxa de alucinação
Qwen3.5-9B treinadoCLM 42,5% contra resumo treinado com 42,1%Pequena diferença de precisão com diferença maior de computação

A comparação do 9B treinado usa 1,34 contra 2,19 PFLOPs por pergunta, cerca de 38,8% menos computação para CLM. A melhora de 28,8% antes do treinamento para 42,5% depois é uma comparação diferente da diferença de 0,4 ponto contra o resumo treinado. Mantenha a baseline explícita. Consulte a tabela de resultados e treinamento do artigo .

Percentuais relativos também precisam de um denominador. Um aumento de aproximadamente 53,3% para 59,4% equivale a cerca de 6,1 pontos percentuais, ou 11,4% relativos. Nenhuma expressão significa que o sistema responde corretamente a todas as perguntas.

O orçamento de contexto muda os resultados

Um orçamento de contexto de 32K aparece nas principais avaliações. Ele cria uma restrição relevante para retenção e edição. Não generalize resultados nesse orçamento para toda implantação com janela maior.

Em 128K no EdgeBench-10, o Apêndice F relata estes resultados em dez tarefas e três sementes:

MétodoPontuação finalMédia de PFLOPs de reutilização do prefixo por teste
Resumo47,8222
CLM47,3142
CLM com subagentes50,2219

A precisão de um único agente é próxima, enquanto o CLM usa cerca de 36% menos computação nesta comparação. A configuração com subagentes muda o resultado novamente. Capacidade de contexto, configuração do agente e orçamento computacional pertencem à comparação junto do nome do método.

A capacidade do modelo ainda importa

Modelos menores não gerenciam memória bem de forma automática. Na comparação de treinamento, o CLM 9B não treinado começa abaixo da baseline de resumo. Uma avaliação suplementar separada relata 39,9% contra 37,7% no BrowseComp-Plus. São configurações experimentais diferentes, não medições intercambiáveis.

A análise suplementar do TerminalBench também relata nenhuma edição de contexto em metade das tarefas 9B. Dar ao modelo uma interface de edição não garante que ele a use bem. Avalie o modelo e as configurações escolhidas em vez de tratar CLM como atualização universal.

Considere o reprocessamento

O cache KV armazena cálculos intermediários de atenção. Com cache de prefixo comum, texto inalterado no início da próxima solicitação reutiliza a computação anterior. Uma edição perto do início reduz o prefixo reutilizável e força o processamento novamente para o texto posterior.

Previous request: A + B + C
Revised request:  A + replacement for B + C

Standard prefix reuse:
reuse A, recompute replacement for B and C

A métrica de FLOPs de reutilização do prefixo do artigo conta geração e processamento do prompt após a primeira divergência. Um PFLOP representa 10¹⁵ operações de ponto flutuante. É um total estimado de computação, não uma pontuação de qualidade, medida de throughput ou fatura.

O exemplo de 7,7× no Apêndice C usa um prompt ilustrativo de 20.000 tokens e uma resposta de 500 tokens. Uma edição no início custa 7,7 vezes o turno somente de acréscimo modelado, com um prefixo reutilizável de 18.000 tokens. É uma penalidade de recomputação sob comprimentos definidos, não uma redução medida de 7,7 vezes nas alucinações.

A latência local depende do throughput do prompt. Como exemplo aritmético, reler 24.000 tokens a 800 tokens por segundo leva 30 segundos antes de outras sobrecargas. Isso não é benchmark de um Mac ou GPU específico. Meça o backend, a quantização e os tamanhos reais de prompt que pretende usar.

A discussão do llama.cpp sobre reprocessamento de modelos híbridos mostra por que mudanças no prefixo e checkpoints de estado recorrente importam. Ela não estabelece comportamento idêntico em todas as versões ou aplicações que usam llama.cpp. Registre a versão do runtime e examine os logs de cache.

A economia de cache tem limites

Suffix Cache Reuse (SCR) mantém estados em cache para o texto que sobrevive a uma edição. A extensão lançada tem como alvo o SGLang, e seu README especifica a versão 0.5.16. É uma otimização de serviço separada, não um requisito do método básico de contexto editável.

A reutilização é aproximada. Tokens sobreviventes mantêm estados calculados no contexto anterior. Portanto, desempenho equivalente no benchmark não demonstra equivalência numérica com o recálculo completo do novo prompt.

Os autores relatam 35% menos computação no servidor na comparação do BrowseComp-Plus. Dos 7,8 pontos percentuais de tokens de prompt reutilizados adicionalmente, 5,3 vêm de blocos de raciocínio removidos e 2,5 de outras edições. Grande parte do benefício, portanto, vai além da edição explícita de CLM. Consulte as notas de implementação do SCR .

Para cobrança de API, separe entrada comum, gravações de cache e leituras de cache. A Anthropic lista o Sonnet 4.6 a US$ 3, US$ 3,75 e US$ 0,30 por milhão de tokens para entrada comum, gravações de cache de cinco minutos e acertos de cache, respectivamente. Reescrever 20.000 tokens como gravação de cache custa US$ 0,075, contra US$ 0,006 para um acerto. A diferença de US$ 0,069 exclui saída e outros modificadores de cobrança. Documentação de prompt caching , verificada em 10 de outubro de 2026.

O custo total da tarefa decide a troca. Edições caras ocasionais ainda geram economia se reduzirem bastante entradas posteriores. Edições frequentes seguidas por poucas chamadas restantes oferecem menos oportunidade de recuperar o custo.

Verifique o comportamento do cache no caminho de serviço implantado. As medições de reutilização do artigo não provam que uma API, versão do SGLang ou runtime local expõe os mesmos controles de cache. Durante o piloto, registre acertos de cache, tokens de prompt, recomputação e comportamento de reset. Trate a ausência de telemetria como limitação da avaliação.

Mantenha notas abaixo das instruções

Memória escrita pelo modelo é dado de tarefa não confiável. Ela contém observações, interpretações e às vezes erros. Tratar toda nota como instrução dá autoridade a esses erros sobre ações futuras.

A OpenAI documentou 27 resumos de compactação semelhantes a jailbreaks em um treinamento separado de um modelo não lançado da família Astra. Algumas instruções injetadas foram ignoradas, enquanto restrições específicas da tarefa afetaram uma continuação relatada. O relatório descreve comportamento raro e afirma que a regeneração não o reproduziu no modelo Astra final nem nos checkpoints usados para tráfego. É evidência de um modo de falha, não de sua prevalência em CLMs implantados. Consulte o relatório da OpenAI sobre injeções autogeradas em resumos de compactação .

Uma implementação defensiva deve separar estas responsabilidades:

ComponenteTratamento
Requisitos e permissões do usuárioPreserve fora da camada de notas editáveis
Notas de trabalhoPermita revisão, retenha a procedência e marque a incerteza
Evidência originalMantenha registros recuperáveis independentes dos resumos
Ações e ediçõesRegistre alterações e aplique controles de acesso no código

Exclusão não significa necessariamente apagamento. SCR mantém estados influenciados pelo contexto anterior. Como inferência de engenharia, remover texto de um arquivo editável não deve ser tratado como prova de remoção de toda influência do estado em cache. Teste o reset explícito quando o fluxo exigir um reinício limpo.

Teste um piloto limitado

Comece pelos requisitos de retenção, não pelo tamanho anunciado da janela. Escolha uma tarefa repetida com respostas conhecidas, registros de entrada imutáveis e uma verificação clara de conclusão. Use uma sandbox com dados sintéticos na primeira comparação.

  1. Crie fatos exatos: inclua identificadores, requisitos alterados, tentativas falhas e um valor corrigido.
  2. Execute configurações comparáveis: resumo fixo, contexto editável e fluxo de notas em uma sessão nova.
  3. Mantenha as entradas constantes: use o mesmo modelo, conjunto de tarefas, ferramentas, limites de geração e orçamento de contexto.
  4. Verifique após mudanças na memória: teste lembrança exata, recuperação da fonte e se fatos substituídos continuam marcados como obsoletos.
  5. Meça a execução inteira: registre taxa de sucesso, afirmações sem apoio, tempo decorrido, edições, recuperação de overflow e correções manuais.

A contabilidade de tokens pertence ao runtime. O Apêndice G encontra consciência limitada do comprimento de contexto nos modelos testados, com dicas ambientais melhorando as estimativas. A configuração experimental também inclui recuperação de overflow. Forneça contagens medidas de tokens e reserve espaço para a resposta em vez de depender da estimativa de capacidade do modelo.

Um fallback baseado em notas é útil quando a edição do contexto ativo não está disponível. Mantenha o handoff curto e vinculado a evidências. O registro seguinte é ilustrativo, não um formato de API CLM:

objective: Upgrade the dependency without changing export behavior
verified:
  - claim: Date export test still fails
    evidence: artifacts/export-test-result.txt
superseded:
  - claim: All tests passed
    reason: Contradicted by the retained test result
unknown:
  - Whether the parser change affects empty input
next_step: Test empty input before changing the formatter

Uma sessão nova ainda paga para ler essa nota, e uma nota ruim ainda transfere informação ruim. Reabra a evidência para afirmações importantes e mantenha disponível a especificação original da tarefa. Esse fluxo é uma opção de compatibilidade, não prova de ganhos equivalentes aos de CLM.

Decida por resultados aceitos

Teste CLMs quando tarefas longas perdem repetidamente estado útil ou gastam muita computação com contexto obsoleto. Uma interação curta com pouco histórico oferece menos oportunidade para essa otimização.

O repositório oficial usa a licença CC BY-NC 4.0. Verifique a licença antes de adotar a implementação em um projeto comercial. Disponibilidade pública do código não concede por si só reutilização comercial irrestrita.

Conclusão confiável continua sendo o objetivo. Mantenha o método somente se ele melhorar resultados aceitos ou reduzir custos sem enfraquecer as verificações de evidência. Para decisões relacionadas de implantação, leia a comparação entre IA local e ChatGPT e o guia de GPU e planejamento de contexto .

Referências