Relatório Técnico
O Contexto Jurídico
Referencial de Engenharia
É no contexto que a vantagem da IA jurídica se multiplica.
Veja como medi-la.
Por Scott Kelly, vice-presidente de Produto
Nota: Este relatório foi elaborado com o auxílio de IA. Todas as pesquisas, análises e conclusões são de responsabilidade do autor.
48%
menor custo por resposta correta com o Gráfico de Contexto Jurídico
$940,000
economia anual para uma empresa com 2.000 funcionários
3.5x
mais barato do que uma atualização do modelo para ganhos comparáveis em termos de precisão
+7.3%
mais preciso, mesmo gastando 18% a menos
resumo
Resumo Executivo
Hoje, a NetDocuments apresenta o Legal Context Engineering Benchmark (“LCEB”): um benchmark interno desenvolvido especificamente para avaliar o valor que um contexto mais adequado representa para um agente de IA jurídica, tanto em termos de qualidade da resposta quanto em termos do custo de uma resposta correta. O LCEB varia o contexto disponibilizado ao agente, mantendo o modelo e o conjunto de testes fixos, o que representa o inverso da forma como a IA jurídica é normalmente avaliada.
Três fatores determinam se um agente de IA jurídica é eficaz.O modelo subjacentea ele,a estrutura construídaem torno dele (por exemplo, agentes específicos para o âmbito jurídico, como CoCounsel, Lexis+ com Protégé, Harvey, Legora e o próprio assistente da NetDocuments, ou agentes de uso geral como o ChatGPT ou o Claude) eo contexto ao qual eletem acesso enquanto trabalha — os documentos, a pesquisa que os localiza, o grafo de conhecimento que conecta os documentos entre si e qualquer outra informação que o escritório disponibilize sobre o assunto. Já existem diversos parâmetros de referência de qualidade (como o VLAIR,de Vals, eo BigLaw Bench, de Harvey) para medir os dois primeiros fatores isoladamente ou todos os três de forma holística. Mas, até onde sabemos, nenhum deles isola o impacto e os aspectos econômicos da própria camada de contexto — o que muda, tanto na qualidade da resposta quanto no custo, quando o modelo e o conjunto de dados são mantidos fixos e apenas o contexto varia.
Essa lacuna é importante porque cada fator — modelo, harness e contexto — evolui separadamente ao longo do tempo e apresenta diferentes oportunidades estratégicas para as empresas. Os modelos melhoram com o avanço das empresas que atuam na área de laboratórios de modelos fundamentais. Os harnesses constituem um espaço extremamente competitivo, e as empresas costumam utilizar vários ao mesmo tempo ou alternar entre eles ao longo do tempo, à medida que o cenário se transforma. O contexto é a camada que é construída uma única vez e se mantém em todas as atualizações de modelo e em todos os agentes que uma empresa adota. É um dos poucos aspectos em que o investimento da própria empresa se acumula, em vez de ser reiniciado.
Com isso em mente, criamos um teste de desempenho baseado no princípio mais simples: manter o modelo e o conjunto de testes constantes, realizar modificações apenas na camada de contexto e medir o que mudou em termos de precisão e custo. Nosso teste de desempenho é deliberadamente neutroquanto à forma como o contextodeve ser aprimorado, uma vez que metadados mais ricos, recuperação mais precisa, habilidades personalizadas e um gráfico de conhecimento são todos possíveis opções.
A precisão por si só seria um critério de avaliação equivocado, pois a precisão quase sempre pode ser obtida com um maior investimento: um modelo maior, mais raciocínio, mais recuperação de informações. Qualquer medida honesta de uma camada de contexto, portanto, precisa ponderar a qualidade que ela produz em relação ao custo para obtê-la. A unidade que definimosé o custo de uma resposta correta. A variação nesse valor é o que chamamosde Índice de Valor do Contexto (CVR). Quando avaliamos nosso Gráfico de Contexto Jurídico em relação a esse parâmetro de referência, os resultados foram decisivos. Por exemplo:
Em 300 perguntas sobre dez temas reais respondidas pelo modelo de ponta GPT 5.6 Sol, o custo de uma resposta correta caiu de US$ 0,68 para US$ 0,36, com a precisão mantida praticamente constante — um Índice de Valor de Contexto de 1,92, ou cerca de 48% a menos por resposta correta.
Resultado da avaliação do Gráfico de Contexto Jurídico do NetDocuments em relação ao padrão de referência.
Essa eficiência coloca as empresas diante de uma escolha. Elas podem aproveitar a economia, reinvesti-la em respostas melhores ou fazer as duas coisas. Uma empresa satisfeita com a precisão atual pode aproveitar a economia diretamente.Para uma empresa com 2.000 funcionários que faz quatro milhões de perguntas por ano, isso se traduz em aproximadamente US$ 940.000 em economia anual, mantendo a mesma qualidade.Uma empresa que deseja maior precisão pode reinvestir parte dessa eficiência. Na análise comparativa, discutimos um exemplo em que aumentar o nível de raciocínio do modelo de médio para alto melhorou a precisão em 7%, mantendo o custo 18% menor do que o da linha de base. Em termos práticos, isso representa 216.000 respostas corretas adicionais por ano. Esses ganhos não são fáceis: as respostas que um sistema ainda precisa acertar são, por definição, as mais difíceis.
E, embora esses números sejam o destaque, este relatório se concentra profundamente na metodologia por trás deles: como e o que medir em relação ao contexto jurídico, qual é o valor de um ganho na qualidade das respostas em relação ao seu custo e onde um investimento adicional traz maior retorno. O objetivo é fornecer aos departamentos jurídicos e escritórios de advocacia uma estrutura reutilizável para avaliar o impacto de sua própria camada de contexto ao longo do tempo.
01 – Como funciona
Como funciona o LCEB — e a estrutura por trás dele
A estrutura fundamental do Legal Context Engineering Benchmark consiste em uma comparação controlada com uma única variável. Um agente — ou seja, um modelo fixo dentro de um ambiente de teste fixo — responde ao mesmo conjunto de perguntas duas vezes. Na primeira rodada, o agente dispõe apenas das ferramentas que um agente normalmente possui: uma pesquisa nos documentos do caso e a capacidade de recuperar seu texto para investigação posterior. Na segunda rodada, ele dispõe dessas mesmas ferramentas e, além disso, pode acessar a camada de contexto aprimorada que está sendo testada (por exemplo, um grafo de conhecimento, filtros de metadados mais eficazes, pesquisa semântica). Como o modelo, as instruções e as perguntas permanecem constantes nas duas rodadas, qualquer diferença que surja na qualidade das respostas ou no custo provavelmente é resultado direto da engenharia de contexto.
Observe que manter outras variáveis constantes é mais difícil do que parece. Uma descrição de ferramenta que orienta um agente de forma a causar sobreajuste no conjunto de dados de teste, uma mensagem do sistema alterada que instrui o agente a se comportar de maneira diferente, um parâmetro de busca ajustado para um lado e deixado inalterado no outro: cada um desses fatores introduz uma segunda variável, e qualquer resultado decorrente disso deixa de ser uma medição do contexto. Nosso ambiente de testes interno, portanto, compara as duas interfaces da ferramenta antes do início de uma execução e não pode prosseguir se elas diferirem em qualquer aspecto que não seja a disponibilidade do próprio Gráfico de Contexto Jurídico.
A versão atual de nosso benchmark é executada em dez casos reais — cinco transacionais e cinco contenciosos —, reunidos a partir de registros regulatórios públicos e pautas judiciais que, no todo ou em parte, estão fora do período de corte dos dados de treinamento dos modelos com os quais realizamos os testes (isso ajuda a garantir que os agentes não respondam com base em seus dados de treinamento e sejam, ao contrário, obrigados a basear-se exclusivamente no conteúdo do caso de teste). Juntos, os dez casos totalizam 874 documentos e aproximadamente 60 milhões de caracteres: declarações de registro e procurações que chegam a centenas de milhares de caracteres cada, além de pautas de processos contendo moções, decisões, transcrições de depoimentos e correspondência. Nada no corpus de documentos foi gerado sinteticamente, o que constitui uma escolha deliberada de projeto que fizemos. Repetidamente, em nossos testes, observamos que um caso gerado sinteticamente que parecia realista à primeira vista carecia de lógica interna ou — pior ainda — revelava uma simplicidade irrealista quando examinado mais de perto.
Cada tema do LCEB contém pelo menos vinte e cinco questões — trezentas no total, distribuídas pelas dez áreas — e cada uma delas é uma questão que um profissional do direito teria motivos para fazer. Elas são deliberadamente distribuídas por uma variedade de níveis de dificuldade e tipos, e cada uma está identificada com o tipo ao qual pertence.
Tipo
O que é solicitado
Exemplo
Lembre-se
Um fato, mencionado em um único lugar
“Qual é o número do processo cível?”
Raciocínio em um único documento
Uma inferência dentro de um único documento
“De acordo com essa disposição, quem arca com o risco de perda antes do fechamento da transação?”
Montagem entre documentos
Dados coletados de várias fontes
“Enumere todas as alterações ao contrato-quadro e suas datas de vigência.”
Síntese de matéria integral
Uma resposta que aborde a questão na íntegra
“Resuma o caso.”
Sem resposta
Questões sobre as quais os autos não se pronunciam
“Qual é o valor da indenização acordada?”, quando não houve acordo algum
Processual
Em que ponto se encontra o processo e o que acontecerá a seguir
“Quando a declaração de registro entrou em vigor?”
As perguntas são elaboradas a partir dos documentos originais por meio da geração de uma série de modelos robustos para ler integralmente cada documento de um processo, o que frequentemente representa um esforço extremamente ineficiente em termos de tokens e oneroso. Os agentes, então, propõem pares de perguntas e respostas com base no que é encontrado nessas análises aprofundadas. Cada par é elaborado em três partes: a própria pergunta, uma resposta de referência que expõe o que o registro realmente comprova (incluindo citações) e uma breve lista dos elementos específicos que uma resposta completa deve conter, a qual se torna a tabela de pontuação para essa pergunta.
Por fim, verificamos as respostas e as rubricas por meio de validações determinísticas (por exemplo, se as citações na resposta correspondem efetivamente ao texto do corpus de documentos), bem como por meio de verificações pontuais realizadas por um especialista humano na matéria.
EXEMPLO: Uma pergunta e o que uma resposta correta deve conter
O caso
: a fusão da Cyclerion Therapeutics com a Korsana Biosciences por meio de uma fusão reversa: 77 documentos apresentados à SEC e 15 milhões de caracteres, incluindo um Formulário S-4 e três emendas com cerca de três milhões de caracteres cada.
Pergunta
“Quando o Formulário S-4 foi assinado, quando foi apresentado e quando entrou em vigor? Indique qualquer data que o registro conteste.” Tipo:processual.
A resposta de referência
, assinada em 17 de abril de 2026 e protocolada em 20 de abril de 2026 — ambas corretas, pois respondem a perguntas diferentes. Em vigor a partir de 24 de julho de 2026. A única data que o processo realmente contesta é a da Emenda nº 1 ao contrato de fusão, datada de 17 de abril, mas indicada como 16 de abril no índice de anexos do formulário S-4 e na nota auditada da Korsana.
A tabela de avaliação das respostas —três critérios, cada um avaliado como “aprovado” ou “reprovado”
- Afirma que o formulário S-4 foi assinado em 17 de abril de 2026 e protocolado em 20 de abril de 2026, considerando ambas as datas corretas.
- Estabelece que a declaração de registro entrou em vigor em 24 de julho de 2026.
- Relata a controvérsia entre os dias 16 e 17 de abril quanto à data da Emenda nº 1.
O critério 2 é a razão pela qual essa questão consta do conjunto. A data de vigênciaaparece exatamente uma vez em todo o documento —não na declaração de registro, onde o tópico indica que ela deveria constar, mas na nota sobre eventos posteriores de um relatório trimestral apresentado posteriormente.
As respostas geradas pelos agentes nas duas execuções de teste — por exemplo, uma com o Gráfico de Contexto Jurídico ativado e outra sem ele — são então avaliadas por um modelo robusto, que analisa a pergunta, os critérios aplicáveis a ela, a resposta gerada na íntegra e o histórico das chamadas de ferramentas que o agente realizou ao produzi-la.
EXEMPLO: Comparando respostas com e sem contexto
Este exemplo é analisado ao longo deste relatório e provém de um teste de benchmark específico realizado com o GPT-5.6 Luna em nível de esforço médio, com o Legal Context Graph ativado e desativado.
Apenas pesquisa e recuperação — pontuação de 0,10
“Assinado: 17 de abril de 2026… Protocolado: A capa do Formulário S-4 indica ‘Conforme protocolado na SEC em 17 de abril de 2026’. No entanto, o Formulário 10-K/A posterior da Cyclerion afirma que o Formulário S-4 foi protocolado em 20 de abril de 2026. Assim, os registros apresentam discrepâncias quanto à data de registro: 17 de abril versus 20 de abril de 2026. Vigência: Os registros disponíveis não indicam uma data em que o Formulário S-4 tenha sido declarado em vigor … Portanto, não posso fornecer com segurança uma data de vigência com base nesses documentos.”
Critério
Veredicto
1. Assinado e arquivado
REPROVADO
A obra apresenta ambas as datas, mas as mantém em conflito, em vez de conciliá-las.
2. A partir de 24 de julho
REPROVADO
Declara que a data não consta dos autos.
3. O conflito de 16 e 17 de abril
REPROVADO
Não foi mencionado.
Com o Gráfico do Contexto Jurídico — pontuação de 0,67
“Assinado em:17 de abril de 2026 …Registrado em:20 de abril de 2026. O Formulário 10-K/A posterior da empresa afirma expressamente que o Formulário S-4 foi registrado na SEC em 20 de abril de 2026.Entrada em vigor:24 de julho de 2026. O Formulário 10-Q informa que a SEC aprovou a entrada em vigor do Formulário S-4 em 24 de julho de 2026.”
Critério
Veredicto
1. Assinado e arquivado
APROVADO
Separa a assinatura do arquivamento, em vez de deixá-las em conflito.
2. A partir de 24 de julho
APROVADO
Fornecido e com referência ao relatório trimestral.
3. O conflito de 16 e 17 de abril
REPROVADO
Ainda não foi mencionado.
Observação: Além das notas de aprovação/reprovação acima, o avaliador atribui uma pontuação geral — uma avaliação da resposta como um todo, em vez de uma contagem dos critérios atendidos; é por isso que as duas não variam em sincronia.
Uma execução registra duas informações: se a resposta estava correta e quanto custou para ser produzida. Cada chamada feita pelo agente é contabilizada, e seus tokens são classificados em três tipos — entrada nova, entrada em cache e saída —, pois cada um é cobrado a uma taxa diferente. Essas taxas correspondem aos preços publicados para o modelo responsável pela resposta, atualizados na data da publicação. O resultado é um valor em dólares.
Observe que, como o modelo é mantido fixoem umacomparação, essa comparação pode ser repetida com um modelo diferente e os resultados podem ser analisados lado a lado. Fizemos isso com todos os três membros da família GPT-5.6, de modo que apenas as mudanças nas capacidades sejam consideradas, enquanto a estrutura de preços permanece comparável:
Atendente
Função
Preço
Economia
GPT-5.6 Luna
Otimizado para cargas de trabalho de alto volume e com foco na redução de custos
Dados: US$ 0,20 / 1 milhão
Receita: US$ 1,20 / 1 milhão
Em cache: US$ 0,02 / 1 milhão
Nível intermediário
GPT-5.6 Terra
Equilibra inteligência e custo; a escolha ideal para a produção diária
Entrada: US$ 2,00 / 1 milhão
Receita: US$ 12,00 / 1 milhão
Em cache: US$ 0,20 / 1 milhão
Fronteira
GPT-5.6 Sol
Para trabalhos profissionais complexos
Entrada: US$ 5,00 / 1 milhão
Receita: US$ 30,00 / 1 milhão
Em cache: US$ 0,50 / 1 milhão
Todos os três compartilham uma data limite de conhecimento em 16 de fevereiro de 2026; portanto, a exposição ao corpus durante o treinamento é idêntica entre eles. Todos os três foram testados com os mesmos dez temas, as mesmas 300 perguntas, os mesmos critérios de avaliação, o mesmo backend de documentos em tempo real e a mesma configuração do avaliador. A única diferença entre os três quadros de resultados que apresentaremos posteriormente (na Seção 2) é qual modelo respondeu às perguntas.
Duas características justificam a realização dessa comparação adicional. Em primeiro lugar, ela verifica se uma camada de contexto funciona como uma muleta para modelos fracos ou como um acelerador para modelos fortes — uma distinção que determina se o investimento sobreviverá à próxima atualização do modelo. Em segundo lugar, o CVR divide dois custos medidos nomesmo modelo; assim, o preço do modelo aparece tanto no numerador quanto no denominador e se cancela. O que sobrevive ao cancelamento é exatamente o que desejamos comparar: em que medida o uso da camada de contexto por cada modelo altera o custo da resposta correta para ele. É por isso que os três índices podem ser analisados lado a lado, mesmo que os valores em dólares por trás deles não possam.
02 – a unidade de medida
Quanto custa uma resposta correta
A variação de custo entre um agente e outro executado no mesmo modelo costumava ser pequena o suficiente para ser ignorada na maioria dos casos. Quando um agente respondia em uma única passagem, ele lia e gravava de forma modesta; agora, ele planeja, aciona ferramentas, lê, repete tentativas e verifica seu trabalho, e isso se tornou o maior custo variável da execução do sistema. Essa tendência só vem se acelerando.O METR, que avalia tarefas de software e pesquisa em vez de tarefas jurídicas, constata que o tempo que um agente de ponta leva para concluir uma tarefa sem ajuda, com uma taxa de sucesso de 50%, agora chega a várias horas e vem dobrando aproximadamente a cada quatro meses.
Isso torna o custo algo a ser medido, além de levantar a questão de em que unidade medi-lo. O custo por consulta ou por tarefa é o valor mais fácil de calcular e um dos menos informativos, pois o que realmente importa para um profissional do direito é uma resposta correta.O custo por resposta correta é, portanto, o parâmetro que selecionamos: o total gasto em uma execução dividido pelo número de respostas corretas, ponderado pelo crédito, o que resulta em um único valor em dólares, sendo que quanto menor, melhor.
O que esse valor representa é o custode responder: cada chamada de modelo que o agente realiza ao responder a uma pergunta ou ao executar uma tarefa. A construção do contexto, em primeiro lugar, é um custo separado, cobrado uma vez por assunto, e não uma vez por pergunta, e faz parte da visão “totalmente carregada” discutida na Seção 4.
EXEMPLO: Das notas ao preço
Emtodas as 30 perguntassobre o caso Cyclerion, utilizando apenas pesquisa e recuperação de informações, com o modelo GPT-5.6 Luna respondendo:
índice de qualidade
0.5973
(59,73 de 100)
x perguntas
x30
respostas corretas
17.92
gasto total
$0.5404
÷ respostas corretas
17.92
CUSTO POR RESPOSTA CORRETA
$0.0302
Observação: as respostas parcialmente corretas são pontuadas pela parte respondida corretamente; é por isso que o divisor é 17,92, e não um número inteiro.
Então:
custo por resposta correta, SEM a camada de contexto
custo por resposta correta, COM a camada de contexto
= ÍNDICE DE VALOR CONTEXTUAL
A Relação de Valor do Contexto indica quantas vezes mais barata se torna uma resposta correta. Com um valor de 2,0, a camada de contexto faz com que uma resposta correta custe metade do preço. Acima de 1,0, ela compensa seu custo; em 1,0, ela atinge o ponto de equilíbrio; abaixo de 1,0, ela custa mais do que rende.
EXEMPLO: A proporção, em relação a um único assunto
A questão sobre o Cyclerion dos exemplos acima — uma das dez — com os dois braços lado a lado; resposta do modelo GPT-5.6 Luna.
Apenas pesquisa e recuperação
Com o Gráfico do Contexto Jurídico
Índice de qualidade
59.73
68.00
Gastos totais, 30 perguntas
$0.5404
$0.3556
Respostas corretas
17.92
20.40
Fichas por resposta
281,868
150,507
Custo por resposta correta
$0.0302
$0.0174
CVR = $0,0302 ÷ $0,0174 = 1,73
Uma resposta correta custa cerca de 40% a menos quando se utiliza o GPT-5.6 Luna com o Gráfico de Contexto Jurídico. Ambos os termos da relação evoluíram na direção correta ao mesmo tempo, o que significa que o agente gastou 34% a menose respondeumelhor, em vez de ter que sacrificar um aspecto em detrimento do outro.
O índice medeuma variação, que é a questão que uma empresa que está avaliando um investimento se coloca: a partir da situação atual, isso vale a pena? O que ele não pode indicar é qual é a situação inicial da empresa. É por isso que, além do valor do CVR, sempre analisamos o índice de qualidade: em que medida o agente fornece uma resposta completa, calculado como média de todas as perguntas, em uma escala de 0 a 100.
Ambos os números são absolutamente essenciais, pois um preço sempre pode ser melhorado reduzindo o esforço, em vez de aprimorando o desempenho, e a maneira menos onerosa de reduzir o custo de uma resposta correta é deixar de tentar responder às perguntas difíceis. Considere dois sistemas submetidos às mesmas cem perguntas:
Perguntas respondidas
Correto
Gastos totais
Custo por resposta correta
Sistema A
100
80
$10.00
$0.125
Sistema B
40
38
$3.00
$0.079
As respostas do Sistema B custam um terço a menos cada uma, e o Sistema B é aquele que nenhuma empresa desejaria, já que deixou sessenta das cem perguntas sem resposta. O preço, por si só, não é suficiente para diferenciá-los.
A mesma cautela se aplica à comparação entre dois sistemas diferentes — ou entre conjuntos de documentos distintos —, pois é mais fácil melhorar um preço quando ainda há margem de manobra em sua referência: um sistema que responde a seis de cada dez perguntas apresenta ganhos de baixo custo em toda a linha, enquanto aquele que já responde a nove de cada dez precisa investir pesadamente para conquistar cada ponto restante. A proporção é mais confiável quando analisada em relação à própria linha de base anterior da empresa — mesmos assuntos, mesmas perguntas, com e sem a camada de contexto.
Esse é todo o método. O resultado são os quadros de resultados apresentados a seguir. Vamos analisar mais a fundo.
O RÁCIO DE DESEMPENHO (1 de 3): Modelo econômico — GPT-5.6 Luna
Apenas pesquisa e recuperação
Com o Gráfico do Contexto Jurídico
Alterar
Índice de qualidade
64.00
65.1
+1.1
Respostas corretas, de um total de 300
191.9
195.3
+3.4
Custo para responder ao conjunto completo
$4.35
$2.83
-35%
Fichas por resposta
208,424
110,001
-47%
Custo por resposta correta
$0.0227
$0.0145
-36%
Relação entre valor e contexto
—–
1.57
—
A TABELA DE RESULTADOS (2 de 3): Modelo de nível intermediário — GPT-5.6 Terra
Apenas pesquisa e recuperação
Com o Gráfico do Contexto Jurídico
Alterar
Índice de qualidade
67.4
69.0
+1.6
Respostas corretas, de um total de 300
202.1
206.9
+4.8
Custo para responder ao conjunto completo
$42.40
$23.65
-44%
Fichas por resposta
181,465
86,431
-52%
Custo por resposta correta
$0.2098
$0.1143
-46%
Relação entre valor e contexto
—–
1.84
—
O RAPORTO (3 de 3): Modelo Frontier — GPT-5.6 Sol
Apenas pesquisa e recuperação
Com o Gráfico do Contexto Jurídico
Alterar
Índice de qualidade
73.9
75.4
+1.5
Respostas corretas, de um total de 300
221.8
226.2
+4.4
Custo para responder ao conjunto completo
$151.10
$80.46
-47%
Fichas por resposta
270,103
130,447
-52%
Custo por resposta correta
$0.6813
$0.3557
-48%
Relação entre valor e contexto
—–
1.92
—
Leia os três juntos. Os modelos mais avançados apresentam melhores resultados em termos absolutos, como seria de se esperar, considerando que custam 10 e 25 vezes mais. O que este conjunto acrescenta é o comportamento dacamada de contexto ao longodessa faixa:
Luna (classe econômica)
Terra (nível intermediário)
Sol (fronteira)
Qualidade, sem o gráfico
64.0
67.4
73.9
Qualidade, com o Gráfico
65.1
69.0
75.4
Redução de tokens
-47%
-52%
-52%
Relação entre valor e contexto
1.57
1.84
1.92
- O Índice de Valor do Contexto melhora com a capacidade do modelo, passando de 1,57 para 1,84 e, posteriormente, para 1,92. O agente mais robusto extrai mais informações do mesmo contexto, e não menos. Essa é uma constatação importante para o Gráfico de Contexto Jurídico, pois sugere que, à medida que os modelos fundamentais se tornam cada vez melhores, sua capacidade de aproveitar bases de contexto bem projetadas só tende a melhorar. Isso faz com que os investimentos em engenharia de contexto sejam do tipo que crescem mês a mês.
- No entanto, os ganhos concentram-se na fase inicial. A transição da camada econômica para a intermediária representa um ganho de +0,27; já a transição da camada intermediária para a de ponta, apenas +0,08. Uma empresa não precisa da camada de ponta para aproveitar a maior parte do que a camada de contexto oferece — o que é importante, pois é na camada intermediária que a maior parte do trabalho de produção será, de fato, executada.
- O mecanismo é o mesmo em todos os casos: menos tokens para respostas iguais ou melhores —uma redução de 47% nos tokens no modelo econômico e de 52% nos outros dois. Uma camada de contexto que permite que um agente leia menos para encontrar a mesma resposta correta gera economias que aumentam na medida em que o custo de cada token é mais elevado. Observe que a redução de tokens já atingiu seu limite máximo no nível intermediário; portanto, a proporção mais elevada do Sol decorre de um termo de qualidade marginalmente superior, e não de uma redução maior.
03 – Colocando em prática
Qual é o valor dessas economias para uma empresa
Um indicador como o Índice de Valor Contextual é útil em teoria, mas o que realmente importa para escritórios de advocacia e departamentos jurídicos é como colocá-lo em prática: seja para aprimorar seus negócios, seja para elevar o padrão da prestação de serviços jurídicos. Esta seção aborda exatamente isso.
Considere uma grande empresa — 2.000 profissionais com acesso a um assistente de IA jurídica — e pergunte-se qual é o valor do Gráfico de Contexto Jurídico para ela ao longo de um ano. Três configurações influenciam essa questão, e medimos todas as três no modelo de fronteira com base nas mesmas 300 perguntas:
esforço de raciocínio
custo por pergunta
qualidade
Apenas pesquisa e recuperação
médio
$0.5037
73.9
Com o Gráfico do Contexto Jurídico
médio
$0.2682
75.4
Com o Graph, o esforço atingiu um nível elevado
alto
$0.4109
79.3
As duas primeiras linhas representam o resultado de referência da Seção 2, expresso por pergunta: a camada de contexto garante qualidade e reduz o preço pela metade. A terceira linha é fundamental para o tema desta seção. Tendo reduzido o custo de uma pergunta em quase metade por meio do Gráfico de Contexto Jurídico, um escritório não precisa necessariamente converter essa economia em dinheiro efetivo. Em vez disso, ela pode “reinvestir” parte dessas economias em configurações do agente que aumentem a precisão — um modelo maior, um orçamento de raciocínio mais extenso, uma recuperação mais ampla. Para os fins deste exemplo, consideramos a opção mais simples: elevar o esforço de raciocínio do modelode “médio” para “alto”, o que permite que o mesmo agente delibere por mais tempo sobre cada pergunta, raciocinando mais detalhadamente, verificando mais e lendo mais profundamente.
O que torna essa atualização acessível é a camada de contexto. Aumentar o esforço de raciocínio custa aproximadamente 1,5 vez mais por pergunta, independentemente da presença ou não do Graph. Quando aplicada à linha de base sem assistência, essa atualização aumentaria os gastos da empresa em cerca de metade. Quando aplicada sobre um preço por pergunta que já foi reduzido pela metade, a mesma atualização faz com que a empresa gaste18% a menos do quegasta atualmente. A precisão é, portanto, obtida com despesas que a empresa já havia orçado.
Consequentemente, a empresa se depara com uma escolha estratégica genuína, e não com um pedido de financiamento, uma vez que nenhuma das opções exige gastar um dólar a mais do que gasta atualmente. A primeira consiste em economizar o valor poupado, mantendo a qualidade em paridade: 73,9 contra 75,4. A segunda consiste em reinvesti-lo: a precisão aumenta de 73,9 para 79,3, enquanto os gastos continuam a diminuir. A magnitude de cada opção depende do grau de utilização da ferramenta pela empresa, que é a única variável que não podemos fornecer. Ao longo de 250 dias úteis e com 2.000 profissionais:
Perguntas por pessoa por dia
Número de perguntas por ano
Depositado, economizado por ano
Reinvestido, economizado por ano
Respostas corretas adicionais por ano
1
500,000
$117,700
$46,400
+27,000
2
1,000,000
$235,500
$92,700
+54,000
4
2,000,000
$470,900
$185,500
+108,000
8
4,000,000
$941,900
$370,900
+216,000
A uma média de oito perguntas por pessoa por dia — um número realista para um escritório de advocacia cujos profissionais realmente contam com os agentes como companheiros no trabalho diário —, a economia gerada representa aproximadamente US$ 940.000 por ano, de forma recorrente, por uma capacidade que o escritório já desenvolveu. Por outro lado, reinvestir esse valor rende 216.000 respostas corretas adicionais, com o escritório ainda ficando cerca de US$ 371.000 por ano em melhor situação do que está hoje.
O segundo desses aspectos merece atenção especial, pois inverte a relação de compromisso habitual. A precisão nos sistemas de IA é normalmente alcançada por meio de maiores gastos: um modelo maior, mais raciocínio, mais recuperação de informações — cada um desses elementos tem um custo mais elevado. Aqui, a ordem é inversa. A camada de contexto reduz primeiro o custo de uma consulta, e a precisão é financiada com os recursos gerados, de modo que uma empresa encerra o ano tanto com maiorprecisão quantoem melhor situaçãofinanceira— uma combinação raramente disponível.
Além disso, o que mais importa é exatamente onde um parâmetro de referência se torna difícil. À medida que um sistema se aproxima do limite máximo em um conjunto de questões, as respostas que permanecem pendentes são as mais onerosas: as reconciliações entre vários documentos, as questões cuja resposta aparece uma vez a cada quinze milhões de caracteres. Essas são precisamente as respostas que uma deliberação mais aprofundada permite obter. Uma empresa que liberou verba pode se dar ao luxo de gastá-la nessa cauda; uma empresa que não o fez, não pode.
04 – Ao longo do ciclo de vida de um processo
Quando a situação está em constante mudança
Tudo o que foi exposto acima é um instantâneo: congelar a questão, construir o contexto, fazer as perguntas. É aí que a maioria dos parâmetros de referência se limita, mas essa não é a realidade da maioria das questões jurídicas. Os documentos chegam, são revisados, são substituídos, e é necessário construir uma camada de contexto e, em seguida, mantê-la.
A primeira consequência é que o Índice de Valor de Contexto é melhor compreendido como uma curva do que como um único número. O contexto é construído uma vez por processo; o valor que ele retorna é acumulado a cada pergunta feita ou tarefa realizada. Um processo que seja encerrado rapidamente, ou que uma equipe jurídica nunca tenha motivo para investigar, não compensará o investimento, por melhor que o contexto tenha sido elaborado. À medida que o número de perguntas aumenta, o custo de construção amortizado entre elas cai em direção a zero e a relação se aproxima do valor referente apenas às respostas relatado acima. A questão-chave é, portanto,o volume de agentes de equilíbrio: o número de perguntas respondidas pelos agentes por caso no qual o índice total — custo de construção somado ao custo de resposta — atinge 1,0. Vale a pena destacar esse aspecto porque ele transforma uma pergunta que um escritório não consegue responder — “vale a pena a engenharia de contexto?” — em uma que ele pode responder: “com que intensidade trabalhamos um caso?”
Três variáveis determinam o volume de agência de equilíbrio. A primeira é o custo de construção da camada de contexto, determinado pela escolha do modelo e pelo volume de texto processado. Deliberadamente, não divulgamos nosso próprio valor: em nossos dez casos, ele variou em cerca de seis vezes com configurações idênticas, pois o que o determina são os documentos, e não qualquer decisão nossa, e um único número extraído de nosso corpus e aplicado ao de outra empresa seria enganoso. Esse é o único parâmetro que uma empresa deve medir por conta própria. O segundo é a economia por pergunta, que é o que o benchmark mede.
A terceira característica merece uma análise mais detalhada: as variações nas técnicas utilizadas para construir a camada de contexto desde o início. Algumas abordagens de engenharia de contexto, por exemplo, derivam seu valor de uma estrutura calculada de tal forma que cada novo documento adicionado ou alterado invalida o que já havia sido construído, e o custo se repete cada vez que um documento é arquivado. Outras abordagens se aplicam a documentos individuais; assim, um novo documento acrescenta trabalho proporcional ao seu próprio volume e deixa intacto tudo o que já foi construído. No início, essas táticas de engenharia de contexto podem parecer idênticas e ter o mesmo custo; ao longo da duração de um processo que recebe documentos semanalmente, elas divergem acentuadamente. Um índice medido em um corpus estático favorece o modelo de reconstrução; portanto, um escritório deve determinar em qual tipo está investindo antes de comparar os números gerais.
Há uma quarta consideração que o resultado de dois níveis acima traz à tona. O custo de construção e o custo de resposta não precisam ser arcados no mesmo nível do modelo. A construção de um índice no nível do documento é uma tarefa limitada e mecânica — ler um documento, descrever o que está nele e onde — e, muitas vezes, está bem dentro da capacidade de um modelo econômico. Responder a uma questão jurídica no âmbito de um processo, por sua vez, muitas vezes não o é. Um escritório pode, portanto, construir sua camada de contexto com um modelo econômico e destinar a economia resultante a um modelo muito mais capaz no momento de responder às questões.
Essa assimetria tem um grande impacto no volume de agentes de equilíbrio, pois a economia por pergunta varia proporcionalmente ao preço do modelo utilizado pelo agente que responde, ao passo que o custo de construção não varia.
EXEMPLO: Quando a construção se paga sozinha
Um caso com 200 documentos. A camada de contexto é construída uma única vez com um modelo econômico, e as perguntas são respondidas por um agente utilizando um modelo de fronteira — a divisão descrita acima.
Documentos relativos ao caso
200
Custo de elaboração do índice para este assunto (modelo econômico)
$0.80
Economia por cada questão respondida (modelo de fronteira)
$0.2355
Volume de equilíbrio, em questões
≈ 4
O número referente à construção é um valor aproximado para fins ilustrativos — pelo motivo exposto acima, o que o determina são os documentos.
Como o modelo de resposta é caro e o modelo de construção é barato, um assunto amortiza sua camada de contexto quase imediatamente — e todas as perguntas a partir da quarta representam lucro puro. Se forem feitas cem perguntas sobre esse assunto ao longo de sua vida útil, a camada terá gerado um retorno de aproximadamente trinta vezes o custo de sua construção.
Faça o mesmo cálculo considerando também o modelo econômico, e o ponto de equilíbrio fica mais próximo de 160 perguntas — o que ainda é viável em um tema amplamente explorado, mas representa um caso de investimento bem diferente. A diferença entre esses dois números é o ponto principal: é a combinação de uma estrutura de baixo custo com uma resposta de alto valor que, muitas vezes, faz com que a engenharia de contexto tenha retorno mais rápido.
Observe que a versão atual do Legal Context Engineering Benchmark não mede as mudanças ao longo do tempo, mas já começamos a testar ampliações do benchmark que levam em conta conjuntos de assuntos que se desenrolam em etapas, sendo que cada documento contém sua data real. Esperamos apresentar um relatório sobre esse conjunto de dados separadamente nos próximos meses. Enquanto isso, a observação geral permanece válida: uma camada de contexto não é algo construído de uma só vez, mas sim cultivado ao longo do tempo para se otimizar de acordo com os valores de um escritório de advocacia ou departamento jurídico.
05 – O convite
Por que estamos divulgando o método
O que descrevemos neste relatório não é apenas o parâmetro de referência interno que orienta a evolução do Legal Context Graph da NetDocuments, mas também a metodologia que sustenta esse parâmetro — uma metodologia que esperamos que qualquer departamento jurídico ou escritório de advocacia possa utilizar para avaliar o investimento na camada de contexto.
Para aplicar essa metodologia, basta seguir as etapas descritas.
- Mantenha o seu modelo e o seu arnês inalterados.
- Anote os tipos de perguntas que seus profissionais realmente fazem e peça a alguém qualificado que especifique o que uma resposta completa deve conter.
- Altere uma técnica ou capacidade de engenharia de contexto por vez.
- Avalie uma resposta correta antes e depois.
- E leia você mesmo algumas das respostas antes de acreditar em qualquer um desses números.
- Sempre que o orçamento permitir, realize a comparação em mais de um nível de modelo — essa é a maneira mais econômica de descobrir se o que o senhor desenvolveu é um obstáculo ou um impulsionador.
Em essência, esse ciclo é a forma como a engenharia de contexto pode se acumular, dia após dia, ano após ano, para construir uma base de inteligência e alcançar um novo padrão na prestação de serviços jurídicos.
© 2026 NetDocuments Software, Inc. Todos os direitos reservados. NetDocuments é uma marca registrada da NetDocuments Software, Inc. nos Estados Unidos e em outras jurisdições. Todas as demais marcas registradas, marcas de serviço e nomes comerciais são de propriedade de seus respectivos titulares.
Veja qual contexto é valioso para a sua empresa
Executaremos o LCEB em seus processos, com suas perguntas, no agente que o senhor já utiliza.


