El contexto jurídico
Referencia en ingeniería 

Es en el contexto donde la ventaja de la IA jurídica se potencia.
Así es como se mide. 

Por Scott Kelly, vicepresidente de Producto

Nota: Este informe se ha redactado con la ayuda de la inteligencia artificial. Toda la investigación, el análisis y las conclusiones son responsabilidad del autor.

Resumen ejecutivo

Hoy, NetDocuments presenta el Legal Context Engineering Benchmark («LCEB»): un índice de referencia interno diseñado específicamente para medir el valor que tiene un mejor contexto para un agente de IA jurídica, tanto en lo que respecta a la calidad de las respuestas como al coste que supone una respuesta correcta. El LCEB varía el contexto disponible para un agente mientras mantiene fijos el modelo y el conjunto de pruebas, lo cual supone el proceso inverso al que se sigue habitualmente para evaluar la IA jurídica. 

Hay tres factores que determinan la eficacia de un agente de IA jurídico:el modelo enel que se basa,el marco creadoa su alrededor (por ejemplo, agentes específicos para el ámbito jurídico como CoCounsel, Lexis+ con Protégé, Harvey, Legora y el propio asistente de NetDocuments, o los de uso general como ChatGPT o Claude), yel contexto al quepuede acceder mientras trabaja: los documentos, la búsqueda que los localiza, el grafo de conocimiento que conecta los documentos entre sí y cualquier otro dato que el bufete facilite sobre el asunto. Ya existen varios índices de referencia de calidad (como el VLAIRde Valsyel BigLaw Bench de Harvey) para medir los dos primeros factores de forma aislada o los tres de manera integral. Sin embargo, según nuestro conocimiento, ninguno aísla el impacto y los aspectos económicos de la propia capa de contexto: qué cambia, tanto en la calidad de la respuesta como en el coste, cuando el modelo y el sistema de control se mantienen fijos y solo varía el contexto. 

Esa brecha es importante porque cada factor —modelo, marco de trabajo y contexto— evoluciona por separado con el tiempo y presenta diferentes oportunidades estratégicas para las empresas. Los modelos mejoran con los avances de las empresas dedicadas a los modelos fundamentales. Los marcos de trabajo constituyen un ámbito extremadamente competitivo, y las empresas suelen utilizar varios a la vez o alternar entre ellos con el paso del tiempo, a medida que cambia el panorama. El contexto es la capa que se crea una sola vez y se mantiene a lo largo de todas las actualizaciones de modelos y todos los agentes que adopta una empresa. Es uno de los pocos ámbitos en los que la inversión propia de una empresa se acumula en lugar de reiniciarse. 

Teniendo esto en cuenta, hemos creado una prueba comparativa basada en el principio más sencillo: mantener constantes el modelo y el conjunto de datos de entrenamiento, realizar modificaciones únicamente en la capa de contexto y medir los cambios en términos de precisión y coste. Nuestra prueba comparativa es deliberadamente neutralen cuanto a cómose supone que debe mejorarel contexto, ya que tanto unos metadatos más completos, como una recuperación más precisa, unas habilidades personalizadas y un grafo de conocimiento son posibles opciones. 

La precisión por sí sola no sería un criterio de evaluación adecuado, ya que casi siempre se puede aumentar la precisión invirtiendo más recursos: un modelo más grande, más razonamiento, más consultas. Por lo tanto, cualquier medida honesta de una capa de contexto debe sopesar la calidad que genera frente al coste que supone obtenerla. La unidad que hemos elegidoes el coste de una respuesta correcta. La variación de esa cifra es lo que denominamos«Índice de Valor Contextual»(CVR). Cuando evaluamos nuestro Gráfico de Contexto Jurídico con respecto a este criterio de referencia, los resultados fueron contundentes. Por ejemplo:

Resultado de la evaluación del «Legal Context Graph» de NetDocuments en comparación con el punto de referencia.

Esta eficiencia plantea una disyuntiva a las empresas. Pueden quedarse con el ahorro, reinvertirlo en mejores respuestas o hacer ambas cosas. Una empresa satisfecha con la precisión actual puede materializar el ahorro directamente.Para una empresa de 2.000 empleados que formula cuatro millones de preguntas al año, eso se traduce en un ahorro anual de aproximadamente 940.000 dólares sin que varíe la calidad.Una empresa que desee una mayor precisión puede reinvertir parte de esa eficiencia. En el análisis comparativo, se expone un ejemplo en el que aumentar el nivel de razonamiento del modelo de medio a alto mejoró la precisión en un 7 %, al tiempo que el coste seguía siendo un 18 % inferior al del modelo de referencia. En términos prácticos, eso supone 216 000 respuestas correctas adicionales al año. No se trata de avances fáciles: las respuestas que un sistema aún no ha acertado son, por definición, las más difíciles.

Y aunque esas cifras acaparan los titulares, este informe se centra en profundidad en la metodología que hay detrás de ellas: cómo y qué hay que medir en relación con el contexto jurídico, qué valor tiene una mejora en la calidad de las respuestas frente a su coste, y en qué ámbitos una mayor inversión reporta mayores beneficios. El objetivo es proporcionar a los departamentos jurídicos y a los bufetes de abogados un marco reutilizable para evaluar el impacto de su propio contexto a lo largo del tiempo. 

Cómo funciona el LCEB —y el marco en el que se basa—

El diseño fundamental del Legal Context Engineering Benchmark consiste en una comparación controlada con una única variable. Un agente —es decir, un modelo fijo dentro de un entorno de prueba fijo— responde al mismo conjunto de preguntas en dos ocasiones. En la primera pasada, el agente solo dispone de las herramientas con las que cuenta habitualmente: una búsqueda en los documentos del asunto y la capacidad de recuperar su texto para un análisis más detallado. En la segunda ronda, dispone de esas mismas herramientas y, además, puede acceder a la capa de contexto mejorada que se está sometiendo a prueba (por ejemplo, un grafo de conocimiento, mejores filtros de metadatos o búsqueda semántica). Dado que el modelo, las instrucciones y las preguntas se mantienen constantes en ambas rondas, es probable que cualquier diferencia que surja en la calidad de las respuestas o en el coste se deba directamente a la ingeniería de contexto. 

Tenga en cuenta que mantener constantes otras variables es más difícil de lo que parece. Una descripción de la herramienta que guía a un agente de tal forma que se produce un sobreajuste del conjunto de datos de prueba, un mensaje del sistema modificado que indica al agente que se comporte de manera diferente, un parámetro de búsqueda ajustado para un lado y no modificado para el otro: cada uno de estos elementos introduce una segunda variable, y cualquier resultado que se obtenga a partir de ahí ya no constituye una medición del contexto. Por lo tanto, nuestro sistema de pruebas interno compara las dos interfaces de la herramienta antes de que comience una ejecución, y no puede continuar si difieren en cualquier aspecto que no sea la disponibilidad del propio Gráfico de Contexto Jurídico. 

La versión actual de nuestra prueba comparativa se basa en diez casos reales —cinco transaccionales y cinco litigiosos—, recopilados a partir de documentos regulatorios públicos y expedientes judiciales que, en su totalidad o en parte, quedan fuera del periodo de datos de entrenamiento de los modelos con los que hemos realizado las pruebas (esto ayuda a garantizar que los agentes no respondan basándose en sus datos de entrenamiento y se vean obligados, en su lugar, a basarse exclusivamente en el contenido del caso de prueba). En conjunto, los diez casos suman 874 documentos y aproximadamente 60 millones de caracteres: declaraciones de registro y poderes que alcanzan cientos de miles de caracteres cada uno, junto con expedientes de mociones, resoluciones, transcripciones de declaraciones y correspondencia. Ningún documento del corpus se generó de forma sintética, lo cual fue una decisión de diseño deliberada por nuestra parte. Una y otra vez, durante nuestras pruebas, observamos que un asunto generado sintéticamente que parecía realista a simple vista carecía de lógica interna o —lo que es peor—, al examinarlo más detenidamente, resultaba ser de una simplicidad poco realista. 

Cada tema del LCEB contiene al menos veinticinco preguntas —trescientas en total entre los diez temas— y cada una de ellas es una pregunta que un profesional del Derecho tendría motivos para plantear. Están distribuidas deliberadamente según distintos niveles de dificultad y tipos, y cada una de ellas está identificada con el tipo al que pertenece. 

Retirada del mercado

Un hecho, expuesto en un solo lugar

«¿Cuál es el número de la demanda civil?»

Razonamiento en un único documento

Una inferencia dentro de un mismo documento

«Según esta disposición, ¿quién asume el riesgo de pérdida antes del cierre?» 

Ensamblaje entre documentos

Datos recopilados a partir de varias

«Enumere todas las modificaciones del convenio marco y su fecha de entrada en vigor». 

Síntesis de la materia en su conjunto

Una respuesta que abarque todo el asunto

«Resuma el caso». 

Sin respuesta

Cuestiones sobre las que no hay constancia en el expediente

«¿A cuánto ascienden los daños y perjuicios acordados?», cuando no se acordó ninguna cantidad

De carácter procesal

En qué punto se encuentra el proceso y qué va a suceder a continuación 

«¿Cuándo entró en vigor la declaración de registro?» 

Las preguntas se redactan a partir de los documentos originales mediante la aplicación de una serie de modelos avanzados que leen íntegramente cada documento de un expediente, lo que a menudo supone una tarea enormemente ineficiente en términos de tokens y costosa. A continuación, los agentes proponen pares de preguntas y respuestas a partir de lo que se encuentra en estos análisis en profundidad. Cada par se compone de tres partes: la pregunta en sí, una respuesta de referencia que expone lo que realmente respalda el expediente (incluidas las citas) y una breve lista de los elementos específicos que debe contener una respuesta completa, que se convierte en la rúbrica de puntuación para esa pregunta. 

Por último, verificamos las respuestas y las rúbricas mediante validaciones determinísticas (por ejemplo, si las citas de la respuesta se corresponden realmente con el texto del corpus de documentos), así como mediante comprobaciones aleatorias realizadas por un experto humano en la materia. 

El asunto
: la fusión de Cyclerion Therapeutics con Korsana Biosciences mediante una fusión inversa: 77 documentos presentados ante la SEC y 15 millones de caracteres, entre los que se incluyen un formulario S-4 y tres enmiendas que suman aproximadamente tres millones de caracteres cada una. 

Pregunta n.º
: «¿Cuándo se firmó el formulario S-4, cuándo se presentó y cuándo entró en vigor? Indique cualquier fecha sobre la que haya discrepancias en el expediente». Tipo:procedimental. 

La respuesta de referencia
, firmada el 17 de abril de 2026 y presentada el 20 de abril de 2026; ambas son correctas, ya que responden a preguntas diferentes. Con efecto a partir del 24 de julio de 2026. La única fecha que se discute realmente en el expediente es la de la Enmienda n.º 1 al acuerdo de fusión, que figura con fecha del 17 de abril, pero que aparece como 16 de abril en el índice de anexos del formulario S-4 y en la nota auditada de Korsana. 

La rúbrica de evaluación de las respuestas:tres criterios, cada uno de los cuales se califica como «aprobado» o «suspenso» 

  1. Se indica que el formulario S-4 se firmó el 17 de abril de 2026 y se presentó el 20 de abril de 2026, considerándose correctas ambas fechas. 
  2. Se indica que la declaración de registro entró en vigor el 24 de julio de 2026. 
  3. Se informa sobre la controversia entre el 16 y el 17 de abril en relación con la fecha de la Enmienda n.º 1. 

El criterio 2 es la razón por la que esta cuestión figura en el conjunto. La fecha de entrada en vigoraparece exactamente una vez en todo el expediente —no en la declaración de registro, donde, según el tema, debería figurar, sino en la nota sobre hechos posteriores de un informe trimestral presentado con posterioridad—. 

Las respuestas generadas por los agentes en las dos ejecuciones de prueba —por ejemplo, una con el «Legal Context Graph» activado y otra sin él— son evaluadas posteriormente por un modelo avanzado, que analiza la pregunta, los criterios que se le aplican, la respuesta completa generada y el historial de llamadas a herramientas que el agente realizó para elaborarla. 

Este ejemplo se analiza a lo largo de este informe y procede de una prueba de rendimiento específica realizada con GPT-5.6 Luna en el nivel de esfuerzo medio, tanto con el «Legal Context Graph» activado como desactivado. 

Solo búsqueda y recuperación — puntuación: 0,10

«Firmado: 17 de abril de 2026… Presentado: La portada del formulario S-4 indica: «Tal y como se presentó ante la SEC el 17 de abril de 2026». Sin embargo, el formulario 10-K/A posterior de Cyclerion indica que el formulario S-4 se presentó el 20 de abril de 2026. Por lo tanto, los documentos disponibles presentan discrepancias en cuanto a la fecha de presentación: 17 de abril frente a 20 de abril de 2026. Entrada en vigor: Los documentos disponibles no indican la fecha en la que se declaró vigente el formulario S-4… Por consiguiente, no puedo determinar de forma fiable una fecha de entrada en vigor a partir de estos documentos». 

1. Firmado y presentado

SUSPENSO

Menciona ambas fechas, pero las deja en conflicto en lugar de conciliarlas. 

2. A partir del 24 de julio

SUSPENSO

Declara que dicha fecha no figura en el acta.

3. El conflicto del 16 y 17 de abril

SUSPENSO

No se menciona.

Con el «Legal Context Graph» — puntuación: 0,67

«Firmado:17 de abril de 2026…Presentado:20 de abril de 2026. El formulario 10-K/A posterior de la empresa indica expresamente que el formulario S-4 se presentó ante la SEC el 20 de abril de 2026.Entrada en vigor:24 de julio de 2026. El formulario 10-Q indica que la SEC aprobó la entrada en vigor del formulario S-4 el 24 de julio de 2026». 

1. Firmado y presentado

PASS

Separa la firma de la presentación, en lugar de dejar que ambas acciones entren en conflicto.

2. A partir del 24 de julio

PASS

Se ha facilitado, con referencia al informe trimestral.

3. El conflicto del 16 y 17 de abril

SUSPENSO

Todavía no se ha mencionado.

Nota: Además de las calificaciones de «aprobado» o «suspenso» mencionadas anteriormente, el evaluador asigna una puntuación global —una valoración de la respuesta en su conjunto, en lugar de un recuento de los criterios cumplidos—, por lo que ambas no coinciden necesariamente.

Una ejecución registra dos datos: si la respuesta fue correcta y cuánto costó generarla. Se contabiliza cada llamada que realiza el agente, y sus tokens se clasifican en tres tipos —entrada nueva, entrada almacenada en caché y salida—, ya que cada uno se factura a una tarifa diferente. Dichas tarifas son los precios publicados para el modelo que proporciona la respuesta, vigentes en el momento de la publicación. El resultado es una cifra expresada en dólares. 

Tenga en cuenta que, dado que el modelo se mantienefijo en unacomparación, esta puede repetirse con un modelo diferente y los resultados pueden analizarse en paralelo. Así lo hemos hecho con los tres miembros de la familia GPT-5.6, de modo que solo varíen las capacidades y la estructura de precios siga siendo comparable: 

Economía

GPT-5.6 Luna

Optimizado para cargas de trabajo de gran volumen en las que el coste es un factor determinante

Datos de entrada: 0,20 $ / 1 millón 

Rendimiento: 1,20 $ / 1 millón 

En caché: 0,02 $ / 1 millón 

Gama media

GPT-5.6 Terra

Combina inteligencia y rentabilidad; la opción ideal para la producción diaria 

Entrada: 2,00 $ / 1 M 

Ingresos: 12,00 $ / 1 millón 

En caché: 0,20 $ / 1 millón 

Frontera

GPT-5.6 Sol

Para trabajos profesionales complejos 

Ingreso: 5,00 $ / 1 M 

Ingresos: 30,00 $ / 1 millón 

En caché: 0,50 $ / 1 millón 

Los tres comparten una fecha límite de conocimiento fijada para el 16 de febrero de 2026, por lo que la exposición al corpus durante el entrenamiento es idéntica en todos ellos. Los tres se sometieron a las mismas diez temáticas, las mismas 300 preguntas, las mismas rúbricas, el mismo backend de documentos en tiempo real y la misma configuración del sistema de corrección. Lo único que difiere entre las tres fichas de puntuación que presentamos más adelante (en la sección 2) es qué modelo respondió a las preguntas. 

Hay dos características que hacen que merezca la pena realizar esta comparación adicional. En primer lugar, permite comprobar si una capa de contexto es un apoyo para los modelos débiles o un acelerador para los fuertes —una distinción que determina si la inversión se mantiene tras la siguiente actualización del modelo—. En segundo lugar, el CVR divide dos costes medidos enel mismo modelo, por lo que el precio del modelo aparece tanto en el numerador como en el denominador y se anula. Lo que sobrevive a la cancelación es precisamente lo que queremos comparar: en qué medida el uso que hace cada modelo de la capa de contexto modifica el coste que le supone obtener una respuesta correcta. Por eso se pueden comparar los tres ratios en paralelo, aunque no se puedan comparar los importes en dólares que hay detrás de ellos. 

Cuánto cuesta una respuesta correcta

La variación de costes entre un agente y otro que se ejecutan en el mismo modelo solía ser lo suficientemente pequeña como para ignorarla en la mayoría de los casos. Cuando un agente respondía en una sola pasada, leía y escribía de forma moderada; ahora planifica, recurre a herramientas, lee, vuelve a intentarlo y comprueba su trabajo, y eso se ha convertido en el mayor coste variable de la ejecución del sistema. Esta tendencia no hace más que acelerarse.METR, que se centra en tareas de software e investigación en lugar de en tareas jurídicas, ha constatado que la duración de una tarea que un agente de vanguardia completa sin ayuda, con una tasa de éxito del 50 %, asciende ahora a varias horas, y se ha ido duplicando aproximadamente cada cuatro meses. 

Esto convierte el coste en algo que debe medirse, además de plantear la cuestión de en qué unidad debe medirse. El coste por consulta, o por tarea, es la cifra más fácil de calcular y una de las menos informativas, ya que lo que realmente le importa a un profesional del derecho es obtener una respuesta correcta. Por lo tanto,el coste por respuesta correcta esel barómetro que hemos seleccionado: el total gastado en una ejecución dividido por el número de respuestas correctas ponderadas por crédito que contiene, lo que arroja una única cifra en dólares, en la que cuanto menor sea, mejor. 

Lo que refleja esa cifra es el costede las respuestas: cada llamada al modelo que realiza el agente al responder a una pregunta o al llevar a cabo una tarea. La creación del contexto, en primer lugar, supone un coste independiente, que se abona una vez por asunto en lugar de una vez por pregunta, y que forma parte de la visión «completamente cargada» que se analiza en la sección 4. 

EJEMPLO: De las puntuaciones al precio 

Enlas 30 preguntassobre el asunto Cyclerion, basándonos únicamente en la búsqueda y la recuperación de información, con el modelo GPT-5.6 Luna como fuente de respuesta: 

Nota: Las respuestas parcialmente correctas se puntúan en función de la parte que se haya respondido correctamente; por ello, el divisor es 17,92 y no un número entero. 

A continuación:

El «Context Value Ratio» indica cuántas veces más barata resulta una respuesta correcta. Con un valor de 2,0, la capa de contexto hace que una respuesta correcta cueste la mitad. Por encima de 1,0, la respuesta genera un beneficio; con un valor de 1,0, se alcanza el umbral de rentabilidad; por debajo de 1,0, cuesta más de lo que reporta. 

EJEMPLO: La proporción, en un caso concreto

El caso de Cyclerion de los ejemplos anteriores —uno de los diez—, con ambos brazos uno al lado del otro; responde el modelo GPT-5.6 Luna. 

Puntuación de calidad

59.73

68.00

Gasto total, 30 preguntas

$0.5404

$0.3556

Respuestas correctas

17.92

20.40

Fichas por respuesta

281,868

150,507

Coste por respuesta correcta

$0.0302

$0.0174

Una respuesta correcta cuesta aproximadamente un 40 % menos cuando se utiliza GPT-5.6 Luna junto con el «Legal Context Graph». Ambos términos de la relación evolucionaron en la dirección correcta al mismo tiempo, lo que significa que el agente gastó un 34 %menos y respondiómejor, en lugar de que uno de los dos aspectos se viera perjudicado en detrimento del otro. 

Este ratio mideuna variación, que es precisamente la pregunta que se plantea una empresa a la hora de valorar una inversión: partiendo de la situación actual, ¿merece la pena? Lo que no puede indicar es cuál es la situación inicial de la empresa. Por eso, además de la cifra del CVR, siempre tenemos en cuenta la puntuación de calidad: en qué medida el agente ofrece una respuesta completa, calculada como media de todas las preguntas, en una escala del 0 al 100. 

Ambas cifras son absolutamente esenciales, ya que siempre es posible mejorar un precio reduciendo el esfuerzo en lugar de mejorando el rendimiento, y la forma menos costosa de reducir el coste de una respuesta correcta es dejar de intentar resolver las preguntas que resultan difíciles de responder. Consideremos dos sistemas a los que se les plantean las mismas cien preguntas: 

Sistema A

100

80

$10.00

$0.125

Sistema B

40

38

$3.00

$0.079

Las respuestas del Sistema B cuestan un tercio menos cada una, y el Sistema B es aquel que ninguna empresa querría, ya que ha dejado sin responder sesenta preguntas de cada cien. El precio por sí solo no basta para diferenciarlos. 

La misma precaución se aplica a la comparación entre dos sistemas diferentes —o entre distintos conjuntos de documentos—, ya que es más fácil mejorar un precio cuando queda margen en su punto de referencia: un sistema que responde a seis de cada diez preguntas puede obtener mejoras económicas en todos los ámbitos, mientras que uno que ya responde a nueve de cada diez debe realizar un gran desembolso por cada punto restante. La proporción resulta más fiable si se compara con la propia referencia previa de la empresa: los mismos asuntos, las mismas preguntas, con la capa de contexto y sin ella. 

Ese es todo el método. El resultado es el conjunto de cuadros de mando que se muestra a continuación. Analicémoslo en detalle. 

LA TABLA DE RESULTADOS (1 de 3): Modelo económico — GPT-5.6 Luna

Puntuación de calidad

64.00

65.1

+1.1

Respuestas correctas, de un total de 300

191.9

195.3

+3.4

Coste de responder al conjunto completo

$4.35

$2.83

-35%

Fichas por respuesta

208,424

110,001

-47%

Coste por respuesta correcta

$0.0227

$0.0145

-36%

Relación entre contexto y valor

1.57

LA TABLA DE RESULTADOS (2 de 3): Modelo de gama media — GPT-5.6 Terra

Puntuación de calidad

67.4

69.0

+1.6

Respuestas correctas, de un total de 300

202.1

206.9

+4.8

Coste de responder al conjunto completo

$42.40

$23.65

-44%

Fichas por respuesta

181,465

86,431

-52%

Coste por respuesta correcta

$0.2098

$0.1143

-46%

Relación entre contexto y valor

1.84

LA TABLA DE RESULTADOS (3 de 3): Modelo Frontier — GPT-5.6 Sol

Puntuación de calidad

73.9

75.4

+1.5

Respuestas correctas, de un total de 300

221.8

226.2

+4.4

Coste de responder al conjunto completo

$151.10

$80.46

-47%

Fichas por respuesta

270,103

130,447

-52%

Coste por respuesta correcta

$0.6813

$0.3557

-48%

Relación entre contexto y valor

1.92

Lea los tres juntos. Los modelos más potentes ofrecen mejores resultados en términos absolutos, tal y como cabría esperar al ser 10 y 25 veces más caros. Lo que aporta este conjunto es el comportamiento dela capa de contexto en todoese rango:

Calidad, sin el gráfico

64.0

67.4

73.9

La calidad, con el gráfico

65.1

69.0

75.4

Reducción de tokens

-47%

-52%

-52%

Relación entre contexto y valor

1.57

1.84

1.92

  • El índice de valor contextual mejora a medida que aumenta la capacidad del modelo, pasando de 1,57 a 1,84 y a 1,92. Cuanto más potente es el agente, más información extrae del mismo contexto, y no menos. Se trata de un hallazgo importante para el Gráfico de Contexto Jurídico, ya que sugiere que, a medida que los modelos fundacionales mejoran cada vez más, su capacidad para aprovechar bases contextuales bien diseñadas no hace más que aumentar. Esto hace que las inversiones en ingeniería de contexto sean de las que crecen mes a mes. 
  • Sin embargo, las ventajas se concentran en las primeras etapas. El salto de «Economy» a «Mid-tier» supone un aumento de +0,27; el de «Mid-tier» a «Frontier», solo +0,08. Una empresa no necesita el nivel «Frontier» para aprovechar la mayor parte de lo que ofrece la capa de contexto —lo cual es importante, ya que el nivel «Mid-tier» es donde, en realidad, se ejecutará la mayor parte del trabajo de producción—. 
  • El mecanismo es el mismo en todos los casos: menos tokens por respuestas iguales o mejores —una reducción del 47 % en el modelo «economy» y del 52 % en los otros dos—. Una capa de contexto que permite a un agente leer menos para encontrar la misma respuesta correcta genera un ahorro que aumenta en función del coste de cada token. Téngase en cuenta que la reducción de tokens ya ha alcanzado su límite máximo en el nivel intermedio, por lo que la mayor proporción de Sol se debe a un término de calidad ligeramente superior, más que a un mayor recorte. 

Qué valor tienen los ahorros para una empresa

Un indicador como el «Context Value Ratio» resulta útil en teoría, pero lo que realmente importa para los bufetes de abogados y los departamentos jurídicos es cómo ponerlo en práctica: ya sea para mejorar su negocio o para elevar el nivel de la prestación de sus servicios jurídicos. Esta sección aborda precisamente ese tema. 

Pensemos en un gran bufete —2.000 profesionales con acceso a un asistente de IA jurídico— y preguntémonos cuál es el valor que tiene para ellos el «Legal Context Graph» a lo largo de un año. Hay tres configuraciones que influyen en esta cuestión, y las hemos evaluado todas ellas utilizando el modelo de frontera con las mismas 300 preguntas: 

Solo búsqueda y recuperación

medio

$0.5037

73.9

Con el «Gráfico del contexto jurídico»

medio

$0.2682

75.4

Con «The Graph», el nivel de esfuerzo ha aumentado considerablemente

alto

$0.4109

79.3

Las dos primeras filas corresponden al resultado de referencia de la sección 2, expresado por pregunta: la capa de contexto garantiza la calidad y reduce el precio a la mitad. La tercera fila es fundamental para el tema que se aborda en esta sección. Tras haber reducido el coste de una pregunta casi a la mitad mediante el Gráfico de Contexto Jurídico, un despacho no tiene por qué materializar ese ahorro en forma de efectivo. En su lugar, puede «reinvertir» parte de ese ahorro en configuraciones de los agentes que aumenten la precisión: un modelo más grande, un mayor presupuesto de razonamiento o una recuperación más amplia. A efectos de este ejemplo, tomamos la opción más sencilla: aumentar el esfuerzo de razonamiento del modelode «medio» a «alto», lo que permite que el mismo agente reflexione más tiempo sobre cada pregunta, razone con mayor profundidad, verifique más y lea más a fondo. 

Lo que hace que esa mejora sea asequible es la capa de contexto. Aumentar el esfuerzo de razonamiento supone un coste aproximadamente 1,5 veces mayor por pregunta, independientemente de si el Graph está presente o no. Si se aplicara a la línea de base sin asistencia, aumentaría el gasto de la empresa en aproximadamente la mitad. Si se aplica además de un precio por pregunta que ya se ha reducido a la mitad, esa misma mejora supone que la empresa gasteun 18 % menos delo que gasta actualmente. Por lo tanto, la precisión se adquiere con un gasto que la empresa ya tenía presupuestado. 

Por consiguiente, la empresa se enfrenta a una auténtica decisión estratégica, más que a una solicitud de financiación, ya que ninguna de las dos opciones requiere gastar ni un dólar más de lo que gasta actualmente. La primera consiste en ahorrar el dinero obtenido, manteniendo la calidad en el mismo nivel: 73,9 frente a 75,4. La segunda consiste en reinvertirlo: la precisión aumenta de 73,9 a 79,3, mientras que el gasto sigue reduciéndose. La magnitud de cada opción depende de la intensidad con la que la empresa utilice la herramienta, que es la única variable que no podemos proporcionar. A lo largo de 250 días laborables y con 2.000 profesionales: 

1

500,000

$117,700

$46,400

+27,000

2

1,000,000

$235,500

$92,700

+54,000

4

2,000,000

$470,900

$185,500

+108,000

8

4,000,000

$941,900

$370,900

+216,000

A razón de ocho preguntas por persona al día —una cifra realista para un bufete de abogados cuyos profesionales dependen realmente de los agentes como compañeros de trabajo diarios—, el ahorro generado asciende aproximadamente a 940 000 dólares al año, de forma recurrente, por una capacidad que el bufete ya ha desarrollado. Por otra parte, reinvertir esa cantidad reporta 216 000 respuestas correctas adicionales, con lo que el despacho seguiría obteniendo unos 371 000 dólares más al año de lo que obtiene actualmente. 

El segundo de estos aspectos merece una atención especial, ya que invierte la relación habitual. La precisión en los sistemas de IA se consigue normalmente mediante un mayor gasto: un modelo más grande, más razonamiento, más recuperación de información, y cada uno de estos elementos tiene un coste mayor. En este caso, el orden es el contrario. La capa de contexto reduce en primer lugar el coste de una consulta, y la precisión se financia con los ingresos obtenidos, de modo que una empresa termina el año con mayorprecisióny, al mismo tiempo, en una mejor situaciónfinanciera—una combinación que rara vez se da—. 

Además, lo más importante es precisamente en qué punto un punto de referencia se vuelve difícil. A medida que un sistema se acerca al límite máximo de un conjunto de preguntas, las respuestas que quedan pendientes son las más costosas: las conciliaciones entre varios documentos, las preguntas cuya respuesta aparece una vez cada quince millones de caracteres. Esas son precisamente las respuestas que se obtienen con una deliberación más exhaustiva. Una empresa que haya liberado presupuesto puede permitirse gastarlo en esa «cola»; una empresa que no lo haya hecho, no puede. 

Cuando la situación cambia constantemente

Todo lo anterior es una instantánea: congelar la situación, crear el contexto, plantear las preguntas. Ahí es donde se detienen la mayoría de los modelos de referencia, pero esa no es la realidad de la mayoría de los asuntos jurídicos. Los documentos llegan, se revisan, quedan obsoletos, y es necesario crear una capa de contexto y mantenerla posteriormente. 

La primera consecuencia es que el «Context Value Ratio» se entiende mejor como una curva que como una cifra única. El contexto se crea una vez por cada asunto; el valor que genera se acumula una vez por cada pregunta formulada o tarea realizada. Un asunto que se cierre rápidamente, o que un equipo jurídico nunca tenga motivo para examinar, no amortizará la inversión, por muy bien que se haya diseñado el contexto. A medida que aumenta el número de preguntas, el coste de creación amortizado entre ellas se reduce hasta tender a cero y la relación se aproxima a la cifra correspondiente únicamente a las respuestas indicada anteriormente. La cuestión clave es, por tanto,el volumen de agentes de umbral de rentabilidad: el número de preguntas respondidas por los agentes por cada asunto en el que el ratio total —el coste de creación junto con el coste de respuesta— alcanza 1,0. Merece la pena aislar este concepto porque convierte una pregunta a la que un despacho no puede responder —«¿merece la pena la ingeniería de contexto?»— en una a la que sí puede responder: «¿con qué intensidad trabajamos un asunto?». 

Hay tres variables que determinan el volumen de trabajo necesario para alcanzar el umbral de rentabilidad. La primera es el coste de crear la capa de contexto, que depende de la elección del modelo y del volumen de texto procesado. Deliberadamente no publicamos nuestra propia cifra: en nuestros diez casos, esta varió aproximadamente seis veces con los mismos ajustes, ya que lo que la determina son los documentos y no ninguna decisión nuestra, y una cifra única extraída de nuestro corpus y trasladada al de otra empresa resultaría engañosa. Este es el único dato que una empresa debe medir por sí misma. La segunda es el ahorro por pregunta, que es lo que mide el índice de referencia. 

La tercera característica merece un análisis más detallado: las variaciones en las técnicas utilizadas para construir la capa de contexto desde el principio. Algunos enfoques de ingeniería de contexto, por ejemplo, derivan su valor de una estructura que se calcula de tal manera que cada nuevo documento añadido o modificado invalida lo que ya se había construido, y el coste se repite cada vez que se incorpora un documento. Otros enfoques se centran en documentos individuales, de modo que un nuevo documento supone un trabajo proporcional a su propio volumen y deja intacto todo lo ya construido. Al principio, estas tácticas de ingeniería de contexto pueden parecer idénticas y tener el mismo coste; sin embargo, a lo largo de la tramitación de un asunto en el que se reciben documentos semanalmente, divergen notablemente. Una ratio calculada sobre un corpus estático favorece al diseño de reconstrucción, por lo que una firma debería determinar en qué tipo está invirtiendo antes de comparar las cifras generales. 

Hay una cuarta consideración que el resultado de dos niveles anterior pone de relieve. El coste de creación y el coste de respuesta no tienen por qué abonarse en el mismo nivel del modelo. La construcción de un índice a nivel de documento es una tarea limitada y mecánica —leer un documento, describir qué contiene y dónde— y, a menudo, está perfectamente al alcance de un modelo económico. Sin embargo, responder a una pregunta jurídica en el marco de un asunto concreto no suele estarlo. Por lo tanto, un despacho puede crear su capa de contexto con un modelo económico y destinar el ahorro resultante a un modelo mucho más capaz a la hora de responder a las preguntas. 

Esa asimetría tiene un gran impacto en el volumen de actividad de equilibrio, ya que el ahorro por pregunta varía en función del precio del modelo utilizado por el agente que responde, mientras que el coste de elaboración no lo hace. 

EJEMPLO: Cuando la inversión en desarrollo se amortiza por sí sola

Un caso que consta de 200 documentos. La capa de contexto se crea una sola vez mediante un modelo económico, y un agente responde a las preguntas utilizando un modelo de frontera: la distinción descrita anteriormente. 

Documentos relacionados con el asunto

200

Coste de elaborar el índice para este asunto (modelo económico)

$0.80

Ahorro por cada pregunta respondida (modelo «Frontier»)

$0.2355

Volumen de equilibrio, en preguntas

≈ 4

La cifra de construcción es un dato aproximado a título ilustrativo; por la razón expuesta anteriormente, lo que la determina son los documentos. 

Dado que el modelo de respuesta resulta costoso y el modelo de construcción es económico, un tema amortiza su capa de contexto casi de inmediato —y cada pregunta a partir de la cuarta supone un beneficio puro—. Si se formulan cien preguntas sobre ese tema a lo largo de su ciclo de vida, la capa habrá generado unos beneficios que equivalen aproximadamente a treinta veces lo que costó su construcción. 

Si se aplica el mismo cálculo al modelo económico, en el que también se tienen en cuenta las respuestas, el umbral de rentabilidad se sitúa más cerca de las 160 preguntas —lo cual sigue siendo factible en un tema muy trabajado, pero supone un caso de inversión muy diferente—. La diferencia entre esas dos cifras es la clave: es precisamente la combinación de una estructura de bajo coste con respuestas de alto valor lo que, a menudo, hace que la ingeniería de contexto resulte rentable más rápidamente. 

Tenga en cuenta que la versión actual del «Legal Context Engineering Benchmark» no mide la evolución a lo largo del tiempo; sin embargo, ya hemos comenzado a probar ampliaciones de este benchmark que tienen en cuenta conjuntos de asuntos que se desarrollan por etapas, en los que cada documento incluye su fecha real. Esperamos informar sobre este conjunto de datos por separado en los próximos meses. Mientras tanto, la idea general sigue siendo válida: una capa de contexto no es algo que se construya de una sola vez, sino que se va desarrollando con el tiempo para optimizarla en función de lo que valora un bufete de abogados o un departamento jurídico. 

Por qué publicamos este método

Lo que hemos descrito en este informe no es solo el punto de referencia interno que guía la evolución del «Legal Context Graph» de NetDocuments, sino también la metodología en la que se basa dicho punto de referencia —una metodología que esperamos que cualquier departamento jurídico o bufete de abogados pueda aprovechar para evaluar la inversión en la capa de contexto—. 

Para aplicar esta metodología, solo tiene que seguir los pasos que se indican a continuación.

  1. Mantenga sin cambios su modelo y su arnés.
  2. Anote los tipos de preguntas que sus profesionales plantean realmente y pida a una persona cualificada que especifique en qué consiste una respuesta completa.
  3. Modifique una técnica o capacidad de ingeniería de contexto cada vez.
  4. Indique el precio de una respuesta correcta antes y después.
  5. Y lea usted mismo algunas de las respuestas antes de dar por ciertas esas cifras.
  6. Siempre que el presupuesto lo permita, realice la comparación en más de un nivel de modelo: es la forma más económica de averiguar si lo que ha creado es un lastre o un impulsor. 

© 2026 NetDocuments Software, Inc. Todos los derechos reservados. NetDocuments es una marca registrada de NetDocuments Software, Inc. en Estados Unidos y en otras jurisdicciones. El resto de marcas comerciales, marcas de servicio y nombres comerciales son propiedad de sus respectivos titulares. 

Descubra qué importancia tiene el contexto para su empresa

Ejecutaremos el LCEB en sus asuntos, con sus consultas, a través del agente que ya utiliza.