Thomson Reuters creó un modelo de IA jurídica. ¿Qué demuestra?

Thomson Reuters lanzó un modelo propietario para CoCounsel y pesos abiertos para una versión más pequeña. Esto es lo que los compradores pueden verificar y lo que sigue siendo una afirmación del proveedor.

Comparte este artículo

Thomson Reuters ha lanzado Thomson, una familia de modelos lingüísticos entrenados para el trabajo jurídico, fiscal, contable y profesional en otros ámbitos. El primer uso en producción es limitado: Thomson está destinado a impulsar Tabular Analysis, una función de revisión estructurada de documentos en CoCounsel Legal, mientras CoCounsel sigue derivando otros trabajos a modelos externos.

La empresa también ha publicado los pesos de Thomson-1.0-Small. Eso cambia la evidencia disponible para compradores e investigadores porque ahora se puede inspeccionar y probar un miembro de la familia fuera de Thomson Reuters. No valida de forma independiente el modelo propietario más grande, no demuestra que ninguno de los dos modelos ofrezca respuestas jurídicas fiables ni muestra que poseer los datos de entrenamiento baste para que un sistema sea seguro para uso profesional.

Hay dos modelos Thomson en la evidencia

El anuncio del lanzamiento del 24 de agosto describe Thomson como el primer modelo lingüístico grande desarrollado internamente por la empresa. Thomson Reuters dice que partió de una base abierta sólida, invirtió 40 millones de dólares en talento y computación, entrenó con menos del 10 % de sus contenidos y conserva el control sobre el modelo y su funcionamiento. Son divulgaciones de la empresa, no resultados auditados de coste o rendimiento.

El sistema de producción no es simplemente “Thomson sustituye a todos los modelos externos”. Thomson Reuters dice que Tabular Analysis será la primera función de CoCounsel Legal en utilizar Thomson y que el producto sigue siendo multimodelo por diseño. SiliconANGLE informa de que los administradores podrán seleccionar otros modelos y que Thomson Reuters sigue utilizando sistemas de terceros cuando encajan mejor. The New Stack también informa de que CoCounsel continúa utilizando tecnología de Anthropic y que Thomson Reuters no afirma que cada declaración generada pueda rastrearse línea por línea hasta una ley o una resolución.

La empresa también publicó Thomson-1.0-Small en Hugging Face. Su model card describe un modelo de mezcla de expertos con 35.000 millones de parámetros totales y 3.000 millones de parámetros activos, una ventana de contexto nativa de 262.144 tokens y pesos BF16. Un modelo de mezcla de expertos dirige cada entrada solo a través de una parte del conjunto total de parámetros, por lo que las cifras de 35.000 y 3.000 millones describen partes distintas de la misma arquitectura, no dos tamaños de modelo.

El modelo pequeño se basa en Qwen3.6-35B-A3B a través del checkpoint Snowdon-1.1-Small. Sus pesos se publican bajo la licencia PolyForm Strict 1.0.0. Por tanto, “peso abierto” significa que los investigadores pueden descargar e inspeccionar los parámetros; no debe convertirse silenciosamente en la afirmación de que todo uso está permitido o de que los pesos del modelo de producción son públicos.

Capa de evidenciaLo que es público ahoraLo que no establece
Modelo de producción ThomsonAlcance del lanzamiento, resultados seleccionados de benchmarks de modelos grandes, divulgaciones de entrenamiento y costes de la empresa y ubicación prevista en CoCounselPrecisión independiente, tasas de fallo en producción, protección del secreto profesional o paridad con el trabajo de un comprador
Thomson-1.0-SmallPesos descargables, arquitectura, esquema de entrenamiento, tablas de benchmarks, configuración de comparación e informe técnicoEl comportamiento del modelo de producción más grande o del sistema CoCounsel completo
Producto CoCounselPrimer uso previsto en Tabular Analysis y estrategia de enrutamiento multimodelo divulgadaQué modelo gestiona cada tarea, la calidad de cada cita o un uso jurídico seguro sin supervisión

La separación importa porque un benchmark de modelo, un checkpoint de pesos abiertos y un flujo de trabajo de producto son tres objetos distintos. La evidencia sobre uno no se transfiere automáticamente a los otros dos.

Los datos propietarios cambian el proceso de entrenamiento, no la carga de la prueba

La explicación de Thomson Reuters sobre el proceso de desarrollo describe tres grandes etapas. Primero, el equipo realineó la base abierta con un marco de valores publicado. Después utilizó preentrenamiento continuado para añadir material seleccionado de Westlaw, Practical Law, Checkpoint y Reuters, mientras repetía datos generales para reducir el olvido catastrófico —la pérdida de capacidades generales útiles durante la especialización—. El postentrenamiento utilizó preferencias de expertos, rúbricas de dominio y aprendizaje por refuerzo para dar forma al comportamiento y al uso de herramientas.

La model card del modelo pequeño añade una escala útil. Thomson Reuters dice que su corpus de entrenamiento intermedio contenía 200.000 millones de tokens seleccionados de un conjunto de más de 19 billones, dividido aproximadamente entre documentos propietarios, reescrituras sintéticas de esos documentos y datos repetidos para capacidades generales. Informa de 35.207 horas de GPU Nvidia B200 y aproximadamente 1,63 × 10²³ operaciones de coma flotante para el pipeline de desarrollo.

Estos detalles respaldan una conclusión concreta: Thomson Reuters hizo algo más que conectar una herramienta de búsqueda a un modelo general congelado. Cambió los pesos del modelo usando contenido de dominio y señales de entrenamiento generadas por expertos, y después publicó suficiente información del checkpoint más pequeño para hacer posibles las pruebas de terceros.

No demuestran que el contenido propietario sea automáticamente un dato de entrenamiento de alta calidad. Los derechos, la actualidad, la jurisdicción, la duplicación, la coherencia de las anotaciones y la relación entre un ejemplo de entrenamiento y una tarea profesional siguen afectando al resultado. La propiedad del modelo tampoco demuestra por sí sola la confidencialidad. Los datos enviados durante la inferencia, los registros, los sistemas de recuperación, los controles de acceso, la conservación, la respuesta a incidentes y los contratos siguen siendo controles del producto.

Las tablas de benchmarks son informativas y siguen siendo evidencia del proveedor

Thomson Reuters ha divulgado más que una sola puntuación titular. Su publicación de benchmarks de julio compara Thomson-1-Large con Gemini 3.1 Pro, Claude Opus 4.8 y GPT-5.5 en siete categorías jurídicas y generales. Thomson lidera tres filas de la tabla publicada, mientras que otros modelos lideran las cuatro restantes. La publicación también dice que su comparación de investigación profunda con 53 consultas utilizó un arnés de agente interno, fuentes de Thomson Reuters para Thomson, búsquedas en la web abierta para los modelos externos y evaluadores de modelos lingüísticos grandes calibrados frente a expertos en la materia.

Eso es más interpretable que afirmar que un modelo es simplemente “el mejor”, pero la configuración combina el comportamiento del modelo, el acceso a la recuperación, un corpus propietario, un arnés de agente y un pipeline de evaluación. La comparación puede respaldar una afirmación sobre un sistema de producto en esas condiciones. No puede aislar cuánto del resultado procede del modelo base, el entrenamiento continuado, el acceso a las fuentes, los prompts, las herramientas o la calificación.

El modelo pequeño publicado aporta un segundo conjunto de resultados ejecutados por el proveedor. Su model card informa de una media no ponderada de 74,6 en los benchmarks enumerados, frente a 71,7 tanto para Snowdon-1.1-Small como para la base Qwen3.6. Los resultados por fila son mixtos: Thomson-1.0-Small mejora sustancialmente respecto a su base en las medidas de “Human Queries” e investigación profunda de la model card, pero Gemma 4-31B lidera varias pruebas jurídicas enumeradas, como Stanford LegalBench y comprensión de contratos. En los benchmarks generales, la base de Thomson o un comparador también gana en varias filas.

Los resultados mixtos no son una vergüenza que haya que ocultar. Son evidencia de que la especialización tiene una forma concreta. La pregunta útil es qué tareas mejoraron con qué arnés, no si un promedio convierte un modelo de dominio en un abogado universalmente más seguro.

Afirmación del proveedorEvidencia disponibleEvidencia aún necesaria para una decisión de despliegue
Thomson es competitivo con los modelos de fronteraModelos de comparación nombrados, resultados por fila, algunos ajustes de razonamiento y un enfoque de evaluación descritoRepeticiones independientes, intervalos de confianza, análisis de contaminación, prompts completos, coste y latencia en condiciones comparables
El entrenamiento de dominio mejora el trabajo profesionalComparaciones del modelo pequeño con su base, además de pruebas de investigación profunda y consultas a expertos de la empresaAsuntos representativos de compradores, cobertura jurisdiccional, evaluación profesional ciega, taxonomía de fallos y resultados reproducibles por tarea
Las citas hacen que las salidas sean más fiablesLa métrica de factualidad de la empresa comprueba si las fuentes citadas respaldan las afirmaciones extraídasPruebas de autoridad ausente, afirmaciones incorrectas pero respaldadas, integridad de las citas, actualidad de las fuentes y tiempo de verificación humana
La propiedad mejora el control y la economíaPropiedad del modelo divulgada, inversión del programa de 40 millones de dólares, pesos pequeños publicados y enrutamiento de producto multimodeloCoste total de propiedad, mediciones de servicio, evidencia de control de cambios, documentación del flujo de datos y garantías contractuales

El explicador de evaluación de IA de AI News ofrece una base útil: identificar la tarea, los datos, el evaluador y su correspondencia con las condiciones operativas reales antes de tratar una puntuación como una conclusión sobre el producto.

La fiabilidad profesional pertenece al sistema completo

El trabajo jurídico eleva el coste de un error aparentemente plausible, pero añadir textos jurídicos durante el entrenamiento no elimina ese modo de error. Una fuente puede respaldar una afirmación mientras la conclusión general omite una autoridad vinculante. Una regla correcta puede aplicarse a la jurisdicción o fecha equivocadas. Un modelo de revisión documental puede extraer texto con precisión mientras el flujo de trabajo que lo rodea expone material protegido por el secreto profesional al usuario equivocado.

La propia Thomson Reuters marca este límite. The New Stack informa de la posición de la empresa de que ningún modelo de IA, incluido Thomson, garantiza estar libre de errores y que la verificación final sigue correspondiendo al profesional. SiliconANGLE dice que los primeros resultados no han recibido una validación independiente extensa. Estas cautelas contrastan —aunque de forma útil— con la marca “Fiduciary-Grade” de la empresa: el estándar es una ambición y una afirmación de producto, no una certificación creada por la tabla de benchmarks.

Para un comprador, el paquete de aceptación debe conectar por tanto el modelo exacto con el flujo de trabajo exacto:

  1. Versión y ruta: registrar la revisión del modelo, las fuentes de recuperación, las herramientas, el prompt o la política del agente y las circunstancias que envían una tarea a Thomson o a otro modelo.
  2. Trabajo representativo: probar asuntos congelados o casos sintéticos realistas en las jurisdicciones, tipos de documentos, idiomas y plazos a los que el sistema se enfrentará realmente.
  3. Comprobaciones de autoridad y citas: medir si cada proposición importante está respaldada, si falta una autoridad contraria o vinculante y cuánto tarda una revisión cualificada.
  4. Límites de los datos: documentar por dónde circulan los prompts, documentos subidos, fuentes recuperadas, registros y comentarios; quién puede acceder a ellos; cuánto tiempo se conservan; y si alguna ruta se usa para entrenar.
  5. Fallo y recuperación: registrar abstenciones, respuestas sin respaldo, fallos de herramientas, errores de enrutamiento, anulaciones del revisor, gestión de incidentes y un fallback probado cuando la ruta preferida no está disponible.
  6. Revisión independiente: exigir que una persona cualificada, con suficiente evidencia, tiempo y autoridad, rechace la salida antes de que afecte a un cliente o asunto.

El último control necesita algo más que un botón de aprobación. La guía de AI News sobre la revisión humana significativa (en español) muestra cómo el acceso a la evidencia, la autoridad para anular, los motivos registrados y una vía de apelación convierten a un revisor nominal en una salvaguarda operativa. Este artículo es un análisis técnico y de producto, no asesoramiento jurídico; las obligaciones profesionales y las reglas del secreto profesional dependen de la jurisdicción y del uso.

Los pesos abiertos crean la próxima prueba real

Thomson-1.0-Small ofrece a los investigadores externos algo que el lanzamiento no ofrecía: un checkpoint que pueden ejecutar con nuevos prompts, evaluadores, idiomas, jurisdicciones y pruebas de fallos. Su licencia restrictiva y su menor escala hacen que no sea un sustituto completo del modelo de producción, pero los resultados independientes ya pueden comprobar si la especialización comunicada se mantiene fuera del arnés de la empresa.

Las próximas divulgaciones más informativas conectarían esas repeticiones del modelo pequeño con el sistema grande: un informe técnico completo del modelo de producción, coste y latencia comparables, incertidumbre por tarea, fallos de cobertura de fuentes, evaluación profesional externa y evidencia de Tabular Analysis después de su lanzamiento. Hasta entonces, Thomson es una demostración creíble del desarrollo de un modelo de dominio y un objeto prometedor de evaluación, no una prueba de que los datos propietarios hayan resuelto la fiabilidad de la IA jurídica.

Fuentes

  1. Thomson Reuters launch announcement for Thomson
  2. Thomson-1.0-Small model card and benchmark disclosures
  3. Thomson Reuters account of how Thomson was built
  4. Thomson Reuters early benchmark disclosure for Thomson-1-Large
  5. The New Stack reports on Thomson and continued Anthropic use
  6. SiliconANGLE reports on Thomson deployment and validation limits