ROC-AUC de 0,97, precisión del 9 %: la matemática de la tasa base
Trabaja con un detector con un 1 % de positivos, convierte los umbrales en puntos ROC y de precisión-recall, y elige un punto operativo para un presupuesto de revisión de 30 alertas.
Etiqueta
9artículoscon esta etiqueta.
Trabaja con un detector con un 1 % de positivos, convierte los umbrales en puntos ROC y de precisión-recall, y elige un punto operativo para un presupuesto de revisión de 30 alertas.
OpenAI y AWS informan de que GPT-5.6 Terra completó tareas exitosas de Terminal-Bench en Kiro con un coste aproximadamente un 82 % menor, pero el trabajo en repositorios añade revisión y reparación.
Lea el Risk Report de Anthropic de agosto de 2026 separando su fecha de cobertura, las calificaciones de la empresa, los fallos divulgados, las redacciones y la revisión externa.
Visual Studio 18.10 Insiders puede conectar modelos locales y alojados al modo Agent, pero una prueba práctica muestra que la disponibilidad del endpoint no implica un trabajo de programación fiable.
Thomson Reuters lanzó un modelo propietario para CoCounsel y pesos abiertos para una versión más pequeña. Esto es lo que los compradores pueden verificar y lo que sigue siendo una afirmación del proveedor.
Hugging Face ha superado los tres millones de modelos, pero los likes y las descargas revelan atención, no adecuación de licencia, procedencia, coste de hardware o calidad para la tarea.
Los precios de Gemini 3.7 Flash subirán en enero de 2027, mientras que el nivel de razonamiento más barato sigue dependiendo de la aceptación, los reintentos, la latencia y el coste alternativo.
DeepSeek ha añadido entradas de imagen a su línea de API rápida, pero la vista previa aún no demuestra un rendimiento fiable en capturas de pantalla, gráficos y documentos.
Grok 4.6 combina un precio anunciado bajo con benchmarks publicados sólidos, pero los reintentos, las tareas fallidas, la latencia y los cargos de herramientas pueden invertir la ventaja aparente.