EN
← Volver al Portafolio
Machine Learning Científico septiembre de 2026

Enunciado, Qué Tan Fielmente los Modelos de Lenguaje Convierten un Enunciado en un Modelo Resoluble

El campo reporta si el modelo generado corrió y a eso lo llama correcto. Enunciado mide fidelidad en su lugar: un corpus de 20 enunciados de optimización redactados a mano en cinco niveles de complejidad, con cada trampa cubierta y cuatro controles sin trampa, se entrega a modelos de lenguaje, y el modelo formal que cada uno devuelve lo juzga un oráculo que no es un modelo de lenguaje: capas ejecutable, estructural y de propiedades sobre un solver, con un certificado de dualidad. Dieciséis modelos de cuatro proveedores, 320 llamadas, todas las filas completas. El mejor modelo local, phi4, es fiel en 5 de 20. El tope de salida decide a los modelos de razonamiento: DeepSeek-V4-Pro es fiel en 2 de 20 con 8192 tokens y en 11 de 20 con 32768. La primera versión de esta medición marcaba +0,000 y estaba equivocada.

Corpus
20 enunciados de optimización redactados a mano, 4 por nivel en 5 niveles de complejidad, cada trampa cubierta, 4 controles sin trampa; el horneado verifica que cada referencia resuelve, que cada óptimo declarado coincide con el solver y que cada relación de propiedades se cumple
Medición
16 modelos de 4 proveedores (Anthropic, Z.AI, DeepSeek, 11 modelos de pesos abiertos a través de Ollama en una sola GPU de laptop de 8 GB), 320 llamadas, todas las filas completas, un libro de 640 registros
Los tres repositorios
planteo (la representación) y copela (el arnés: costura de proveedor, libro de solo anexar, cuatro capas de veredicto, guarda de presupuesto), ambos publicados en PyPI desde sus propios repositorios; Enunciado no declara paquete
Defectos atrapados por compuertas, no por revisión
10, incluidos 3 óptimos declarados equivocados, un envoltorio de solver lanzando excepción en el caso infactible, dos barridos entrelazados en un libro, un +0,000 que quería decir sin medición; y 4 veces una compuerta se atrapó a sí misma
Banco de trabajo
14 métodos en 4 grupos, una pestaña de Dualidad como certificado de optimalidad en cuatro partes, matrices de modelos, una tabla de sensibilidad al tope, advertencias calculadas desde el libro; 207 chequeos de navegador pasan contra el origen en producción en 0.08.000 en oscuro, claro y español, con el pase en español recorriendo cada pestaña y fallando ante palabras sin acento; la wiki lleva 17 figuras exportadas desde los mismos componentes
No construido, no afirmado
Las otras tres familias objetivo, los cuatro manuscritos (uno registrado como pendiente) y cualquier medición de modelos de frontera más allá de los dieciséis
Diagrama de arquitectura de Enunciado, Qué Tan Fielmente los Modelos de Lenguaje Convierten un Enunciado en un Modelo Resoluble
#formalization #optimization #autoformalization #llm-evaluation #benchmark #pyomo #solvers #ollama #reproducible-research

Contexto de Negocio

Cualquiera que entregue una optimización, una simulación o un diseño de experimento a un modelo de lenguaje necesita saber con qué frecuencia el modelo devuelto es el problema que planteó, y no solo un modelo que resuelve. Enunciado da ese número por modelo, por nivel y por trampa, con las advertencias unidas al mismo libro de registro, para que un equipo pueda elegir un modelo para una tarea de formalización por fidelidad medida y no por una tabla de posiciones que puntuó compilación. También muestra qué mueve el número: el tope de salida decide a los modelos de razonamiento, la vía local desplaza en silencio su contexto por defecto, y una refutación metamórfica puede ser un candidato no acotado mal leído por tres capas, cada uno un hallazgo registrado y no una nota al pie.

Valor Estratégico

El producto es el primer adoptante de un arquetipo de medición de narrativa a formal, y su registro de lo que atraparon las compuertas es su argumento más fuerte. Diez defectos fueron atrapados por compuertas y no por revisión: tres óptimos declarados equivocados; un envoltorio de solver que lanzaba una excepción en el caso deliberadamente infactible en lugar de reportar infactibilidad; dos barridos que compartían un libro y entrelazaban registros de versiones de código distintas; un reporte que imprimía una brecha de +0,000 cuando quería decir sin medición; nombres de proveedores encontrados en la CLI por la prueba de la costura; un enlace profundo que respondía 404 mientras renderizaba correctamente. Cuatro veces una compuerta se atrapó a sí misma: la guarda del documento de diseño leyó una referencia cruzada en prosa como un requisito duplicado, la compuerta de UI aprobó su chequeo de artefactos cargados mientras la página mostraba un error del router, su cambio de tema escribía una clave que nada lee así que ambas pasadas corrieron en un tema, y su servidor de pruebas modelaba mal el host de dos formas distintas. Ambas brechas de Claude de +0,050 descansan en una sola refutación cada una que cae exactamente en el óptimo entero de la referencia en un enunciado que nunca fija integralidad; leídas como permitidas son 0,000, la página lo dice, y la definición es una decisión registrada. Las otras familias objetivo (modelado matemático y de simulación, diseño de experimentos, encuadre de aprendizaje automático), los manuscritos y cualquier medición de un modelo de frontera más allá de los dieciséis no están construidos y no se afirman. El release 0.08.000 puso las seis páginas en el orden del estándar con App primero, dividió la Comparativa en seis pestañas y escribió la superficie en español con sus acentos, 1.813 palabras decididas en contexto.

El Desafío

Enunciado es la palabra para el planteamiento de un problema: el texto tal como se entrega, antes de que alguien decida cuáles son las variables. Convertirlo en un modelo formal y resoluble es el paso que las evaluaciones publicadas se saltan. Cuatro literaturas separadas reportan que el artefacto corrió y a eso lo llaman correcto, y cada una, leída de cerca, admite que la fidelidad medida es menor: en modelado de optimización, alcanzar el objetivo de referencia no implica un modelo correcto (arXiv:2508.10047); en formalización de enunciados hay una brecha de 3,0 a 29,0 puntos entre compilar y ser fiel, con el agente más fuerte compilando el 89,5 por ciento de las veces y siendo fiel el 60,5 (arXiv:2606.31002); en diseño de experimentos todo modelo es débil en datasets, líneas base y métricas (arXiv:2608.03501); en modelado de simulación el modelo corre pero el razonamiento causal es débil y ningún modelo domina (arXiv:2605.28994). Un artículo de posición de 2025 sostiene que es un solo problema y no entrega nada de la maquinaria (arXiv:2509.09810). Los benchmarks de la comunidad no sirven: cargan tasas de error de 8,13 a 54,0 por ciento, dos de los más citados no pueden redistribuirse por licencia, y la familia vecina de aprendizaje automático está contaminada.

Nuestro Enfoque

Tres repositorios, un producto. planteo (su propio repositorio, en PyPI) es la representación: dimensiones en cada cantidad, procedencia en cada elemento y un registro de lo que el enunciado dejó abierto. copela (su propio repositorio, en PyPI) es el arnés: una costura de proveedor, un libro de registro de solo anexar, cuatro capas de veredicto y una guarda de presupuesto que se niega a llamar a un modelo sin un presupuesto declarado. Enunciado es el producto y no declara paquete: el corpus, el horneado, la medición y la superficie web. El corpus son 20 casos redactados a mano, cuatro por nivel en cinco niveles de complejidad, con cada trampa cubierta y cuatro controles sin trampa, escritos en lugar de importados por las razones anteriores. El horneado verifica que cada referencia resuelve, que cada óptimo declarado coincide con el solver y que cada relación de propiedades se cumple en la referencia; atrapó tres óptimos declarados equivocados de veinte. La medición llama a dieciséis modelos de cuatro proveedores (Anthropic, Z.AI, DeepSeek y once modelos de pesos abiertos a través de Ollama en una sola GPU de laptop de 8 GB), 320 llamadas con todas las filas completas en un libro de 640 registros, y puntúa cada respuesta a través de las capas ejecutable, estructural y de propiedades con una sola taxonomía de fallas igual a la del clasificador. El banco de trabajo muestra catorce métodos en cuatro grupos, una pestaña de Dualidad que es un certificado de optimalidad en cuatro partes, una barra lateral que diagnostica el caso seleccionado desde el libro, matrices de modelos, una tabla de sensibilidad al tope y advertencias calculadas desde el libro en lugar de escritas.

Indicadores Clave de Rendimiento

KPILínea BaseResultadoImpacto
Fidelidad, no compilaciónLas evaluaciones publicadas puntúan si el modelo corrióCapas ejecutable, estructural y de propiedades sobre un solver, con un certificado de dualidad en cuatro partes; el mejor modelo local, phi4, es fiel en 5 de 20 casosUn modelo se elige por lo que acertó, no por lo que devolvió
El tope decide a los modelos de razonamientoUn solo número por modeloDeepSeek-V4-Pro es fiel en 2 de 20 con un tope de salida de 8192 tokens y en 11 de 20 con 32768; se publican la tabla de sensibilidad al tope y los conteos al topeUn ranking sin su tope no es un resultado
Una medición que se corrigió a sí mismaEl primer reporte marcaba una brecha de +0,000Quería decir sin medición; el reporte ahora distingue ambas cosas, y el release 0.07.001 volvió a derivar reporte, intentos y repuntuación después de que CI encontró que los artefactos cubrían 551 llamadas contra un libro de 640 registrosCada tasa del sitio se recuenta desde el libro versionado en CI

Arquitectura

enunciado pipeline

enunciado pipeline

Stack Tecnológico

Python planteo copela Pyomo Ollama TypeScript React Vite KaTeX

Capturas de la Aplicación

Enunciado, Qué Tan Fielmente los Modelos de Lenguaje Convierten un Enunciado en un Modelo Resoluble
Enunciado, Qué Tan Fielmente los Modelos de Lenguaje Convierten un Enunciado en un Modelo Resoluble