El JSON fiable de un LLM local requiere una decodificación restringida consciente del esquema, además de validación semántica; solo con indicaciones no se pueden garantizar campos analizables ni correctos.
Un agente doméstico puede necesitar una llamada a una herramienta con un ID de dispositivo exacto, una enumeración, un número y un objeto de argumentos anidado. Una comilla ausente rompe el análisis, mientras que un JSON perfectamente válido aún puede seleccionar el dispositivo equivocado. Por tanto, la fiabilidad tiene dos capas: el decodificador debe imponer la sintaxis permitida y la aplicación debe validar si los valores completados satisfacen la operación real.
Un esquema define más que llaves
El modo JSON puede restringir la salida a JSON válido, pero un esquema JSON también describe las claves obligatorias, los tipos, las enumeraciones, el anidamiento, los rangos y si se permiten propiedades adicionales. Los nombres y las descripciones claras de los campos ayudan al modelo a elegir el contenido antes de aplicar las restricciones estructurales.
Un amplio referente de esquemas JSON evalúa decodificadores restringidos en diez mil esquemas del mundo real y separa el cumplimiento, la cobertura, la eficiencia y la calidad de salida. Esta separación muestra por qué un único porcentaje de «JSON válido» no puede describir la fiabilidad práctica. Esta distinción sigue siendo visible durante las pruebas domésticas posteriores.
La plantilla de chat del modelo y el formato de llamada a herramientas deben coincidir con el entorno de ejecución. Una palabra clave de esquema no compatible o una discrepancia del tokenizador pueden debilitar la aplicación de restricciones, mientras que los esquemas profundamente recursivos o ambiguos pueden aumentar la latencia y los errores de contenido aunque la sintaxis siga siendo válida.
La decodificación restringida por gramática bloquea los tokens siguientes no válidos
En cada paso de generación, un motor de gramática realiza un seguimiento del estado válido del analizador y enmascara los tokens que infringirían el esquema. El modelo elige únicamente entre continuaciones permitidas, lo que evita delimitadores ausentes, claves imposibles o texto libre fuera de la estructura solicitada.
La decodificación restringida por gramática acelera la ejecución de gramáticas independientes del contexto mediante tokens previamente comprobados, un estado persistente del analizador y la integración con el motor de inferencia. El trabajo demuestra que se pueden aplicar restricciones estructurales sólidas con una sobrecarga reducida en el servicio local. El resultado intermedio debe seguir siendo inspeccionable antes de que la automatización continúe.
Las restricciones garantizan la pertenencia al lenguaje descrito por la gramática, pero no que el valor seleccionado sea verdadero. Si «desbloquear» y «bloquear» son valores de enumeración válidos, la gramática no puede determinar cuál refleja la intención del usuario.
La validación y la reparación protegen el significado después del análisis
Después del análisis, los validadores deterministas deben comprobar identificadores, unidades, rangos, reglas entre campos, permisos y referencias al estado actual. Una reparación acotada puede recibir los errores de validación y regenerar únicamente el objeto no válido, en lugar de permitir que los datos malformados sigan su curso.
El enfoque de reparación de salidas estructuradas utiliza un modelo ligero de posprocesamiento y evalúa tanto la precisión del esquema como la fidelidad del contenido. Ilustra una alternativa o complemento cuando el modelo local principal no ofrece compatibilidad nativa completa con las restricciones. Este límite debe medirse por separado en condiciones operativas realistas.
El límite de fallo es una salida semánticamente peligrosa pero sintácticamente válida. Las llamadas a herramientas de alto riesgo necesitan una resolución del objetivo y una aprobación fuera del modelo, y las reparaciones repetidas deben detenerse después de un presupuesto reducido en lugar de cambiar silenciosamente la intención hasta que la validación se complete.
Construye una matriz de pruebas de fiabilidad del esquema
Crea esquemas que cubran campos obligatorios, enumeraciones, matrices anidadas, valores anulables, límites numéricos, Unicode, texto escapado y claves adicionales prohibidas. Ejecuta indicaciones representativas y adversarias con la temperatura, la longitud de contexto, la cuantización del modelo y la concurrencia previstas. La consecuencia práctica aparece cuando varias fuentes compiten por un contexto limitado.
Relaciona los resultados con el cambio hacia las llamadas estructuradas a herramientas en llamadas estructuradas a herramientas. Cuenta por separado el éxito del análisis, el cumplimiento del esquema, la validez semántica, los intentos de reparación, la latencia y las selecciones de objetivos inseguras; no los combines en una única tasa de éxito. Esta dependencia debe seguir siendo explícita en la interfaz final.
Implementa únicamente las funciones del esquema que el entorno de ejecución admita realmente y rechaza los objetos que no superen las comprobaciones deterministas. Si la sintaxis alcanza el cien por cien mientras persisten los errores semánticos, mejora las definiciones de los campos y la validación externa en lugar de afirmar que la canalización JSON es fiable.
Centro de Tecnología e IA
Más para leer

¿Qué factores determinan la precisión de las citas de RAG en una base de conocimientos doméstica?
Descubre por qué una fuente relevante aún puede ser una cita incorrecta, qué etapas de la canalización controlan la fundamentación y la cobertura, y...

Linaje de datos de IA local: por qué cada respuesta necesita una ruta de origen trazable
Aprende cómo las rutas de origen hacen auditables las respuestas de IA local, por qué las citas por sí solas son incompletas y cómo...

Indexación mediante hash de contenido: cómo las huellas digitales de los archivos evitan trabajo redundante de la IA
Descubre cómo las huellas digitales de archivos y fragmentos impulsan la indexación incremental, por qué los metadatos son insuficientes y en qué casos los...

