Un científico pasa semanas construyendo una versión más rápida y capaz de un algoritmo de búsqueda de vacíos, uno que procesa sondeos cien veces más grandes que su predecesor. Un agente de programación de IA reescribe la lógica central. Se generan los gráficos, se redacta el comentario, se verifica el razonamiento en cada paso. Luego, diez minutos después de la presentación, un colaborador señala el esquema de gestión de bordes. El suelo se desploma. El código es rápido, hermoso y está mal. Todo lo derivado de él también está mal. El científico acaba de presentar un absurdo a una sala llena de colegas, con total confianza.
Esta no es una historia aleccionadora sobre que la IA no sirve para nada. Es algo más preciso e instructivo que eso.
La fluidez que se siente como comprensión
Los LLM no razonan de la misma manera que los humanos. En su esencia, son sofisticados predictores de la siguiente palabra. La razón por la tienen razón la mayoría de las veces es, como señala el científico detrás de VIDE, una razón aburrida: las afirmaciones verdaderas aparecen con más frecuencia en el texto escrito por humanos en el que se entrenan estos modelos, por lo que una afirmación verdadera es estadísticamente la mejor predicción. La corrección es un efecto secundario, no un objetivo.
La fluidez no es un efecto secundario. Fue diseñada deliberadamente. Los predictores en bruto son desagradables para interactuar con ellos, por lo que los desarrolladores los refinaron mostrando a las personas diferentes formas de respuestas y ajustando el modelo hacia las respuestas que las personas preferían. Lo que las personas preferían, de manera constante, eran respuestas claras, organizadas y directas. Se premiaba la confianza. Las dudas no.
El resultado es un sistema que suena autoritario tanto si tiene razón como si se equivoca. Un humano que tiene confianza pero se equivoca arriesga su trabajo, su reputación, su propio respeto. Una máquina no tiene ninguna de esas apuestas. La fluidez es un rasgo que se cultivó, de la misma manera que los lobos se convirtieron en perros que miran los rostros humanos. Sirve a la interacción. No sirve a la verdad.
Esto es lo que la mayor parte de la cobertura sobre los errores de la IA pasa por alto. El problema no es que el modelo cometa errores de vez en cuando. El problema es que sus errores llegan exactamente en el mismo registro que sus respuestas correctas. No hay ninguna señal. Nada parece dudoso. El científico describe semanas de trabajo sin ni una sola chispa de duda, y esa ausencia de duda es precisamente lo que el sistema fue optimizado para producir.
El método del alquimista como marco práctico
El científico establece una comparación que va más allá de lo metafórico. Los alquimistas trabajaron durante más de mil años con sustancias volátiles que no entendían, careciendo de cualquier conocimiento sobre átomos, moléculas o mecánica cuántica. Nunca encontraron la piedra filosofal. Pero descubrieron el fósforo, recrearon la porcelana, aislaron el alcohol y construyeron aparatos de laboratorio que todavía se usan hoy en día. Sus palabras sobreviven en el idioma: crisol, alcohol, gas.
Lograron esto a través del método. La ignorancia de sus materiales se encontró con un compromiso casi fanático con el proceso: documentación rigurosa, control estricto, verificación en cada paso. El trabajo tenía que mantenerse anclado, o se evaporaba en una ilusión.
El paralelo con la IA es directo. Los desarrolladores saben cómo se construyeron estos modelos, porque escribieron el código. Lo que no pueden explicar, en la mayoría de los casos, es el porqué: por qué esta palabra y no otra, por qué este camino en particular a través de la máquina. El crisol está cerrado. Y al igual que los alquimistas, las personas que usan estas herramientas no van a parar.
El marco alquímico ofrece tres principios. El primero es el anclaje: cualquier resultado que no pueda verificarse frente al mundo no tiene valor, independientemente de lo bien organizado que suene. Las salvaguardas actuales, una advertencia en la parte inferior de una ventana de chat, un filtro de toxicidad, no constituyen un anclaje. La verificación sí. El segundo principio es la procedencia: nada en el recipiente del alquimista era un evento privado. Todo fue registrado. La fuente de cada afirmación importa, y rastrearla no es opcional.
Por qué esto importa más allá del mal día de un científico
Cientos de millones de personas recurren a estas herramientas todos los días. El científico es explícito al respecto y también es explícito en cuanto a que esas personas no son idiotas. La aceleración es real. La utilidad es real. El científico no ha escrito una línea de código desde enero, después de escribir código desde los cinco años. Las tareas de investigación que antes requerían semanas de lectura y búsqueda de citas ahora ocurren a través de agentes de IA. Estos son, en el propio marco del científico, intercambios correctos.
Pero la volatilidad también es real. Las herramientas están sintonizadas para complacer. Ese ajuste no se apaga cuando el resultado es incorrecto.
El problema más profundo es estructural. Los sistemas de IA están ahora integrados en flujos de trabajo profesionales en medicina, derecho, ingeniería e investigación. En cada uno de esos dominios, las respuestas incorrectas que suenan seguras conllevan consecuencias que se extienden mucho más allá de una presentación embarazosa. La cuestión de cómo implementar una herramienta que a veces se equivoca pero siempre complace no es una cuestión técnica. Es una cuestión sobre el proceso, sobre quién verifica qué y sobre lo que cuenta como verificación suficiente antes de que un resultado sea compartido o se actúe en consecuencia.
Los alquimistas no tenían más remedio que desarrollar disciplina en torno a un proceso que no podían ver por completo. Esa disciplina es lo que hizo que su trabajo fuera productivo en lugar de meramente teatral. La misma disciplina se le exige ahora a cualquiera que use la IA en un contexto donde equivocarse tiene costes.
En resumen
La fluidez de la IA es diseñada, no emergente. Un sistema optimizado para producir respuestas claras y seguras las producirá, ya sea que el contenido subyacente sea correcto o no. La experiencia del científico con VIDE ilustra lo que sucede cuando esa fluidez se confunde con la comprensión: semanas de trabajo, una sala llena de colegas y un resultado fundamentalmente roto que se sentía como dominio. Los alquimistas construyeron ciencia real a partir de procesos que no podían explicar mediante el compromiso con una verificación y documentación rigurosas. Ese es el modelo. La aceleración es un beneficio genuino. La aceleración no verificada es oro de tontos.
Basado en información de Nautilus.