Informática
Un lenguaje que no afecta a tu manera de pensar sobre la programación no merece la pena conocerlo.
— (1982)
Desarrolladores experimentados se sentían más rápidos con IA mientras trabajaban de forma medible más lenta — el hallazgo real, y el veredicto sobre programar con IA que no es
Un ensayo aleatorizado controlado de METR hizo que dieciséis desarrolladores open source experimentados completaran 246 tareas reales en bases de código que conocían bien, con herramientas de IA de comienzos de 2025 (Cursor Pro más Claude 3.5/3.7 Sonnet) permitidas en una mitad asignada al azar. Esperaban que la IA redujera el tiempo por tarea en torno a un 24 %; en cambio, lo aumentó en un 19 % — y después seguían creyendo que los había acelerado en torno a un 20 %. Esa brecha de percepción es el núcleo nítido y robusto del estudio. Pero son dieciséis desarrolladores, un entorno estrecho y una instantánea fija de comienzos de 2025: los autores son explícitos en que no muestra que la IA no ayude a la mayoría de los desarrolladores, y su propio seguimiento de 2026 ya apunta hacia una aceleración, con sus propias reservas.
Una prueba criptográfica puede ocultar su secreto haciendo difícil probar el simulador que falta
Las pruebas de conocimiento cero permiten demostrar una afirmación sin revelar el testigo. La teoría clásica dice que no se puede tener eso, en sentido pleno, con un solo mensaje, sin configuración confiable y con solidez perfecta. El artículo de Rahul Ilango no hace desaparecer esa imposibilidad. Cambia el objetivo: en lugar de exigir que un simulador exista realmente, pide que ningún sistema de prueba elegido pueda probar eficientemente que el simulador no existe. Bajo grandes hipótesis de complejidad de pruebas y criptografía, eso basta para recuperar consecuencias falsificables, basadas en juegos, del conocimiento cero propiedad por propiedad. El punto no es una primitiva de internet lista para enchufar. Es una forma, desde la teoría de la prueba, de convertir la indemostrabilidad matemática en cobertura criptográfica.
Una IA medica puede ser privada en promedio y aun asi exponer a pacientes concretos, sobre todo a los subrepresentados
Un modelo de IA medica llamado preservador de privacidad suele apoyarse en un numero promedio. Este estudio argumenta que ese es el test equivocado. Al estudiar ataques de inferencia de pertenencia - que revelan si el registro de una persona concreta estuvo en los datos de entrenamiento de un modelo y por tanto pueden delatar que tuvo cierta enfermedad -, los autores midieron el riesgo por paciente y no en agregado, en siete conjuntos de datos medicos y muchos modelos. El patron: modelos que parecen seguros en promedio aun pueden permitir identificar a individuos concretos casi perfectamente (AUC de ataque >= 0,95); los expuestos pertenecen sistematicamente a grupos subrepresentados; y empeora a medida que crecen los modelos. No dicen abandonar la IA medica: dicen medir la privacidad por paciente, controlar el acceso al modelo y usar privacidad diferencial.
Enseñar a una IA de dibujo a mirar la página
Los modelos de lenguaje que generan gráficos vectoriales lo hacen a ciegas: escriben los comandos de dibujo sin ver nunca el resultado. Un nuevo método deja que el modelo observe cómo se llena su propio lienzo, trazo a trazo, y el giro honesto es que darle ojos sin más empeora las cosas: hay que reentrenarlo para usarlos. El resultado es un modelo que iguala o supera ligeramente a rivales entrenados con hasta veinte veces más datos: un resultado real y cuidadoso en un benchmark, no una revolución.
Un agente de IA trabajo casos completos de pacientes por su cuenta: en un simulador, con historiales pasados
MIRA es un nuevo tipo de IA medica: en vez de responder una sola pregunta, trabaja un caso entero dentro de un historial hospitalario simulado: toma la historia, pide y lee pruebas, llega a un diagnostico y redacta las ordenes. En 574 casos retrospectivos de una base publica, con ocho diagnosticos preseleccionados, los autores informan que supero a medicos en precision diagnostica y tomo decisiones en gran parte acordes con guias y seguras en medicacion. Cada calificativo importa: fue un sandbox con historiales pasados, solo texto; gran parte de la ventaja vino de condiciones con pruebas claras; pidio unas dos veces mas analisis de sangre que los medicos; y varios resultados se puntuaron contra lo registrado en la historia original. El avance real es un agente que actua a traves de todo el flujo de trabajo, no una prueba de que una maquina diagnostique mejor que un medico.
Funcionan mejor los grandes modelos de fundacion para robots? Una respuesta cuidadosa: modestamente si, y la mayoria de estudios no puede saberlo
Toyota Research Institute entreno large behavior models: politicas roboticas preentrenadas con unas 1.700 horas de datos diversos de manipulacion, y las comparo con politicas de una sola tarea entrenadas desde cero usando un protocolo inusualmente riguroso: ensayos ciegos, aleatorizados, con muestras grandes (unas 1.800 pruebas reales y mas de 47.000 simuladas) y estadistica real. Tras el ajuste fino por tarea, los modelos grandes rindieron mejor en promedio, necesitaron alrededor de 3 a 5 veces menos datos especificos y fueron mas robustos cuando cambiaban las condiciones; el rendimiento subia suavemente con mas datos de preentrenamiento. Pero sin ajuste fino no superaron de forma consistente a los modelos monotarea, varios efectos eran tan pequenos que requerian muestras grandes, y una decision mundana de normalizacion importaba mas que la arquitectura. Apoya de forma medida la direccion de los robot foundation models: no un robot general, no un generalista zero-shot, no un salto emergente.
Por qué los modelos de lenguaje alucinan, y por qué nuestra forma de evaluarlos mantiene el problema
Las falsedades dichas con seguridad que llamamos "alucinaciones" no son un fallo misterioso: algunas son un subproducto estadístico del entrenamiento, y persisten porque los benchmarks dominantes premian una conjetura segura más que un honesto "no lo sé". Un estudio de caso con cuatro modelos de frontera muestra que declarar las reglas de puntuación en el prompt ("rúbricas abiertas") invierte ese incentivo.