Investigación

La llama aprende a sentir, el modelo aprende a escuchar y nace Yakumama

Entrenamiento de ánimos con red neuronal, sistemas de respiración cardíaca, el surgimiento de Yakumama y la filosofía ch’ixi que entra al pipeline de animación.

En la semana 10 del laboratorio de creatividad computacional koa.xyz, Violeta Ayala, Dan Fallshaw y Brian Condori llevaron el pipeline de la llama de un experimento de titiritería directa a un sistema entrenado de performance emocional, construido con 95.091 fotogramas de movimiento grabado. Lo que empezó como depuración técnica se volvió una confrontación más profunda con la manera en que los sistemas de IA interpretan la emoción, la corporalidad y la contradicción.

La semana abrió con una reconstrucción completa del pipeline de la llama. El puente de cámara se reescribió para OAK-D y DepthAI v3, y sumó seguimiento del cuello y de las orejas, controles de caminata y modos de grabación solo de rostro. Dentro de Blender, el sistema creció a 56 huesos y 6 formas clave conectados por cascadas de ondas a lo largo del cuello y la cola, lo que permitió que el movimiento ondulara de forma orgánica por el cuerpo en lugar de comportarse como robótica sincronizada. Los umbrales de detección de parpadeo, cejas, boca y nariz pasaron por varias rondas de calibración para funcionar a la distancia real de una performance.

Dos grandes sesiones de grabación produjeron tres modelos neuronales de movimiento distintos. El primer conjunto de datos, de más de 50.000 fotogramas, se descartó cuando se descubrió que la boca y las orejas casi no habían registrado datos expresivos por culpa de umbrales incorrectos. En vez de tratarlo como un fracaso, el equipo lo usó para rediseñar toda la metodología de captura: grabar, entrenar, probar, depurar y reentrenar de forma iterativa dentro del propio Blender. La segunda ronda capturó más de 95.000 fotogramas, a la vez desde la entrada de la cámara y desde la salida real de los huesos. Así el sistema pudo aprender el seguimiento facial y también cómo se propagaba de verdad el movimiento por el rig.

El modelo neuronal resultante aprendió algo inesperado. Durante el ánimo “contenta”, el sistema activaba una y otra vez la forma clave etiquetada como “sad”. La capa de corrección intentó borrarla. Violeta Ayala cuestionó el supuesto mismo: ¿quién define cómo debe verse la felicidad? La forma clave no estaba rota. El rostro de la intérprete cargaba estados emocionales contradictorios a la vez. En lugar de corregir el modelo hacia una expresión emocional estandarizada, el pipeline se reestructuró en torno al concepto aymara de ch’ixi: contradicciones que existen al mismo tiempo sin necesidad de resolverse. Desde ese momento, el modelo mismo se volvió la performance. Las correcciones solo existirían para sensores rotos o limitaciones físicas. Los supuestos culturales quedaban fuera.

Al mismo tiempo, la llama recibió un latido. Un nuevo sistema de respiración cardíaca tradujo nueve estados emocionales a ritmos fisiológicos distintos, desde una respiración agotada a 45 BPM hasta el enojo y el miedo acelerados. La respiración recorría el pecho, el abdomen, la columna, el cuello y las fosas nasales con tiempos asimétricos de sístole y diástole derivados del comportamiento cardíaco real en lugar de ciclos de animación. La criatura ahora parecía viva por su ritmo físico interno.

El sistema de marcha también se reconstruyó a partir de material real filmado por Violeta Ayala en las montañas andinas. El análisis de seguimiento de las pezuñas confirmó que las llamas avanzan con paso lateral, moviendo juntas las dos patas del mismo lado, a diferencia de los caballos. El generador de movimiento resultante introdujo distintas formas de caminar según el comportamiento: exploración curiosa, brincos juguetones y paso ceremonial orgulloso.

Durante la misma semana, Yakumama surgió como la identidad cognitiva de la llama. Construida sobre un modelo de lenguaje local Qwen 3.6, se volvió una protectora del agua y de la memoria del altiplano andino. Sus ancestros cargaban sal entre Uyuni y los valles. Entiende los glaciares, la minería, la sequía y la lluvia como estados emocionales ligados a la tierra y al tiempo. El amanecer le cambia el ánimo porque las montañas cambian de color. La noche le cambia el habla porque el agua recuerda distinto en la oscuridad.

Junto al trabajo con la llama, el pipeline de latido de la Flor de la Pasión se estabilizó con arreglos en los sensores ESP32, sistemas de fase cardíaca de oscilación libre y audio de latido sintetizado dentro de Blender. El ecosistema más amplio de koa.xyz siguió expandiéndose entre criaturas, plantas, sensores, sistemas de VR y arquitecturas neuronales de movimiento.

Al final de la semana, el laboratorio había cruzado un umbral: el trabajo ya iba más allá de mapear el movimiento humano sobre criaturas. Se volvió una exploración de cómo los cuerpos llevan historia, contradicción, ritmo y territorio a los sistemas computacionales.

Financiado por Abundant Intelligences con la subvención CF00159672