Laboratorio Mozilla Fellowship Investigación
El cuerpo sabe la música
Una máquina entrenada en Cochabamba reconoce la Kullawada, el Tinku y el breaking sin etiquetas, y encontró el compás de la música midiendo solo los tobillos de quienes bailan.
Por Violeta Ayala — Tecnóloga Creativa
En un espacio de captura en Cochabamba, cuatro cámaras calibradas graban a siete bailarines: Camili, Keny, Sean, Galgo, Lu, Ivana y Valentina. Bailan Kullawada, Tinku y breaking. Las cámaras no graban video para mostrar. Graban para medir: cada cuerpo queda convertido en 26 puntos en el espacio, en tres dimensiones métricas, treinta veces por segundo.
Ese archivo se llama Paqarina. Tiene 46 tomas y unos 66 minutos de danza. Es chico comparado con cualquier dataset comercial de movimiento, y ya alcanzó para varios hallazgos que ningún dataset comercial puede producir, porque ningún dataset comercial contiene lo que este contiene.
La música que la máquina encontró sin escuchar
El sistema no sabe que existe el sonido. Nunca recibió un archivo de audio. Trabaja solo con posiciones de articulaciones en el espacio.
Medimos la altura de los tobillos a lo largo del tiempo, porque los pies golpean el suelo a tiempo. En tres tomas independientes de Kullawada, el pulso detectado fue 82.4, 82.3 y 80.4 golpes por minuto. Tres tomas, tres días de captura, menos de dos pulsaciones de diferencia. En el Tinku: 154.0, 154.9 y 155.1.
Pulso detectado sobre la altura de los tobillos en tres tomas independientes por danza. El breaking no marca el compás con los pies: su tiempo vive en la música y en el torso.
La bailarina lleva la orquesta en los tobillos.
Hay más. El ciclo del movimiento de la Kullawada, medido por la energía del cuerpo entero, dura entre 66 y 70 frames, con cinco tomas coincidiendo en un margen de dos. A 82 pulsaciones por minuto, un tiempo musical dura 17.5 frames. Cuatro tiempos son 69. El ciclo del movimiento es el compás, medido por dos vías que no se conocen entre sí.
Reconocer sin etiquetas
Entrenamos un modelo de la familia JEPA para que aprenda a predecir movimiento enmascarado. Nunca le dijimos qué danza era cada toma. Después le preguntamos: dado un fragmento cualquiera, buscá el fragmento más parecido en otra toma. Acierta la danza el 83.6 por ciento de las veces. El azar daría 33.
| Danza | Acierto | |
|---|---|---|
| Kullawada | 90% | |
| Breaking | 77% | |
| Tinku | 68% | |
| Azar | 33% |
Lo interesante está en qué mira. El 57 por ciento de la variación que el modelo considera importante correlaciona casi perfecto con una sola cosa: la altura de los hombros. Antes de cualquier sutileza, una danza es una relación con el suelo.
El eje dominante del modelo correlaciona 0.96 con la altura de hombros. Kullawada de pie, Tinku agazapado, breaking contra el piso.
Y la identidad de una danza vive en la frase, no en el paso. Con ventanas de dos segundos el modelo reconoce poco. Con seis segundos llega a su máximo. Con ocho empieza a bajar. Un paso suelto no dice qué danza es; la frase sí.
El experimento del vocabulario
La medición más limpia del proyecto salió de un accidente. En una toma de Tinku, uno de los dos bailarines se aburre a mitad de la sesión y cambia a breaking. El otro sigue en Tinku.
Energía de movimiento de los dos cuerpos. La distancia entre ellos casi no cambia: lo que se rompe es el idioma.
La sincronía no es estar cerca ni moverse al mismo tiempo. Es hablar el mismo idioma con el cuerpo. Eso ahora está medido.
En el trío de Kullawada aparece la versión honesta del mismo fenómeno: un solo patrón común explica el 39.1 por ciento de lo que hacen las tres bailarinas, apenas sobre el 35.7 del azar. De 22 ventanas de ocho segundos, solo 2 muestran pulso claro compartido. Se enganchan por momentos y el resto del tiempo cada una baila su versión. La sincronía perfecta del bloque de fraternidad es una conquista, no un punto de partida.
Los errores que enseñan
Acá los errores se publican, porque cada uno midió algo que ningún acierto habría mostrado.
Durante meses el Tinku parecía reconocerse al 53 por ciento. Era falso. Dos tomas de breaking estaban mal etiquetadas como Tinku y se encontraban entre sí en la evaluación, inflando el número. Al corregir el catálogo, el Tinku bajó a 47. Material mal etiquetado no empeora un resultado. Lo mejora, y por eso es tan difícil de ver. Un número que baja cuando se limpian los datos es señal de que el número anterior estaba mal.
Después, limpiar el tracking lo subió a 68 sin capturar un solo frame nuevo. Las dos limpiezas movieron el número en direcciones opuestas y las dos tenían razón.
También sabemos exactamente dónde se rompe el sistema. Un muslo de Sean llegó a medir 3.05 metros en una toma de trabajo de piso; su largo real es 37 centímetros. El detector pierde el cuerpo cuando el cuerpo se invierte, se ocluye, gira contra el suelo. Las tomas de piso de una tarde de agosto están destruidas entre un 35 y un 64 por ciento, y de adentro se rescataron con cirugía casi un minuto de tramos sanos. La cámara cenital que falta es un hallazgo del sistema.
Y la generación libre de danza nueva todavía no funciona, y sabemos por qué: el techo es de datos. Setenta minutos de archivo homogéneo no alcanzan para que un modelo invente Kullawada nueva, y el modelo lo dijo de cuatro maneras distintas antes de que le creyéramos. Lo que sí funciona es la recombinación: el modelo elige fragmentos reales que empalman bien y el resultado ya mueve un avatar en Blender, con los pies capturados y los huesos rígidos.
Por qué esto no lo hace la industria
Los datasets comerciales de movimiento capturan individuos en ropa ajustada haciendo gestos genéricos. Su unidad de análisis es una persona sola.
Las danzas de este archivo tienen otra unidad. La Kullawada es sincronía: cuerpos en fase. El Tinku es oposición: dos cuerpos acoplados por antagonismo, cada movimiento responde al del otro sin copiarlo. El breaking es turnos: el cypher alterna y los demás responden. Capturar estas danzas de a un cuerpo es capturar la mitad trivial y perder la parte que las define.
Paqarina se gobierna desde la comunidad que baila. Los métodos se publican completos, incluido este texto. Los datos pertenecen a quienes los produjeron con el cuerpo, con etiquetas de Local Contexts que registran esa pertenencia. Los modelos se abren; el archivo se cuida.
Lo que viene: una sesión de captura con más bailarines, el Tinku primero porque es la danza con menos material, trajes de captura diseñados con un color por segmento del cuerpo, y la cámara cenital para el trabajo de piso. Los personajes que salgan de este archivo van a nacer con las proporciones de los cuerpos reales que los bailaron.
La bailarina lleva la orquesta en los tobillos. Ahora hay un archivo que lo puede probar.
Paqarina es un proyecto de United Notions Film y el laboratorio Koa.xyz, dentro de la beca Mozilla 2026–2027. Sistema: Dan Fallshaw. 3D: Brian Condori. Bailarines: Camili, Keny, Sean, Galgo, Lu, Ivana y Valentina. Las mediciones corresponden al estado del proyecto al 20 de agosto de 2026.
