En directo · flujo MJPEG 256×224
nivel—
distancia ahora—px
mejor distancia—px
pasos/s—
fotogramas/s del juego—
estado—
Cómo aprende · el ciclo, en vivo
intento actual—
pasos jugados—pasos
ritmo—pasos/s
actualizaciones de la red—
esperando los datos del agente…
esperando intentos con los que medir si mejora…
Aquí no hay generaciones ni población: eso es de los algoritmos genéticos (NEAT). Este agente aprende por gradiente — juega, mide el resultado, corrige los pesos de la red y vuelve a jugar con la red corregida. Los intentos son partidas seguidas, no generaciones.
Curva de aprendizaje · en qué se basa
esperando el primer intento…
Terminal · diario del agente
mario@vps · diario en vivo del agente
las líneas nuevas se escriben solas según las publica el propio agente
─────────────────────────────────────────────────────────────
puntos
—
monedas
—
vidas
—
bandera
—
Recompensa por intento
recompensa del intento
media móvil (7 intentos)
—
—
Distancia por intento
distancia del intento (px)
mejor distancia hasta ese intento
—
Telemetría del agente
pasos totales
—
decisiones tomadas desde el arranque
intentos
—
partidas empezadas
mejor distancia
—
récord global
recompensa media
—
media de los últimos intentos
ritmo
—
pasos por segundo
vídeo del juego
—
fotogramas por segundo (emulador)
tiempo jugado
—
desde el arranque
nivel actual
—
—
Niveles
| nivel | nombre | intentos | mejor distancia | mejor recompensa | muertes | turno del agente | ¿superado? |
|---|---|---|---|---|---|---|---|
| — | — | — | — | — | — | — | — |
Ficha del agente
Cómo aprende
- proyecto
- —
- emulador
- —
- política (red)
- —
- entrada de la red
- —
- fórmula de recompensa
- —
- qué está haciendo
- —
Hiperparámetros del entrenamiento
Aprende desde cero y sin GPU. No hay una partida pregrabada ni una política copiada: el agente arranca sin saber nada, prueba al azar, cobra la recompensa que él mismo calcula y va subiendo. Sin tarjeta gráfica el progreso es lento, pero es real y se ve en la curva de arriba.