Q-Learning
Stufe 2 - tabellarisches Q-Learning aus Belohnung. Plus eine ehrliche Note dazu, wo Konvergenz wirklich greift.
Jetzt ersetzen wir die handgeschriebene Tabelle durch eine, die sich selbst füllt.
Tabellarisches Q-Learning, von der ganzen Kolonie geteilt - 16 Zustände × 4 Aktionen.
Belohnung
Die einzige Vorgabe, die wir dem Lernen geben:
let r = -0.01; // jeder Schritt kostet (Effizienz)
if (ev.picked) r += 1; // Zucker aufgenommen
if (ev.delivered) r += 10;// Zucker im Bau abgeliefert ← das eigentliche Ziel
Aktionswahl (ε-greedy) und Lernregel
decide(s) {
this.visits[s]++;
if (Math.random() < this.eps) // explorieren
return Math.floor(Math.random() * 4);
return argmax(this.Q[s]); // ausnutzen (gieriger Zug)
}
update(s, a, r, sNext, alpha) {
const maxNext = Math.max(...this.Q[sNext]);
this.Q[s][a] += alpha * (r + this.gamma * maxNext - this.Q[s][a]);
this.eps = Math.max(0.05, this.eps * 0.9996); // Exploration sinkt mit der Zeit
}
Der update braucht die vorige Entscheidung. Deshalb merkt sich jede Ameise
prevS/prevA und die seit dem letzten Zug angesammelte Belohnung rAccum. Pro
Tick: erst update(prevS, prevA, rAccum, s), dann neu entscheiden.
Der Geld-Moment
Lege die gelernte Politik neben die handgeschriebene. Für jeden erlebten Zustand:
Stimmt argmax(Q[s]) mit hardAction(s) überein?
const match = argmax(Q[s]) === hardAction(s);
// zähle nur Zustände, die oft genug besucht wurden - über Unerlebtes weiß die Kolonie nichts
Im Lab zeigt das Metrik-Panel „Politik-Match" eine Quote wie 4/5 ✓. Die Maschine
hat deine Regeln selbst gefunden - nur aus Belohnung.
Ehrliche Note zur Konvergenz: Wir vergleichen nur die entscheidungsrelevanten Zustände - die, in denen die Belohnung die Aktion wirklich bestimmt (Tragen →
ZUM_BAU, Zucker sehen →ZUM_ZUCKER). In Zuständen, in denen jede Navigation fast gleich gut ist (nur „am Bau", nur „Spur"), bleiben die Q-Werte nah beieinander undargmaxist quasi zufällig. Das ist kein Bug, sondern eine Eigenschaft von Reward-Shaping: Gelernt wird zuverlässig nur dort, wo die Belohnung unterscheidet.
Agenten-Lektion: Drei Dinge werden hier greifbar.
- Das ist der Unterschied zwischen Algorithmus und Lernen: gleiche Box, aber in Stufe 1 vorgeschrieben, in Stufe 2 aus Erfahrung gebildet.
- Die Kolonie lernt nur über Situationen, die sie erlebt. Seltene Zustände bleiben leer - die Brücke zu „ein Modell ist nur so gut wie seine Daten".
- ε steuert das Explore/Exploit-Dilemma: zu wenig Exploration → die Kolonie erstarrt in einer mittelmäßigen Strategie.
→ Im Lab: Gehirn „Q-Learning" wählen und „Politik-Match" zusehen