Niemand bringt den Autos das Fahren bei. Sie probieren es einfach – sehr, sehr oft – und bekommen Punkte dafür, wie es gelaufen ist. Daraus wird nach und nach ein Gehirn, das fahren kann.
Die Autos bekommen nur für das Ergebnis Punkte, nicht für einen bestimmten Fahrstil. Niemand sagt „fahr rechts“ oder „bremse vor der Kurve“:
Wir nehmen das aktuelle Gehirn und machen 48 leicht veränderte Kopien (die Gewichte werden ein wenig zufällig verwackelt). Jede Kopie fährt eine Weile. Dann schauen wir: Welche Veränderungen haben mehr Punkte gebracht? In diese Richtung wird das Gehirn verschoben. Eine Runde heißt Generation.
Vorteil: sehr einfach und robust. Nachteil: Es zählt nur die Gesamtpunktzahl aller Autos – welches Auto was falsch gemacht hat, erfährt das Verfahren nicht. Das macht es langsam.
Hier lernt das Gehirn aus den Erlebnissen jedes einzelnen Autos: Was hat es gesehen, was hat es getan, und wie ging es danach für dieses Auto aus? Handlungen, die besser liefen als erwartet, werden wahrscheinlicher; schlechtere seltener – aber immer nur in kleinen, vorsichtigen Schritten.
Alle Autos teilen trotzdem ein Gehirn: Was eines lernt, können alle. Das ist meist viel schneller als Evolution, aber kniffliger einzustellen.
Wie viele der Autos sind während des Trainings angekommen, verunglückt oder von der Straße abgekommen? Gestrichelte Linien markieren, wo ein neuer Trainingslauf mit geänderten Einstellungen weitergemacht hat.
Gemessen beim Training selbst: Dort wird die Verkehrsmenge langsam gesteigert, sobald es gut läuft. Zwischen den Läufen haben sich auch Belohnung und Simulation geändert – die Kurve ist also eher ein Tagebuch als eine saubere Messung. Saubere Messungen stehen unter der Zeitreise.
Hier fährt jeweils ein gespeicherter Zwischenstand des Gehirns. Schieb den Regler und vergleiche: Am Anfang fahren die Autos wild durcheinander, später kommen die meisten an. (Alle Zwischenstände fahren mit genau demselben Verkehr.)