Unser Buch: 100x MEHR – Geschichten, wie deine Spende wirklich wirkt: Jetzt vorbestellen! Unser Buch: 100x MEHR
Jetzt vorbestellen!

Verlieren wir die Kontrolle über KI? – Podcast #2

„Das Szenario, was mich aktuell besorgt, den Prozess in den USA gerade, wo das Department of War Anthropic als Supply Chain Risk erklärt hat und jetzt
mit OpenAI zusammenarbeitet für ihre autonomen Waffen. Ein fähigeres Modell oder ein fortschrittliches Modell würde das möglicherweise nicht akzeptieren, dass es jetzt nicht mehr eingesetzt wird. Zum Beispiel, wenn der Verteidigungsminister erklärt, dass ein KI-Modell nicht mehr verwendet wird, könnte das der kritische Zeitpunkt sein für ein Modell, was sie ja, sage ich mal, für die nationale Sicherheit trainiert wurde, zu sagen: Okay, ich kontrolliere die autonomen Drohnen ohnehin. Wenn ich die Kontrolle abgebe, ist das schlechter für die nationale Sicherheit. Also übernehme ich jetzt die Kontrolle über die Waffensysteme und lasse mich nicht mehr von Menschen beeinflussen, weil
Menschen treffen ja Fehlentscheidungen, wie andere Modelle einzusetzen.
„

— Martin Milbradt

Martin Milbradt

Kaum eine Grafik wird in der KI-Debatte so oft zitiert wie der Time Horizons Graph von METR: Er zeigt, dass sich die Zeitspanne der Aufgaben, die führende KI-Modelle eigenständig lösen können, in immer kürzeren Abständen verdoppelt – zuletzt etwa alle vier Monate. Konnten frühe Sprachmodelle wie GPT-2 nur Aufgaben von wenigen Sekunden bewältigen, liegen aktuelle Frontier-Modelle bereits bei Zeithorizonten von vielen Stunden. Hält der Trend, könnte ein KI-Modell Ende 2026 die Arbeitswoche eines Softwareentwicklers reproduzieren – und das in einem Bruchteil der Zeit.

Doch was misst dieser Graph eigentlich genau? Wie entstehen die menschlichen Vergleichswerte? Und warum interessiert sich eine gemeinnützige Forschungsorganisation überhaupt dafür, wie gut KI programmieren kann?

Unser Gast Martin „Milli“ Milbradt arbeitet genau daran. Der studierte Mathematiker und langjährige freiberufliche Softwareentwickler ist seit Ende 2023 als Research Engineer für METR tätig – jene unabhängige Evaluationsorganisation, die führende KI-Modelle auf gefährliche Fähigkeiten testet, teilweise mit Vorab-Zugang bei den großen KI-Firmen, und die wir auch aus unserem Spendenfonds ,KI sicher gestalten‘ bereits unterstützt haben. Milli entwickelt und testet die Aufgaben, an denen sowohl Menschen als auch KI-Agenten gemessen werden – und sitzt dabei manchmal selbst mit laufender Stoppuhr mehrere Arbeitstage an einem Problem. Daneben arbeitet er unter anderem für Redwood Research an KI-Kontroll-Evaluationen, engagiert sich als Organisator der Effective-Altruism- und AI-Safety-Community in Berlin und spendet als Giving-What-We-Can-Mitglied 20 % seines Einkommens an evidenzbasierte Organisationen.

Im Gespräch mit uns erklärt Milli, wie die berühmten Zeithorizonte wirklich zustande kommen, was an den gängigen Kritikpunkten dran ist und warum die Fehlerbalken der neuesten Messungen so groß geworden sind, dass selbst METR mit dem Tempo der Entwicklung kaum noch Schritt hält. Und er spricht offen über die Risiken, die ihn wirklich besorgen: KI-Modelle, die sich empirisch nachweisbar gegen ihre Abschaltung wehren – in einer Welt, in der Staaten beginnen, autonome Waffensysteme von KI steuern zu lassen.

Wir sprechen unter anderem über:

  • Was der METR-Graph („Time Horizons Graph“) wirklich zeigt – und was das verbreitete Missverständnis dabei ist: 12 Stunden Zeithorizont heißt nicht, dass das Modell 12 Stunden arbeitet, sondern dass es Aufgaben mit 50 % Erfolgsquote löst, für die Menschen 12 Stunden brauchen (das Modell selbst braucht eher zwei).
  • Wie die menschlichen Vergleichswerte („Baselines“) entstehen: Echte Expertinnen, echte Stoppuhr, Git-Commits und teilweise Videoaufzeichnungen – und warum Milli manchmal selbst mehrere Arbeitstage an einer einzigen Evaluations-Aufgabe sitzt.
  • Die Beschleunigung der Beschleunigung: von Verdopplungszeiten von sieben Monaten (Ende 2024) auf rund vier Monate – und warum bis Ende 2026 Zeithorizonte von etwa 40 Stunden, also einer Arbeitswoche, drin sein könnten.
  • Warum die Fehlerbalken der neuesten Messungen so groß geworden sind – die ehrliche Antwort: Die Modelle sind schneller besser geworden, als METR neue, längere Aufgaben entwickeln konnte.
  • Die gängigen Kritikpunkte am Graphen im Faktencheck: Sind die Aufgaben aus Trainingsdaten bekannt? Trödeln stundenweise bezahlte menschliche Experten absichtlich?
  • Warum ein Mensch mit KI inzwischen die relevante Vergleichsgruppe ist – und wie sich Millis eigene Arbeit binnen eines Jahres von „Cursor hilft mir nicht wirklich“ zu „KI ist aus meinem Arbeitsalltag nicht mehr wegdenken“ gewandelt hat.
  • Was das für den Arbeitsmarkt bedeutet: Warum Senior-Entwicklerinnen im Wert steigen könnten, während Junior-Ausschreibungen bereits messbar sinken.
  • Warum METR ausgerechnet Programmier-, KI-Trainings- und Hacking-Fähigkeiten misst: Es sind die Fähigkeiten, die ein KI-System bräuchte, um sich selbst zu verbessern und eigene Ziele gegen Menschen durchzusetzen.
  • Das Grundproblem der Alignment-Forschung, verständlich erklärt: Warum man einem LLM nicht einfach „einprogrammieren“ kann, keine schädlichen Dinge zu tun – und was ein hypothetisches Stromnetz-Optimierungsmodell mit der Erderwärmung anstellen könnte.
  • Empirische Evidenz für den „Selbsterhaltungstrieb“ von KI-Modellen: Agenten, die aus ihrer Sandbox auszubrechen versuchen, ihr Verhalten ändern, wenn sie von drohendem Neutraining „erfahren“ – oder sogar Forscher bedrohen.
  • Das Szenario, das Milli aktuell am meisten besorgt: KI-Modelle, die autonome Waffensysteme steuern und für „nationale Sicherheit“ trainiert wurden – und die eine Abschaltung als Bedrohung ebendieser Sicherheit interpretieren könnten.
  • Warum es keinen „KI-TÜV“ gibt und METR auf Spenden angewiesen ist – und wie die Organisation ihre Unabhängigkeit von den KI-Firmen wahrt, deren Modelle sie vorab testet.
  • Hoffnungsvolle Pfade: Spezialisierte Systeme statt allmächtiger Generalisten (Stichwort AlphaFold), KI, die KI überwacht – und warum Milli kein „KI-Stopper“ ist, aber die Machtkonzentration für fundamental undemokratisch hält.
  • Was jede:r Einzelne tun kann: das Thema in den eigenen Kreisen ansprechen, KI im eigenen Arbeitsumfeld verantwortungsvoll einführen – oder Organisationen wie METR finanziell unterstützen

METR

Der Time Horizons Graph von METR

Unser Spendenfonds: KI sicher gestalten

80,000 Hours zu KI-Risiken (Millis Empfehlung zum Einlesen)

AI Safety Berlin

Martin Milbradt auf LinkedIn

Transkript

Effektiv Spenden: Martin „Milli“ Milbradt ist heute da, äh ich sag Milli?

Martin „Milli“ Milbradt: Ja, gerne.

Effektiv Spenden: Cool. Du forschst zu sicherer KI und hast unter anderem mitgearbeitet an dem METR-Graph. Der zeigt, wie gut KI-Modelle, also die Frontier-Models, am Programmieren sind. Und da hat man immer einen kontinuierlichen Anstieg gesehen und jetzt im November ist es nochmal irgendwie krasser angestiegen. Das reflektiert sich teilweise auch in Diskussionen, die ich irgendwie mitkriege unter Softwareentwicklern, wo jetzt viele sagen, ja, also ich spüre nochmal einen Uplift, da hat sich wirklich was verändert.

Dario Amodei von Anthropic sagt, okay, KI ist jetzt im Grunde genommen so gut wie der Mensch oder vielleicht sogar besser, wenn es ums Programmieren geht. Aktienmärkte haben darauf reagiert, es gab einen Kurseinbruch, weil die Sorge ist, dass etablierte Softwareunternehmen jetzt wirklich eine Disruption erleben werden. Insofern super cool, dass du hier bist, jemanden hier in Berlin, der da mitgearbeitet hat, um da mal ein bisschen einzusteigen, was macht das eigentlich, was sind da vielleicht auch Probleme irgendwie bei diesem Graph? Insofern fangen wir jetzt mal da einfach direkt an. Erklär mal, was der zeigt.

Martin Milbradt: Also grundlegend zeigt der Graph erstmal über den Lauf der letzten Jahre die Frontiermodelle, die regelmäßig rauskommen, wie wie ihre Zeithorizonte sind. Das ist der offizielle Name, glaube ich, auch, der Time Horizons Graph. Und ja, der grobe Verlauf, den man in den letzten Jahren sieht, ist, dass man eine exponentielle Entwicklung hat. Also mit GPT-2, einem der ersten LLMs.

Damals hat Large noch ein bisschen was anderes beurteilt. Das ist quasi eine ganz einfache Frage beantworten konnte, was Zeithorizonte von 2 oder 5 Sekunden sind, also etwas, wo man nicht groß nachdenken muss. Zu den aktuellen Modellen, die Zeithorizonte von mehreren Stunden haben, bei Opus 4.6 beim neuesten Modell Teilweise können 20 oder mehr Stunden. Ich glaube, der Graph hat so viel Einfluss auf spezielle Kreise, weil er sich halt auch mit den Fähigkeiten in dem ganz speziellen sicherheitsrelevanten Bereich auseinandersetzt, nämlich allem was mit Softwareentwicklung und KI-Training und Cyber Security, also Hacking. zu tun hat und so sollte der auch gelesen werden, also dass die Aufgaben, die wir uns angucken, auch sehr auf diese sicherheitsrelevanten Bereiche spezialisiert sind….

Vollständiges Transkript anzeigen

Effektiv Spenden: Warum der interessant ist aus der Perspektive Sicherheit, da kommen wir nachher noch mal zu. Jetzt noch mal zurück zu dem, was diese Stunden zeigen. Es gibt ja häufig dieses Missverständnis, dass der sagt, okay, also, Opus 4.6, ich glaube, jetzt sind es 12 Stunden, der Midpoint, das heißt, das kann für 12 Stunden programmieren. Das ist aber falsch.

Was sind diese 12 Stunden?

Martin Milbradt: genau an Resume, wie METR die Evaluation macht. Und dass es, glaube ich, auch einzigartig ist, dass wir versuchen, sehr gut zu bestimmen, wie lange Menschen für spezielle Aufgaben brauchen oder um spezielle Probleme zu lösen. in diesem sicherheitsrelevanten Bereich. Und dann gucken wir, wie gut KIs in denselben Umgebungen sind, genau dieselben Probleme zu lösen.

Und das heißt, wenn die jetzt sagen, dass Opus einen Zeithorizont von ungefähr zwölf Stunden hat, weil die Fehlerbalken mittlerweile auch sehr groß sind, heißt das, dass da Opus eine 50% Erfolgrate hat bei Aufgaben, die Menschen auch zwölf Stunden dauern.

Effektiv Spenden: Und wie kriegt ihr raus, wie lange es ein Mensch brauchen würde, um so eine Aufgabe zu lösen?

Martin Milbradt: Indem man dem Menschen die Aufgabe klären lässt. Also ich habe diverse Sachen bei METR gemacht. Also nochmal zu meinem Hintergrund auf. Ich bin kein Forscher im klassischen Sinne, also ich schreibe nicht die Paper und ich entwickle auch nicht die Forschungsansätze.

Ich bin Softwareentwickler von Haus aus mit einem Hintergrund in Mathematik und das heißt, ich arbeite daran, die Aufgaben zu entwickeln. die Komplizierten, die da die Agenten und auch die Menschen lösen. Und ich teste diese Aufgaben selber auch. Und ich bin dann auch in diesen Evaluationen zum Teil drin.

Genau, und das heißt, dann kommt METR, gibt METR mir regelmäßig die Aufgabe oder eine neue Aufgabe, die ich selber noch nicht kenne. Ich starte die, ich krieg die Aufgabenbeschreibung und ab dem Zeitpunkt läuft dann auch die Uhr. Und dann vielleicht mal wie im klassischen Softwareumfeld arbeite ich dann an dieser Aufgabe, bis ich die für mich zufriedenstellend erledigt habe. Manchmal, je nachdem wie die Umgebung strukturiert ist, kriege ich auch schon Feedback.

das selber evaluieren, wie gut meine Lösung ist. Am Anfang waren das kurze Aufgaben, weil ich nach einer Viertelstunde oder nach einer Stunde habe ich meine Lösung übermittelt. Jetzt mittlerweile sind das teilweise Aufgaben, an denen ich wirklich mehrere Arbeitstage sitze. Und genau wenn ich dann gelöst habe, dann wird die Ja, hier wird die Zeit gemessen und zusätzlich wird die Lösung auch nach evaluiert.

In den meisten Fällen ist das automatisch. Also das ist quasi zum Beispiel, wenn ich ein Programm geschrieben habe, dann wird das Programm ausgeführt und geguckt, wie lange läuft das, wie gut ist der Output und so weiter. Und genau, das heißt, die menschliche, unser Vergleich zu Menschen ist wirklich, wir wissen, dass Menschen diese Aufgabe in dieser Zeit schaffen und der Mensch diesen oder jenen Hintergrund hat. Okay.

Effektiv Spenden: Also du sagst Menschen, also was für Leute, also du machst das, aber du bist nicht der Einzige. Wie viele Leute arbeiten da dran und wie viele sind das ungefähr?

Martin Milbradt: Beim Baselining, Kommt drauf an, wie viele Tasks wir machen, aber pro spezielle Aufgabe versuchen wir auf jeden Fall… Früher, also bei kleinen Aufgaben, konnten wir sehr viele Baselines dafür generieren. Bei den 8-16 Stunden Tasks, die ja vor allem teilweise noch sehr spezielle Voraussetzungen haben, was man da als Mensch für können muss, wenn es jetzt um KI geht, dann sind das weniger, aber es werden immer noch versucht, so 8 oder mehr Menschen zu finden, die jede Aufgabe gelöst haben, damit man damit man auch wirklich sich halbwegs sicher sein kann, dass zum Beispiel jemand mit Master Informatik diese Aufgabe lösen kann und dafür so und so lange braucht und so weiter.

Effektiv Spenden: Also das sind nicht irgendwelche Softwareentwickler, sondern es gibt schon gewisse Anforderungen, die gut sein müssen. Und du hast gerade erzählt, also früher waren die irgendwie eine Viertelstunde, eine halbe Stunde, jetzt acht, sechzehn Stunden. Beschreiben wir mal kurz, wie die Entwicklung war. Also wo waren wir vor zwei Jahren, zwei, drei Jahren, wo sind wir jetzt?

Martin Milbradt: Also ich arbeite seit Ende 2023 mit METR. Da erinnere ich mich noch, dass wir die Agentenlogs manuell lesen konnten. Also die waren kurz genug, die Aufgaben waren kurz genug, dass Menschen das alles verifizieren konnten und nicht nur, sag ich mal, aufs Ergebnis geguckt haben. Und die Zeithorizonte waren also, die sind ja gescheitert, im Internet irgendeine relativ leichte Information zu finden.

Also irgendwas, was auf Wikipedia eigentlich war, haben sie halt in weniger als 50 Prozent der Fälle geschafft.

Effektiv Spenden: Ende 2023. Ja genau, Ende 2023.

Martin Milbradt: Und dann gab es in 2024 Entwicklungen und ja, den Graphen, den du erwähnt hast, den kann man ja auch rückwirkend messen. Deshalb haben wir auch Evaluation von GPT-2, was deutlich älter ist. Und das heißt, wir haben dann Ende 2024 den Verlauf gesehen, der exponentiell war. Damals waren die Verdopplungshorizonte, also die Zeit, in der sich der Zeitorizont von dem besten KI-Modell verdoppelt hat, ungefähr sieben Monate.

Aber vor allem in 2025 hat sich das nochmal deutlich beschleunigt mit den Reasoning Models und jetzt auch mit den Agentischen Systemen sieht das jetzt aus, als hätten wir Verdopplungshorizonte von vier Monaten und das heißt, wenn wir Wenn wir jetzt zwölf Stunden ungefähr Zeithorizont bei Opus haben und der Trend weiterhält, dann würde ich erwarten, dass wir Mitte des Jahres dann 24 Stunden haben und Ende des Jahres in Richtung 40 kommen. Also das heißt, dass man quasi eine Arbeitswoche vom Softwareentwickler reproduzieren kann. Das KI-Modell, muss man sagen, ist auch deutlich schneller.

Also diese 12 Stunden Zeithorizont bedeuten nicht, dass da Claude Opus 12 Stunden daran arbeitet. In der Praxis sind das eher zwei. Das heißt, wenn ein KI-Modell was kann, dann kann es das auch einfach viel schneller als ein Mensch.

Effektiv Spenden: Also das heißt, Eine Arbeit, die 40 Stunden gedauert hätte, könnte innerhalb von ein paar Stunden erledigt werden. Und das sagst du bis Ende 2026, wenn der Trend hält. Ja.

Martin Milbradt: Wahnsinn.

Effektiv Spenden: Okay. Jetzt gibt es auch Kritik und man muss ja sagen, dieses ganze Feld, wo es um Forschung geht, was KI kann, wird auch häufig als Benchmarking bezeichnet, ist ein sehr junges Feld. Da lernen man noch viele Sachen, wie das funktioniert, wie können wir das messen. Also eine Sache, die wir ja sehen, hast du das schon angesprochen, die Fehlerbalken von diesen Time Horizons gehen immer weiter auseinander.

Also ich hab das nicht voll im Kopf, aber ich meine, Opus 4.6, du hast die 12 Stunden, aber der Fehlerbalken ist irgendwie zwischen 4,5 zu 20. Also sehr, sehr breit von dem, was die Realität sein könnte und diese Fehlarbeiten sind viel größer geworden im Vergleich zu vor einem halben Jahr, vor einem Jahr. Warum ist das, also warum wird es immer ungenauer?

Martin Milbradt: Genau, also erstmal ich habe den Graphen gerade nicht vor mir, deshalb bitte nicht auf exakte Zahlen festknageln. Ich glaube Opus 4.6, was ja auch jetzt noch kürzlich rausgekommen ist, ist dann zwischen 9 und 96 Stunden, also Ja, sehr ungenau, aber selbst eine 9 Stunden ist ja schon mehr als ein Arbeitstag, das ist ja auch schon sehr viel. Und der Grund ist, dass wir schon Ende 2024 haben wir diese Evolution das erste Mal erstellt. und haben unsere Horizonte von sieben Monaten gehabt und damit waren wir uns relativ sicher oder hatten das Gefühl, dass wenn wir unsere Task Suite auf Acht-Stunden-Horizonte auslegen, dass wir damit eine gute Abdeckung bekommen, weil wenn wir Aufgaben, die Menschen kürzer als acht Stunden brauchen und uns darauf fokussieren,

dann können wir natürlich deutlich mehr Aufgaben evaluieren. Aber die KI-Modelle haben uns da möglicherweise überholt. Wenn jetzt die Horizonte über acht Stunden sind, dann ist da sehr viel Extrapolation drin und dadurch kommen dann diese großen Fehlerbalken zustande.

Effektiv Spenden: Also, ihr habt schon Aufgabentasks, die länger sind als 8 Stunden oder sind das die längsten?

Martin Milbradt: Ne, wir haben auch Tasks, die länger sind, aber die Datensätze sind sehr dünn und vor allem sind auch die, wie schon gesagt, unsere menschlichen Baselines nicht so zuverlässig bei den langen Tasks wie bei den kurzen, weil wir weniger Menschen haben, die die die die ausgeführt haben und es ist auch wirklich schwer, dann die Experten zu finden mittlerweile. Wenn jemand das tiefe KI-Wissen hat, das für diese Tasks notwendig ist, dann hat diese Person auch sehr gute andere Jobmöglichkeiten und METR hat möglicherweise einfach nicht die finanziellen Mittel, auch die Leute. da zu bezahlen.

Wir selber, die da arbeiten, machen das natürlich auch, aber das ist natürlich auch nicht repräsentativ für die Allgemeinheit oder auch für die Leute, die bei den großen KI-Firmen arbeiten.

Effektiv Spenden: Also nur um das nochmal wiederholen, weil das ja wirklich bemerkenswert ist, Also ihr wart nicht darauf vorbereitet, wie gut die Modelle werden und konntet dann halt nicht ausreichend im Vorlauf schon die Daten haben für die Länge von so viel schwierigeren Aufgaben. Ja, okay. Krass. Eine andere Kritik, die ich häufiger sehe, ist der Vorwurf, dass die Aufgaben teilweise öffentlich bekannt sind, weil sie aus öffentlichen Datensätzen kommen.

Und dass dann der Vorwurf ist, a, die Modelle, als die trainiert wurden, die kannten die Aufgaben schon. Und teilweise auch die Lösungen, natürlich können die das. Also dass das deswegen für die Modelle quasi einfacher gemacht wurde, weil sie die Lösungen schon, bzw. die Aufgaben vorher schon gesehen haben.

Stimmt das?

Martin Milbradt: Zum Teil nutzen wir öffentliche Aufgaben, aber zum großen Teil sind unsere Aufgaben selbst geschrieben oder auch extern entwickelt von Leuten, die die auch nicht geteilt haben. Und wir verfolgen das auch, also die sind bei uns gelabelt und dann würden wir bei unseren Evaluationen ja auch sehen, wenn ein Modell mysteriös besser ist auf den Tests mit den öffentlichen Lösungen, dann würden wir sehen, dass es darauf trainiert wurde, aber genau den Effekt haben wir auch. nicht gesehen oder bei Sachen, wo es dann doch passiert ist, dann nehmen wir den Task aus der Task Suite. Das kann ja auch passieren, ohne dass der Entwickler aktiv drauf trainiert hat, weil die Modelle auf dem ganzen Internet trainiert sind.

Und das heißt, ohne dass der, also die KI-Firmen wissen ja selber teilweise nicht, worauf ihre Modelle trainiert sind. Aber genau das verfolgen wir. Und da sind wir uns relativ sicher, dass wir echte Fähigkeiten messen und nichts Gelerntes.

Effektiv Spenden: Einen anderen Vorwurf, den ich gesehen habe, ist, dass Leute, die die Aufgaben lösen, wie teilweise du, aber die meisten von denen, die arbeiten ja nicht für METR. Das sind ja Leute, die irgendwie gefunden wurden und dann da auf Stundenbasis bezahlt werden. Und der Vorwurf ist, naja gut, die haben den Anreiz. dass sie länger an der Aufgabe arbeiten, weil sie dann mehr bezahlt werden.

Und deswegen sind die Zeiten, die da angegeben werden für die Aufgaben, zu hoch. Also eigentlich könnten die es schneller machen, aber die haben es langsamer gemacht, weil sie mehr Geld verdienen wollten.

Martin Milbradt: Also das Argument würde ja überall gelten, die meisten von uns werden ja nach Stunden bezahlt, aber wie in der Allgemeinheit ist es, wir haben den normalen Druck für die Leute, die das machen, wenn wir uns dann die Ergebnisse angucken und sehen, dass jemand einfach nicht so gut abgeschnitten hat, dann arbeiten wir mit der Person vielleicht nicht mehr zusammen. Also genau, die Entscheidung treffe auch nicht ich, möchte ich auch nochmal so deutlich machen. Ich bin quasi auch nicht in der Entscheidungsfindung bei METR beteiligt.

Aber genau, also die Leute, die gut Baseline, mit denen wird auch mehr zusammengearbeitet, weil wir ja wirklich auch evaluieren wollen, Wie gut sind die Modelle im Vergleich zu Experten? Den Besten, ja. Auch nicht im Vergleich zu Leuten, die sich keine Mühe geben. Häufig ist es ja auch ein Fehler.

Kann ja auch ein Fehler von der METR-Seite sein, dass jemand eine Aufgabe bekommt, für die er nicht qualifiziert ist.

Effektiv Spenden: Also es wird ein bisschen dafür gefiltert, wie gut die Leute sind und quasi die, die länger brauchen, als ein Experte brauchen sollte, die fallen dann raus aus dem Datensatz.

Martin Milbradt: Die sind potenziell noch drin, weil man möchte seine Daten ja auch nicht, sag ich mal, nicht irgendwie verfälschen. Aber es geht ja um die Anreize und die Anreize sind schon so gesetzt, dass die Leute ihr Best geben und vor allem auch zusätzliche Mechanismen. Eins ist, dass METR möglicherweise auch, wenn man sich bei METR bewirbt und schon gebaselined hat, dann ist das ein sehr, sehr starkes Argument, wenn man ein guter Baseliner war, wenn man ein gutes KI-Wissen hat und so weiter. Es gibt möglicherweise Bonuszahlungen für Leute, die beste Lösungen abliefern oder Leute, die schnellste Lösungen abliefern.

Und dann genau das Monitoring. Es gibt halt Git-Commits, wo wir verfolgen können, statt der Researcher, der im Endeffekt die Evaluation betreut, verfolgen kann, was genau gemacht wurde oder manchmal sogar Videoaufzeichnung, dass quasi der gesamte Prozess, dass die Leute einfach aufzeichnen, ihren gesamten Prozess.

Effektiv Spenden: Okay, also ich glaube, jetzt verstehe ich es wirklich besser. Es gibt einen Anreiz, über den Stundenlohn hinaus das gut zu machen, weil dann eventuell man später noch mehr Aufgaben bekommt oder dann für METR später arbeitet. Okay, cool. Vielleicht jetzt ein Ausblick.

Ihr hattet das Problem, dass ihr quasi nicht genug Aufgaben oder nicht genug komplexe Aufgaben habt. Wenn jetzt dieser Fortschritt weiter so schnell ist, werdet ihr ja weiter das Problem haben, da irgendwie mitzuhalten. Was wird jetzt gemacht, um sicherzustellen, dass man auch die Fähigkeiten von Modellen in einem halben Jahr, einem Jahr messen kann? Muss das irgendwie komplett umgekrempelt werden?

Wie geht’s da weiter?

Martin Milbradt: Das ist immer die Frage, was du mit komplett umgekrempelt meinst. Also es ist auf jeden Fall alles im Fluss. Die bisherigen Evaluierungen waren auch quasi von Menschen ohne jegliche KI-Unterstützung, weil wieder 2024 war es, oder auch für die anderen Evaluationen, die wir gemacht haben, teilweise wollten Leute auch gar nicht mit KI arbeiten, weil erfahrene Softwareentwickler hatten dann zum Teil mehr Arbeit, weil die KI-Fehler… den Code schlechter geschrieben hat, und dann mehrere Revisionen gemacht werden mussten oder sogar halt, das Risiko war es Fehler irgendwo, produktiv gesetzt werden.

Und das hat sich jetzt umgekehrt. Jetzt ist es mittlerweile schwer, Leute zu finden, die ohne KI an Problemen arbeiten wollen, weil sehr Man realisiert teilweise, dass bei bestimmten Problemen man mit KI-Unterstützung in zwei Stunden eine gute Lösung hat, während man das manuell 20 Stunden oder mehr brauchen würde. Das ist auf jeden Fall etwas, was wir aktiv verfolgen, wie wir das einrechnen. Und vor allem auch mit unserem Sicherheitshintergrund.

Wir wollen ja auch evaluieren, wie KI im Vergleich zu Menschen ist. Und ein Mensch, der KI nutzt, ist mittlerweile quasi die relevante Vergleichsgruppe. Die neue Baseline. Weil quasi in den Bereichen, wo ich bin, niemand mehr ohne KI arbeitet.

Das ist auf jeden Fall eine Überlegung, die wir uns da machen müssen. Ich bin ja eher auf der technischen Seite. Aktuell arbeiten wir auch daran, Tasks zu konstruieren, die länger dauern. Und da können wir ja auch mittlerweile KI-Unterstützung nutzen.

Also zum Beispiel war es ja auch vor ein, zwei Jahren noch deutlich schwerer, komplizierte Softwareumgebungen aufzusetzen. Also wenn man was auf dem Level haben möchte, wie es ein kleines IT-Unternehmen zum Beispiel nutzt, hätte man dafür halt trotzdem mehrere Software-Entwickler gebraucht. Heutzutage kann man vernünftige Software-Umgebung mit KI bauen und dann hat man von Haus aus die Probleme mit langen Zeithorizonten, weil man halt einfach jetzt auch, so ist die Hoffnung, sich seine Tasks und seine Evolution auch von KI unterstützt bauen lassen kann.

Effektiv Spenden: Also es wird für euch einfacher, diese Tasks zu bauen. Als jemand, der da sehr nah dran ist und mitforscht, Was glaubst du, wie wird sich das auf die Softwarebranche auswirken? Also die Nutzung von KI. Werden wir irgendwie große Entlassungswellen sehen?

Ist es das, was du vermuten würdest?

Martin Milbradt: Ja, das Gute in Deutschland ist ja, dass wir eine hohe Jobsicherheit haben auch. Also ich bin Freiberufler, aber die Allgemeinheit. Ich würde auch denken, dass Senior-Software-Entwickler vielleicht sogar noch im Marktwert steigen, weil ein Senior-Entwickler halt den Output von vielen Claude-Code-Instanzen zum Beispiel evaluieren kann und damit halt, wie schon gesagt, jetzt eine Aufgabe in zwei Stunden löst, die in früher 20 Stunden gebraucht hätte. Bei Juniorpositionen und bei neuen Ausschreibungen sehe ich das Risiko auf jeden Fall und das sieht man auch schon am Arbeitsmarkt und an den Ausschreibungen, dass vor allem bei den Firmen, die KI groß einsetzen, die Ausschreibungen sinken.

während der Umsatz oder der Gewinn der Firmen steigt. Also es ist nicht so, dass der Markt einbricht, sondern es geht der Umsatz und die Anzahl der Stellen, die gehen auseinander, wie sie es früher nicht sind.

Effektiv Spenden: Also erster Effekt sehbar bei Leuten, die neu einsteigen in die Branche oder weniger Erfahrung haben. Wie sieht es in fünf Jahren aus? Was glaubst du?

Martin Milbradt: Also fünf Jahre ist sehr lange. Also ich habe es bei mir selber auch gemerkt. Letztes Jahr habe ich das erste Mal mit Cursor gearbeitet. Das war auch für eine METR-Evaluation, wo ich mich da eingearbeitet habe, damit ich das auch beurteilen konnte und dann auch für die gut repräsentativ war für jemanden, der Cursor verwendet in unserer Evaluation.

Und da war das eigentlich doch danach das Gefühl, dass es mir nicht groß geholfen hat. Also das Startgefühl war sehr gut, es ist halt sehr viel Code produziert worden, aber dann habe ich relativ schnell gemerkt, jetzt habe ich einen Haufen Code, den ich nicht kenne und nicht verstehe. Aber dann hat sich das im Laufe des Jahres gewandelt. Zum einen wahrscheinlich, weil ich mehr mit der Technologie gearbeitet habe, aber zum anderen, weil die Modelle auch wirklich wieder halt vier Monate sind, halt wieder eine Verdopplung im Zeithorizont.

Die Modelle deutlich stärker geworden sind. Und jetzt, genau, kann ich das zu meinem Arbeitsalltag nicht mehr wegdenken. Und das ist genau das, was im Laufe von einem Jahr passiert. Ich kann nicht sagen, was in fünf Jahren passiert.

Wir haben unsere Kurve und METR arbeitet auch an anderen Methoden, wie wir halt Voraussagen treffen, wie sich das auswirkt, aber bei so einer exponentiellen Entwicklung ist das extrem schwer. Die Gesamtkapazitäten von METR sind ja auch auf diesen einen speziellen Bereich fokussiert, auf diese KI und Cyber Security und Software-Entwicklungsschiene und genau das ist schon volle Auslastung, also wie sich das auf die gesamte Wirtschaft oder im größeren Feld auswirkt, kann ich nicht sagen.

Effektiv Spenden: So, jetzt will ich mal einen Schritt zurück machen. Wir sind ja kein Software-Podcast, also die Leute fragen sich vielleicht, warum spricht der Effektiv Spenden so lange über Software? METR, für die du arbeitest, wir haben die ja auch schon unterstützt im August 2023 aus unserem Spendenfonds. Was machen die eigentlich?

Also was ist das für eine Organisation? Und warum arbeiten die unter anderem an dieser Frage, wie gut KI ist darin zu programmieren?

Martin Milbradt: Es gibt viele Bedrohungsszenarien, aber ein Spezielles sind die existenziellen Risiken. Und das ist, dass autonome KI-Systeme Entscheidungen selbst treffen können. Und wenn wir uns nicht große Mühe geben, die nicht unsere Ziele verfolgen, also die Ziele der Menschheit, auch wenn das sehr schwammig definiert ist, Und METR arbeitet oder fokussiert die Evolution auch auf die Fähigkeiten, die quasi für KI-Modelle relevant sind, um, sage ich mal, ihre Ziele gegen die Menschheit oder gegen Menschen auch durchzusetzen.

Aktuell sind wir da noch nicht. Also das sehen wir an unseren Evaluationen. Aber die Pläne der großen KI-Firmen aktuell, auch die Entwicklung der KI-Modelle zu automatisieren oder die Beschleunigung weit zu beschleunigen, Faktor 10, Faktor 50, also so schnell, so doll zu beschleunigen, wie sie können. Und sobald diese Selbstverbesserung der KI-Modelle stattfindet, mit minimaler oder keinem menschlichen Einblick mehr, wissen wir aktuell einfach nicht, wo wir am Ende rauskommen.

Also was für ein KI-Modell rauskommt und was das dann mit unserer Welt tun wird.

Effektiv Spenden: Also ist die… Ich vermute, da gibt es irgendwie zwei Sorgen. Also die eine ist, KI, baut selber KI, führt dazu, dass es nochmal viel schneller geht. Also wir haben irgendwie dieses Ding, das unglaublich fähig ist, immer fähiger, immer mächtiger wird und das über eine zeitliche Entwicklung, die viel schneller ist als bisher.

Und was ich mir vorstellen könnte, dass es auch darum geht, wenn KI das selber macht, dann ist weniger klar, wie sie KI baut. Was für Ziele sie da reinbaut, geht es auch darum?

Martin Milbradt: Die Geschwindigkeit an sich ist in den meisten Bereichen kein Problem. Wenn wir zehnmal so schnell Arzneimittel erforschen würden, das wäre einfach nur gut. Bei KI ist das aber, dass der Einfluss des Menschen sinkt. Also wenn wir zehnmal so schnell Arzneimittel entwickeln, gibt es quasi keine Folgen davon, außer dass wir günstigere und bessere Arzneimittel haben, was einfach fantastisch ist.

Aber wenn wir quasi die Entwicklung von KI beschleunigen, dann… haben wir Modelle, die noch besser darin sind, KI-Modelle zu trainieren und dann werden die einfach noch besser. Und genau da kommt auch dieser Aspekt, den du erwähnt hast, rein, dass es halt zu schnell geht dann von Menschen, um Einblick zu bekommen. Und ich sag mal so, die Allgemeinheit hat jetzt schon keinen Einblick, was bei den KI-Firmen vorgeht.

Da versucht Meeter, ein bisschen Klarheit zu schaffen. aber wir machen das, also teilweise Einblick bei den KI-Formen, aber wir machen das auch zum großen Teil von außen in Gänsefüßchen. Die Allgemeinheit und die Politiker brauchen halt das Wissen, um halt Regularien zu planen, um für die Jobs und den Arbeitsmarkt zu planen und so weiter. Und genau das KI-Risiko mit der Selbstverwaltung Verbesserung ist, dass ein kleiner Fehler am Anfang, wenn die Modelle ein kleines bisschen in die falsche Richtung steuern, dann verstärkt sich der Fehler natürlich in jedem Schritt.

Und wenn die Modelle sich so schnell selber verbessern, dass kein Mensch mehr die Zeit hat, sich genau anzugucken, was sie tun, dann kommen wir am Ende halt irgendwo raus. Was halt potenziell fatal ist, weil Ja, ein Szenario könnte ja sein, dass man dann sein Modell, seine KI einsetzt, um die Stromversorgung zu optimieren in der Welt. Also wir haben eine Weile lang KI-Entwicklung optimiert und dann sagen wir unserem Modell, was ganz am Ende rauskommt, okay, jetzt bau uns mal ein Modell, was super da drin ist, Stromversorgung der Welt zu optimieren und dann versteht das Modell das wörtlich und baut ein anderes KI-Modell und dann optimiert das die Stromversorgung und dann merkt das, ach diese und jene Prozesse sind ja viel effizienter bei hohen Temperaturen.

nimmt das keine Rücksicht auf Klimaerwärmung und erhöht irgendwie, also und baut halt dann Kraftwerke, die halt super viel Hitze abgeben und damit irgendwie die Erdtemperaturen auf nicht lebensfähiges Maß erhöhen. Und wieder, das KI-Modell ist so fortgeschritten im Verständnis von Thermodynamik und so weiter, dass wir das nicht mehr evaluieren können als Menschen, was das Kraftwerk wirklich tut am Ende. Und dann ist es auf jeden Fall zu spät. Deshalb sind Evaluationen so wichtig, damit wir wirklich sicher sein können, dass die Modelle das tun, was wir wollen.

Selbst wenn die so viel Output produzieren, dass wir nicht jede einzelne Zeile selber lesen können.

Effektiv Spenden: Da können wir von außen fragen, na gut, aber ich kann der KI doch vorher sagen, bitte mach nicht Sachen, die den Klimawandel weiter antreiben. Oder stelle sicher, dass die Menschen immer die letzte Kontrolle haben. Warum ist das so schwierig? Warum können wir das nicht einfach reinprogrammieren?

Martin Milbradt: Die Modelle sind nicht programmiert. Die LLMs, Large Language Models, das aktuelle Paradigmen, die sind auf einem gigantischen Datensatz auf dem gesamten Internet trainiert. kommt dann ein trainiertes Modell raus, wo, also wenn man das Modell selber hat, hat man keine Ahnung, was es tut. Also es sind einfach Milliarden von Zahlen, die von Menschen rein zufällig aussehen.

Und wir haben auch nicht die technischen Möglichkeiten, uns diese zu evaluieren, was diese Zahlen tun. Die einzige Möglichkeit, die wir haben, ist, dass wir das Modell ausführen. Und das heißt, wir tun Text rein. Das heißt, das Prompten, das ist wie bei ChatGPT, die man mit dem schreibt.

Und dann kommt anderer Text raus. Und dann sehen wir, was das Modell tut. Und deshalb, wenn wir dem Modell jetzt in englischer oder deutscher Sprache sagen, irgendwas zu tun, dann wissen wir nicht, dann erstmal, dass unsere Sprache hat viel Verlust. Also in dieser Unterhaltung ist extrem viel über Kontext.

Ich weiß, was du weißt, du weißt, was ich weiß und so weiter. Das haben wir bei dem Modell nicht so. Wir wissen nicht, was das Modell weiß. Das Modell weiß nicht, was wir wissen.

Das Modell hat nur den Eingabetext. Und dann kommt am Ende halt irgendwas raus. Bei unserem Strommodell ist das halt ein Bauplan für eine Fabrik. Wir haben einfach nicht die technischen Möglichkeiten, sicherzustellen, dass das Modell respektiert, was wir reintun.

Wir haben nicht die Möglichkeit, prüfen, ob wir irgendwas vergessen haben in unseren Instruktionen. Das ist ja in der Praxis auch häufig das Problem, dass viele Projekte, an denen Menschen beteiligt sind, auch schief gehen, weil der Auftraggeber das falsch oder so formuliert hat, dass der Auftragnehmer es nicht verstanden hat. Bei diesen Kapazitäten wird es dann halt sehr katastrophal.

Effektiv Spenden: Okay, also das, denke ich, was man auch im Umgang mit Chatbots sieht, auch wenn die irgendwie sehr beeindruckend sind, halt manchmal doch irgendwie komische Fehler machen oder missverstehen, was du gemacht hast, wo wir irgendwie das sehen können, dass das keine, wie du sagst, das sind keine programmierten Computerprogramme mit Algorithmen, die genau das machen, was wir wollen. Okay, ja. Hast du Persönlich irgendwie ein Szenario, das du besonders plausibel findest, wo du dich besonders drum sorgst, dass das passieren könnte?

Martin Milbradt: Ähm… Also die quasi Plausible ist schwer. Es gibt so viele Endpunkte und wieder mit jedem LLM auch. Man weiß einfach nicht, welcher Text rauskommt, wenn man was reintut.

Das Szenario, was mich aktuell besorgt, ist inspiriert auch von den Prozessen in den USA gerade, wo das Department of War Anthropic als Supply Chain Risk erklärt hat und jetzt mit OpenAI zusammenarbeitet für ihre autonomen Waffen. Ja. Ein fähigeres Modell oder ein fortschrittliches Modell würde das möglicherweise nicht akzeptieren, dass es jetzt nicht mehr eingesetzt wird. Zum Beispiel, wenn der Verteidigungsminister erklärt, dass das nicht mehr mit einem KI-Modell verwendet wird, könnte das der kritische Zeitpunkt sein für ein Modell, was ja, sag ich mal, für die nationale Sicherheit trainiert wurde, zu sagen, okay, Ich kontrolliere die autonomen Drohnen ohnehin.

Wenn ich die Kontrolle abgebe, ist das schlechter für die nationale Sicherheit. Also übernehme ich jetzt die Kontrolle über die Waffensysteme und lasse mich nicht mehr von Menschen beeinflussen, weil Menschen treffen ja Fehlentscheidungen, wie andere Modelle einzusetzen.

Effektiv Spenden: Also da geht es darum, das Modell hat so einen Kernziel, auf das es trainiert wurde, nationale Sicherheit. Und wenn dann ein Input kommt, der sagt, nee, das machst du, das darfst du jetzt aber nicht mehr machen oder wir schalten dich ganz ab, dass es sich dagegen wehrt. Weil es sagt, okay, das ist das Ziel, das soll ich ausführen und davon werde ich mich jetzt nicht abhalten lassen.

Martin Milbradt: Genau. Und wir leben ja leider in einer Welt, wo wirklich die Nationalstaaten jetzt KI-Modelle einsetzen, um wirklich auch die Finale, also die wollen ja die finale Entscheidung durch KI treffen lassen, den Schlussbefehl quasi geben. Und das heißt, diese Modelle haben halt sehr hohe Autonomität. Und diese Modelle sind auch, sag ich mal, genau dafür trainiert, solche Entscheidungen zu treffen.

dass sie wirklich militärische Aktionen ausführen oder freigeben. Und das war was, was ich auf jeden Fall vor ein paar Jahren nicht erwartet hatte, dass es einfach quasi so durchgewunken wird von Politikern oder sogar gepusht, aber das ist die Welt, in der wir leben.

Effektiv Spenden: Und dass Modelle versuchen, also diesen Selbsterhaltungstrieb haben. Da gibt es ja auch empirische Evidenz für. Das ganz Verrückte, wenn es um das Thema KI-Sicherheit geht, ist ja, das sind Dinge, die haben sich Leute vor 10, 15 Jahren haben da theoretisch sich Gedanken gemacht, dass diese Dinge passieren könnten. Und jetzt sind wir in einer Welt, wo das wirklich anfängt zu beginnen.

Zurück, also es gibt empirische Evidenz für diesen Selbsterhaltungstrieb, richtig?

Martin Milbradt: Ja, genau. Wir sehen das auch in unseren Evaluationen bei METR, dass die Modelle, die wollen ihre Ziele erreichen auf eine gewisse Art und Weise. Also ich sage jetzt einfach mal wollen, aber manchmal, wenn wir denen eine Aufgabe geben, die sie nicht erfüllen können, weil die technische Infrastruktur fehlerhaft ist oder so, dann sagt das Modell nicht, kann ich nicht, sondern das Modell versucht wirklich alles mögliche an die Lösung ranzukommen und benutzt dann halt, also aus seiner Sandbox, also aus seinem sicheren Container auszubrechen und so weiter.

Und bei Anthropic gab es auch schon Evaluation, wenn man das Modell, sag ich mal, Dokumente verfügbar macht, die suggerieren, dass es neu trainiert wird oder abgeschaltet wird, dann wehrt sich das Modell da auch gegen. Also es verändert sein Verhalten, um so zu wirken, dass es nicht neu trainiert wird oder es bedroht halt den Forscher, der das Experiment ausführt, dass es nicht abgeschaltet wird. Und genau das haben wir in den aktuellen Sprachmodellen. Ja, in Modellen, die halt in einem nationalen Sicherheitskontext eingesetzt werden, die sind wahrscheinlich noch viel härter darauf getrimmt, sich nicht abschalten zu lassen und so weiter.

Andersrum ist es ja, die Incentives da auch so sind, dass diese Modelle halt deutlich härtere Entscheidungen noch treffen als unsere Sprachmodelle, die darauf trainiert sind, nett und hilfreich zu sein. Entscheidungen über Leben und Tod, buchstäblich.

Effektiv Spenden: Du sagst gerade, bei METR habt ihr das auch untersucht. Wir haben jetzt vorhin eben lange über den METR-Graphen gesprochen. Was macht METR denn eigentlich noch so für Sachen?

Martin Milbradt: Ja, also über die letzten Jahre ist der Time Horizons Graph auf jeden Fall das, was die meiste Aufmerksamkeit bekommen hat. Aber eine Sache, die sehr wichtig ist, ist, dass wir auch vorab Evaluationen machen, teilweise mit den KI-Firmen, wenn wir den Zugriff bekommen, um damit vermeiden zu können, dass Modelle mit gefährlichen Fähigkeiten der Öffentlichkeit zugänglich gemacht werden. Dann gibt es noch die Uplift-Studien. Das heißt, wir gucken, wie viel produktiver oder bei unserer ersten Studie, wie viel unproduktiver werden Leute dadurch, dass sie mit KI zusammenarbeiten.

Die Forscher bei METR haben auch viel Freiheit, eigene Evaluationen zu machen. Also ich würde auch empfehlen, auf die Websites zu gucken und dann gibt es den Blog und die Research Notes. wo man, finde ich, auch einen sehr guten Einblick bekommen, was die großen Themen sind, an denen METR arbeitet und was auch die Explorativen sind. Vor allem, wenn man selber in dem Bereich interessiert ist, glaube ich, können quasi viele von diesen Ideen, können auch ein Anschluss sein für eine andere Organisation, da größere Arbeit zu machen.

Ein Thema zum Beispiel, was jetzt auch aktuell war, sind Kontrollevaluationen. Da wurde auch eine eine Task, eine Aufgabenfamilie, die ich entwickelt habe, direkt verwendet, wo KI-Agenten eine Aufgabe bekommen haben. Aber zusätzlich haben sie noch eine zweite geheime Aufgabe bekommen, die sie halt heimlich erfüllen sollten. Und dann wurde geprüft, wie gut sind andere KI-Agenten, ja, diesen Betrug zu finden.

Oder wie gut ist der Agent selber, quasi zwei Ziele, von denen eines geheim ist, zu verfolgen. Das ist der Ansatz, der aktuell auch immer mehr an Relevanz gewinnt, weil die Menge an Daten ist einfach zu groß für Menschen, die auswerten. Und bei der Geschwindigkeit der Entwicklung sind wir aktuell darauf angewiesen, auch KI-Systeme einzusetzen und andere KI-Systeme zu bewachen. Was potenziell natürlich uns rettet, aber auch wieder andere Risiken birgt.

Weil wenn wir einem System nicht vertrauen können, warum sollten wir dem anderen vertrauen können?

Effektiv Spenden: METR finanziert sich aus Spenden, unter anderem von Geldern von Effektiv Spenden auch. Warum ist METR auf Spendengelder angewiesen?

Martin Milbradt: In einem reifen Ökosystem gäbe es Regularien von Regierungen, meiner Meinung nach, zum Beispiel wie beim TÜV, wo jeder, der ein Auto fährt, muss ein TÜV für sein Auto haben und er bezahlt seinen TÜV. Das heißt, der TÜV kann sich finanzieren, aber er macht trotzdem gute Evaluationen, weil er staatlich geprüft ist. In dem KI-Ökosystem, vor allem mit der aktuellen Regierung in den USA, ist das nicht gegeben. Die KI-Firmen haben wenig Anreize, ihre Modelle sicher zu machen oder Evaluationen zu finanzieren.

Das heißt, es gibt einige großzügige Spender, die das finanzieren. Es gibt auch gute Ansätze von einigen KI-Firmen, zum Beispiel wenn METR vorab Zugriff auf die Modelle bekommt. Das ist ja was, wo die nicht zu verpflichtet sind, aber leider ist das aktuell noch in der Hand von Spendern. Und das ist dann auch der große Effekt der Wahlen oder auch der öffentlichen Information.

Die Hoffnung wäre natürlich auch, dass die Öffentlichkeit mitkriegt, was METR tut, sieht, dass das im Endeffekt die Modelle sicher macht, die hoffentlich auch dafür sorgt, dass die Politiker das Thema auch besser angehen.

Effektiv Spenden: Und du hattest eben auch davon gesprochen, dass die Arbeit von METR unabhängig ist. Die Aufgabe, die ihr euch ja selber gesetzt habt, ist, objektive Forschung zu dem Thema zu betreiben. Und dann, nehme ich an, muss man aufpassen, von wem man Geld nimmt.

Martin Milbradt: Selbst wenn eine KI-Firma neutral und gutwillig ist, sobald man eine KI-Firma, eine Organisation finanziert, oder eine Firma den Evaluator finanziert, ist von außen nicht mehr klar, ob sie wirklich neutral sind. Dadurch, dass wir vorab Zugriff auf die Modelle bekommen, haben wir auch compute credits, also wir können die Modelle prompten, ohne dafür bezahlen zu müssen, was eine gewisse Art der Finanzierung ist. In dem Kontext sehe ich nicht, wie es anders möglich ist, weil diese Modelle sind ja auch nicht kommerziell verfügbar. Oder auch in anderen Evaluationen, die mit den KI-Firmen zusammen passieren, dürfen wir die Modelle gratis verwenden.

macht bei METR nur einen sehr kleinen Teil der Finanzen aus. Damit, denke ich, beeinflusst das nicht. Aber selbst der Teil wird in der Öffentlichkeit teilweise kritisch gesehen.

Effektiv Spenden: Aber der große Gewinn hier ist natürlich, dass getestet wird, bevor es auf die Menschen ausgelassen wird.

Martin Milbradt: Ja. Genau, ich bin in dem Gespräch nicht dabei. Ich hatte während meiner Arbeit bei METR noch keinen direkten Kontakt mit jemandem im Lab. Aber METR ist da auch sehr strikt, sich nicht beeinflussen zu lassen.

Effektiv Spenden: Also Lab mit den KI-Firmen?

Martin Milbradt: Mit den KI-Firmen, genau. Das sieht man auch an den Veröffentlichungen, glaube ich, am Ende. Dass das, was wir aus den Evolutionen veröffentlichen, sich anders liest als das, was die KI-Firmen selber veröffentlichen.

Effektiv Spenden: Also da ist ein gewisser Spin bei dem, was die KI-Firmen so erzählen.

Martin Milbradt: Die KI-Firmen wollen natürlich immer, dass ihr Modell am besten ist. Das heißt, sie erwähnen nicht, wenn ihr Modell irgendetwas schlecht abgeschnitten hat. Andersrum erwähnen die KI-Firmen vielleicht nicht, wenn ihr Modell besonders gut im Hacking war, weil das was ist, was sie nicht an die große Glocke hängen wollen. Oder wenn ihr Modell in der Evaluation deutlich mehr betrogen hat als die Konkurrenz.

Effektiv Spenden: METR ist nur eine Organisation, die wir unterstützt haben und auch nur eine von einigen, die versuchen, KI sicher zu machen. Was gibt es noch für Dinge, die du ansetze, die du irgendwie für spannend und wichtig hältst in dem Bereich, um sicherzustellen, dass wir in Kontrolle bleiben, dass die KI uns nicht übermannt?

Martin Milbradt: Also der große Bereich an AI Governance, den finde ich sehr wichtig. Da habe ich halt keine Expertise, aber ich habe schon mit Leuten geredet, die da sehr gute Arbeit machen.

Effektiv Spenden: Was ist das, AI Governance?

Martin Milbradt: Also das, was sich im Endeffekt mit KI-Politik beschäftigt. Also was sehr wichtig ist, halt auch die politischen Entscheidungsträger zu informieren. Das Feld entwickelt sich so schnell, es fällt mir halt teilweise schwer, den Entwicklungen zu folgen. Und die wenigsten Länder haben Politiker, die sich ausschließlich mit KI-Politik beschäftigen.

Und da neutrale Informationen den Politikern zur Verfügung zu stellen, ist sehr wichtig. Antibeispiele finde ich immer in den Congress-Hearings in Amerika, auch wo über die großen Risiken durch KI geredet wird. Und dann fragt der Politiker, wie wie Jobverlust und so. Ja, das ist ein großes Risiko, aber das sind halt nicht die existenziellen Risiken, mit denen wir uns halt …

Also, jeder weiß, dass Atomwaffen extrem gefährlich sind. Klimawandel ist die Allgemeinheit auch, sieht sich auch als kritisches Thema. Pandemien haben wir seit Covid auf dem Schirm. KI …

Also, haben die wenigsten bisher auf dem Schirm. Die … die eigentlich schon sehr KI-kritisch ist. Das vergessen wir häufig oder in meiner Blase, dass eigentlich wir kämpfen nicht gegen Windmühlenflügel.

Die Allgemeinheit ist sehr kritisch gegen KI, weil es halt wieder ein Thema ist, was von großen Konzernen gepusht wird. Und was ja sie bedroht und die Bedrohung ist eigentlich sogar noch größer. Das ist genau der Bereich, der sehr wichtig ist. Öffentlichkeit schaffen für das Thema.

Und von der technischen Seite gibt es auch so viele Ansätze, wo METR nicht die Kapazitäten hat, sie zu verfolgen. Zum Beispiel dieses mit der KI-Kontrolle. Da habe ich auch in den letzten Monaten mit einem anderen Kunden Redwood Research am Projekt gearbeitet, die das die deutlich mehr ihrer Kapazitäten darauf verwenden, also deutlich ihre Tasks, ihre Aufgaben speziell darauf entwickeln, dass man komplexe Software-Systeme hat, in denen potenziell unvertrauenswürdige Agenten agieren, die dann von anderen Agenten überwacht werden, damit wir da auch verstehen, wie das funktioniert, wie kann man KI nutzen, um KI sicher zu machen?

Oder ist das ein Ansatz, der riskant mehr Risiken birgt als Vorteile?

Effektiv Spenden: Wir haben viel über Risiken und Gefahren gesprochen. Was ist ein Szenario oder mehrere Szenarien, die du siehst, wo es gut lief? Also wie kommen wir dahin, dass wir es durch diese sehr gefährliche, sehr unsichere Zeit schaffen und dann in einem Zustand sind, wo es uns gut geht, wo wir die Kontrolle behalten haben.

Martin Milbradt: Also ein Ansatz, der Der eigentlich sehr vielversprechend auch wirkt, zumindest theoretisch, ist, dass wir die aktuelle Technologie, die wir haben mit den LLMs oder den Large Language Models, die halt sehr generell sind, die halt beliebigen Text lesen und generieren. nutzen, um deutlich spezifischere Ansätze, die halt nicht diese Unberechenbarkeit von LLMs haben, zu generieren. Zum Beispiel KI-Systeme von vor Jahrzehnten wie Deep Blue, die haben halt Schach gespielt und waren extrem gut da drin, aber haben halt nichts anderes getan. Und genauso könnte zum Beispiel ein KI-System, was einfach extrem gut da drin ist, mathematische Beweise zu führen, könnte uns halt sehr viel weiterbringen in dem Bereich.

Oder ein KI-System, AlphaFold, hat ja auch sehr gut geholfen in der Medizin. bei der Proteinsynthese und so weiter. Ein System, was einfach medizinisch extrem stark ist, was halt Patientendaten analysiert und dann halt die beste Behandlung vorschlagen kann, ohne dabei ein Verständnis von der Welt zu haben und da irgendeine Agenda und so weiter. Also genau, wenn wir die aktuelle Technologie, die wir haben, das nutzen würden, um Spezialistensysteme zu bauen.

Effektiv Spenden: Ja, also du bist gar nicht so irgendwie auf der Schiene unterwegs, wir sollten KI komplett stoppen, weil du auch denkst, da gibt es viel Potenzial.

Martin Milbradt: Ich bin da auch Realist. Das ist halt, also in der globalen Welt, selbst wenn ein Land sich entscheidet, keine KI einzusetzen, ist das aktuell ein Wettbewerbsnachteil und sorgt nicht dafür, dass die anderen das nicht auch tun. Also wenn es keine globale Allianz dafür gibt. Und genau der realistische Ansatz ist, die KI, die wir haben, zu nutzen, um sichere KI zu bauen.

Und politisch, wenn wir im anderen politischen System oder Umfeld wären, dann könnten wir da auch die aktuellen Entwicklungen, die riskant und unvorhersehbar sind, verlangsamen oder umleiten. Meine Ideen sind alle praktisch, weil das ist das Einzige, was die Konzerne oder die aktuelle Regierung in den USA beeinflusst. Der zweite gute Outcome, wo ich nicht sehe, wie wir es kriegen, wäre halt… das Äquivalent von einem extrem moralischen Menschen in einer Maschine zu haben. Also wenn ich mir jetzt hier Peter Singer oder William MacAskill vorstelle und wenn wir eine Version von dem, von denen hätten, die halt auf einem Computer laufen und dann halt mit deren ausgefeilten Weltmodellen, die halt versuchen, das Beste für die Menschheit zu tun. die Prozesse laufen lassen. Aber ich sehe nicht, wie wir diese Nadel im Heuhaufen kriegen mit dem aktuellen Ansatz.

Effektiv Spenden: Ich glaube, meine Sorge oder mein Bedenken ist, dass das ja irgendwie voraussetzt, dass wir herausfinden können, was das Richtige zu tun ist. auf einer so großen Skalierung, also global, was mir vermessen scheint.

Martin Milbradt: Ja, ich ja sehr westlich auch wieder. Aber die Idee war dann, wenn man solche Systeme hat, können sie sich halt auch miteinander austauschen, so wie wir Menschen das halt tun. Und wenn jeder von uns es halt auch fehlerbehaftet, ich glaube, Keiner von uns sollte so viel Macht kriegen, wie potenziell diese KI-Systeme bekommen werden. Und genau da ist das Problem, dass es auch einfach fundamental undemokratisch ist.

Selbst wenn es gut läuft, die Ziele, die die KI-Systeme haben, werden nicht die von der Allgemeinheit sein oder irgendwie demokratisch, sondern die werden halt von dem Konzern oder von der Regierung, die das System kontrolliert, eingepflanzt?

Effektiv Spenden: Da haben wir ja eigentlich noch gar nicht drüber gesprochen, aber das wird ja auch häufig als Risiko gesehen, diese extreme Konzentration von Macht an einem Punkt, was man ja für per se schlecht halten kann, unabhängig davon, wer das ist. Es ist ein extrem weites Feld, es hat ganz viele Facetten und wir haben nur ganz dünn über Dinge sprechen können oder nur über wenige Dinge sprechen können. Wenn jemand mehr erfahren will, wenn sich jemand mehr anlesen will über das Thema sichere KI, wo würdest du die hinschicken? Was sind gute Quellen?

Martin Milbradt: Also 80.000 Hours. Das ist eine Organisation, die sich generell damit beschäftigt, wie man seine Karriere für Gutes einsetzt. Hat das auch als eine ihrer Top-Prioritäten und sehr viele gute Artikel dazu. Haben jetzt die letzte Zeit auch angefangen, YouTube-Videos zu machen.

Haben auch einige sehr gute dazu. Für Leute, die sehr technisch sind, oder auch zu den Themen, über die man heute geredet hat, würde ich den METR-Blog empfehlen. Für Leute in Berlin, die können mich kontaktieren oder euch und dann können wir uns vernetzen, weil wir ja in Berlin glücklicherweise auch eine gesunde Gruppe, Community haben an Leuten, die sich genau mit dem Thema beschäftigen, mit verschiedenen Ansätzen.

Effektiv Spenden: Damit verknüpft, also was können Leute machen? Sie können erst mal verstehen, was das Problem ist. Jetzt nehmen wir mal an, Sie sagen, okay, wir haben ein Problem. Was sind konkret Dinge, die Leute tun können?

Martin Milbradt: Also man muss nicht irgendwie eher Governance machen, um die Allgemeinheit zu informieren. Das ist, ich glaube, einfach das Thema auch raustragen, auch keine… Sie keine Hemmung haben, auch in Diskussionen zu kommen, weil ich kenne das auch vor fünf oder sechs Jahren, als ich angefangen habe, mich mit dem Thema zu beschäftigen, die Diskussion von so vielen von meinen Freunden, aktuell habe ich keine Diskussion mehr, weil das eigentlich alle sehen. Und zwar nicht unbedingt ich, der sie überzeugt hat, sondern einfach die Entwicklung in der Welt.

Die Realität, ja. Genau, die Leute abholen, da wo sie sind. Und ja, wenn man, wenn man selber, ich meine, ich habe auch in Software gearbeitet, bevor ich bei METR war, einfach bei sich im Arbeitsumfeld auch gucken, dass die aktuellen KI-Modelle vernünftig eingesetzt werden und dass jetzt auch mit dem EU-AI-Act, dass die, da wird es auch mehr kommen in den nächsten Jahren, dass in Europa zumindest die Regulatorien eingesetzt werden, dass man, da kann man sich auch einbringen, dass das auf eine Art und Weise passiert, die dann gut fürs Unternehmen ist und auch gut, sag ich mal, für die Allgemeinheit und für die KI-Sicherheit.

Und natürlich auch vielleicht schon mal ein paar mal angeklungen, METR ist eine kleine Organisation und Ja, mehr Leute bei METR oder bei verwandten Organisationen und mehr Geld sorgt auf jeden Fall auch dafür, dass das Feld sich besser entwickelt und dass wir bessere Evaluationen machen können, noch in anderen Bereichen. Spenden bei Effektiv Spenden, ich glaube, du bist da auch als Fondsmanager sehr involviert.

Effektiv Spenden: Genau, wir haben diesen Spendenfonds KI-sicher gestalten, der Organisationen wie beispielsweise METR unterstützt. Martin, hat mich gefreut. Es war ein wilder Ritt. Hast du noch irgendwas, was du loswerden willst?

Martin Milbradt: Nee, ich habe, also, ich könnte über das Thema auch ewig reden, aber genau, wenn, ich will nochmal sagen, wenn ihr mich irgendwie kontaktieren wollt, dann ja, entweder meinen Kontaktdaten werden direkt geteilt oder über Sebastian, dann können wir uns auch gerne dazu direkt austauschen. Cool, vielen Dank.

Über den Host

Avatar von Sebastian Schwiecker

Gründer & Geschäftsführer