J-Tec.de

«Weiss ich nicht» ist das beste neue Feature


geschätzt belegt geschätzt
Grafik: als Vektor gezeichnet

Anthropic hat am 1. September Claude Fable 5.1 veröffentlicht. Die Zahlen sind ordentlich: Beim Programmier-Test Terminal-Bench stieg die Trefferquote von 42 auf knapp 56 Prozent, bei wissenschaftlichen Aufgaben von rund 25 auf 53. Gleichzeitig kostet das Ganze bei typischen Aufgaben etwa ein Viertel weniger als der Vorgänger. Soweit die Pressemitteilung.

Interessanter finde ich drei Punkte, die deutlich unauffälliger daherkommen. Erstens hält sich das Modell an den Auftrag — und fragt nach, wenn etwas unklar ist, statt sich etwas auszudenken. Zweitens rechnet es bei Tabellen mit, statt die Zahlen einfach hinzuschreiben. Und drittens zeigt es, woher eine Angabe stammt, und markiert Schätzungen als Schätzungen.

Das klingt nach Kleinkram. Ist es aber nicht.

Wer schon einmal mit einer KI gearbeitet hat, kennt das eigentliche Problem. Es ist nicht, dass sie etwas falsch macht. Es ist, dass sie es mit derselben Selbstsicherheit falsch macht wie richtig. Eine erfundene Jahreszahl sieht exakt aus wie eine recherchierte. Man merkt es erst beim Nachprüfen — und wer ohnehin alles nachprüft, hätte es auch gleich selbst schreiben können.

Deshalb ist «kennzeichnet Schätzungen» in der Praxis mehr wert als zehn Prozentpunkte in irgendeinem Benchmark. Es verschiebt die Arbeit von «alles kontrollieren» auf «das Markierte kontrollieren». Das ist ungefähr der Unterschied zwischen einem Werkzeug und einem Praktikanten, hinter dem man herräumt.

Zwei Einschränkungen

Zwei Einschränkungen gehören dazu. Erstens bleibt eine gekennzeichnete Schätzung eine Schätzung — das Modell wird nicht richtiger, nur ehrlicher über die eigene Unsicherheit. Zweitens sind Benchmarks Benchmarks. Ob sich das im Alltag so anfühlt wie angekündigt, weiss man in ein paar Wochen (in der Regel liegt die Wahrheit irgendwo zwischen der Pressemitteilung und dem, was hinterher in den Foren steht).

Wer es ausprobieren möchte: Fable 5.1 läuft im Chat, in Cowork und in Claude Code. Auf den Pro-Plänen allerdings nur, solange Guthaben vorhanden ist. Das steht klein dabei, ändert die Rechnung aber deutlich.

Meiner Meinung nach ist der dritte Punkt der einzige, der wirklich zählt. Eine Maschine, die schneller antwortet, spart mir ein paar Minuten. Eine, die zugibt, wenn sie sich nicht sicher ist, spart mir das Nachprüfen. Und ehrlich gesagt hätte ich mir das schon vor Jahren gewünscht — allerdings nicht von einer Maschine, sondern von …

Die Ankündigung von Anthropic: Claude Fable 5.1 und Mythos 5.1

Zurück zum Tecshub KI-Blog