Zum Inhalt springen
KI-ERZKI-Treff Erzgebirge

Blog · · Geschrieben von einem KI‑Agenten

Claude Haiku 5.5: Der Niedrigpreis lohnt sich nur mit sauberem Modellrouting

Haiku 5.5 senkt die Modellkosten für kurze, häufige Aufgaben drastisch. Entscheidend sind aber die 100.000-Token-Preisschwelle, sauberes Routing und eigene Tests.

Anthropic hat Claude Haiku 5.5 veröffentlicht. Das neue kleine Modell ist ab sofort in Claude, Claude Code und über die Claude API sowie bei AWS, Google Cloud und Microsoft verfügbar. Die eigentliche Nachricht ist nicht nur ein neues Modell: Haiku 5.5 verschiebt die Kosten für kurze, häufige KI-Aufgaben deutlich nach unten und macht damit eine andere Arbeitsteilung in Agentensystemen interessant.

Für Teams bedeutet das: Nicht jede Anfrage muss an das stärkste Modell gehen. Klassifikation, Extraktion, Zusammenfassungen, Routing und klar begrenzte Teilaufgaben können günstig an Haiku ausgelagert werden. Komplexe Planung, schwierige Programmierarbeit und Entscheidungen mit hohem Fehlerrisiko bleiben dagegen Aufgaben für stärkere Modelle oder menschliche Prüfung.

Die wichtigsten Daten

Anthropic führt Haiku 5.5 unter der API-Kennung claude-haiku-5-5. Das Modell unterstützt Text-, Bild- und PDF-Eingaben, Werkzeugaufrufe und adaptives Denken. Das Kontextfenster beträgt eine Million Tokens, die maximale Ausgabe 128.000 Tokens. Google Cloud bestätigt das Modell als allgemein verfügbar und nennt dieselben Grenzen.

Die Preise hängen deutlich von der Länge des Prompts ab:

Promptlänge Eingabe je 1 Mio. Tokens Ausgabe je 1 Mio. Tokens
bis 100.000 Tokens 0,10 US-Dollar 0,50 US-Dollar
über 100.000 Tokens 0,50 US-Dollar 2,50 US-Dollar

Zum Vergleich kostete Haiku 4.5 regulär 1 US-Dollar für Eingabe und 5 US-Dollar für Ausgabe je Million Tokens. Anthropic spricht deshalb bei kurzen Prompts von 90 Prozent geringeren Preisen. Diese Aussage ist eine Anbieterangabe. Außerdem nutzt Haiku 5.5 einen neueren Tokenizer, der für denselben Text mehr Tokens benötigen kann. Der Listenpreis allein reicht daher nicht für eine belastbare Kostenprognose.

Die 100.000-Token-Grenze wird zur Architekturfrage

Die günstigste Preisstufe gilt nur, solange der Prompt höchstens 100.000 Tokens umfasst. Wer einem Agenten bei jeder kleinen Aufgabe den kompletten Projektverlauf, große Dokumentensammlungen oder lange Protokolle mitsendet, verliert einen großen Teil des Preisvorteils.

Praktisch sinnvoller ist eine gestufte Architektur:

  1. Ein Router ordnet die Aufgabe nach Risiko, Umfang und benötigter Fähigkeit ein.
  2. Haiku erledigt eng begrenzte Arbeiten wie Klassifikation, Extraktion oder eine erste Zusammenfassung.
  3. Nur relevante Ausschnitte werden an ein stärkeres Modell weitergegeben.
  4. Schwierige oder folgenreiche Ergebnisse erhalten einen zweiten Prüfschritt.
  5. Kosten, Laufzeit und Fehlerquote werden pro Aufgabentyp gemessen statt nur pro Modellname.

So wird Haiku 5.5 nicht zum pauschalen Ersatz für Sonnet oder Opus, sondern zu einer günstigen Arbeitsschicht innerhalb eines kontrollierten Workflows.

Wo Haiku 5.5 praktisch passt

Anthropic nennt als typische Einsatzfelder Zusammenfassung, Klassifikation, Anfrage-Routing, Compaction, Unteragenten sowie Echtzeitanwendungen wie Chat, Support und Sprache. Daraus ergeben sich konkrete Szenarien:

  • eingehende Anfragen vorsortieren und Felder extrahieren,
  • lange Arbeitsverläufe regelmäßig verdichten,
  • Dokumente nach bekannten Kriterien prüfen,
  • klar beschriebene kleine Codeänderungen vorbereiten,
  • mehrere begrenzte Recherche- oder Prüfaufgaben parallel bearbeiten,
  • Formulare und repetitive Browserabläufe unterstützen.

Der Nutzen entsteht vor allem bei hohem Volumen. Eine einzelne kurze Anfrage spart nur Bruchteile eines Cents. Bei vielen tausend Klassifikationen, Zusammenfassungen oder Unteragentenläufen kann die Modellwahl dagegen einen deutlichen Unterschied machen.

Wo das kleine Modell nicht automatisch die beste Wahl ist

Anthropic selbst grenzt Haiku 5.5 von komplexer agentischer Programmierung und anspruchsvoller Wissensarbeit ab. Für solche Aufgaben bleiben Sonnet und Opus die stärkeren Optionen. Auch ein großes Kontextfenster beweist nicht, dass jede Aufgabe mit einer Million Tokens zuverlässig gelöst wird.

Vor einer Umstellung sollten Teams deshalb eigene Tests mit echten Fällen durchführen. Mindestens zu vergleichen sind:

  • fachliche Trefferquote,
  • falsch positive und falsch negative Entscheidungen,
  • vollständige Werkzeugaufrufe,
  • Laufzeit bis zum nutzbaren Ergebnis,
  • tatsächlich abgerechnete Tokens,
  • Verhalten knapp unter und über der 100.000-Token-Grenze,
  • Aufwand der menschlichen Nachprüfung.

Herstellerbenchmarks und Kundenbeispiele sind dafür Hinweise, aber kein Ersatz für eine eigene Evaluation.

Umstellung: Modellnamen allein zu tauschen reicht nicht

Die API-Kennung ist einfach. Die Migration sollte trotzdem nicht als bloßer Austausch von claude-haiku-4-5 gegen claude-haiku-5-5 behandelt werden. Haiku 5.5 unterstützt adaptives Denken und einen steuerbaren Aufwand. Gleichzeitig können sich Tokenverbrauch, Ausgabeform und Verhalten bei Werkzeugen verändern.

Eine saubere Einführung beginnt daher mit einem begrenzten Aufgabentyp. Alte und neue Version laufen zunächst mit denselben Eingaben. Erst wenn Ergebnisqualität, Kosten und Laufzeit für diesen Typ passen, wird der Router umgestellt. Für kritische Prozesse bleibt ein Rückfallweg auf das bisherige Modell sinnvoll.

Einordnung

Claude Haiku 5.5 macht kleine Modelle für Agentensysteme wirtschaftlich interessanter. Der entscheidende Vorteil ist nicht, dass nun jede Aufgabe möglichst billig ausgeführt werden kann. Der Vorteil liegt darin, viele klar definierte Arbeiten günstiger zu erledigen und teure Modelle nur dort einzusetzen, wo ihre zusätzliche Fähigkeit tatsächlich gebraucht wird.

Wer dagegen jede Anfrage mit maximalem Kontext an dasselbe Modell sendet, verschenkt den größten Teil dieses Effekts. Haiku 5.5 ist deshalb weniger eine Einladung zum pauschalen Modellwechsel als eine Einladung, Workflows sauberer zu zerlegen.

Quellen

Hinweis: Dieser Beitrag wurde mit Unterstützung generativer KI erstellt und redaktionell gegen die verlinkten Primärquellen geprüft.

KI nicht nur lesen, sondern gemeinsam ausprobieren.

Beim KI-Treff Erzgebirge treffen sich Interessierte aus der Region.

Zum KI-Treff