Bevor große Sprachmodelle (LLMs) Text verarbeiten können, zerlegen sie ihn in Einheiten wie Wörter oder Wortfragmente. Das LLM hinter ChatGPT zerlegt beispielsweise „LMU München“ in die drei Einheiten „LM“, „U“ und „München“, sodass es die einzelnen Buchstaben in „München“ nie direkt sieht. Dieser als Subwort-Tokenisierung bezeichnete Schritt macht LLMs zwar effizient, verursacht jedoch eine Reihe von Problemen, wie beispielsweise ein eingeschränktes Verständnis auf Zeichenebene. Modelle, die Text stattdessen Byte für Byte lesen (wobei grob ein Byte einem Buchstaben entspricht), vermeiden diese Probleme. In der Praxis sind sie jedoch noch keine brauchbare Alternative zu LLMs mit Subwort-Tokenisierung geworden.
In einer neuen Studie, die in der Fachzeitschrift Nature veröffentlicht wurde, haben Forschende der LMU, des Allen Institute for AI, der University of Cambridge, der University of Washington und des Imperial College London eine Methode entwickelt, die bestehende LLMs in Modelle auf Byte-Ebene umwandelt, ohne sie von Grund auf neu trainieren zu müssen. Diese „Byteifizierung“ erfordert weniger als ein Prozent des für ein solches Modell üblicherweise benötigten Trainingsaufwands und bewahrt weitgehend die Leistung des ursprünglichen LLMs, während gleichzeitig die Vorteile der Verarbeitung auf Byte-Ebene hinzukommen. Die daraus resultierenden Modelle übertreffen alle bisher veröffentlichten LLMs auf Byte-Ebene vergleichbarer Größe.
„Wir glauben, dass die ‚Byteifizierung‘ und LLMs auf Byte-Ebene im Allgemeinen das Potenzial haben, einige seit Langem bestehende Mängel von LLMs zu überwinden“, sagt Valentin Hofmann, Juniorprofessor für Informations- und Sprachverarbeitung mit Methoden der KI an der LMU München und Leiter der Studie. „Herkömmliche LLMs haben Schwierigkeiten mit Aufgaben, die Fähigkeiten auf Zeichenebene erfordern, wie zum Beispiel das Rückwärtsbuchstabieren eines Wortes. Unsere ‚byteifizierten‘ Modelle sind darin deutlich besser.“ Diese Fähigkeiten sind mehr als nur eine akademische Spielerei: „Eine gute Darstellung der Feinstruktur von Text ist in vielen Bereichen der Wissenschaft entscheidend, zum Beispiel bei der Arbeit mit Code oder biologischen Sequenzen“, erklärt Hofmann.
Die Forschenden hoffen, dass die Byteifizierung Modelle auf Byte-Ebene zu einer praktischen Alternative zu den heutigen LLMs macht und neue Forschungsrichtungen eröffnet. Die Modelle, der Code und die Trainingsdaten sind öffentlich zugänglich.
Benjamin Minixhofer, Tyler Murray, Tomasz Limisiewicz, Anna Korhonen, Luke Zettlemoyer, Noah A. Smith, Edoardo M. Ponti, Luca Soldaini & Valentin Hofmann: Retrofitting language models to operate over bytes. Nature 2026