Zu Geek Stuff

Reflection kündigt Beam an: 501-Milliarden-Modell bleibt vorerst unter Verschluss

KI · Neuigkeiten · 06. Okt. 2026 · 4 Min. Lesezeit

Reflection AI stellt Beam als künftiges Open-Weight-Modell für Programmierung, Schlussfolgern und Agentenaufgaben vor. Die technischen Eckdaten sind groß, doch Gewichte, Model Card und Sicherheitsbericht sollen erst später im Oktober erscheinen.

Ein Open-Weight-Modell ohne veröffentlichte Gewichte

Reflection AI hat am späten 5. Oktober 2026 sein erstes eigenes Sprachmodell vorgestellt. Beam ist ein reines Textmodell mit einer Mixture-of-Experts-Architektur. Von insgesamt 501 Milliarden Parametern sollen bei jedem verarbeiteten Textbaustein 23 Milliarden aktiv sein. Das Unternehmen nennt Programmierung, mehrstufiges Schlussfolgern und den Einsatz als Werkzeug nutzender Agent als wichtigste Aufgaben.

Die Bezeichnung Open Weight beschreibt derzeit allerdings ein Versprechen, keinen fertigen Download. Beam befindet sich laut Reflection noch in abschließenden Sicherheitstests und Evaluationen. Interessenten können sich für einen begrenzten Frühzugang anmelden. Die vollständigen Gewichte, eine Model Card, der technische Bericht sowie Werkzeuge für Betrieb und Anpassung sollen erst später im Oktober unter Apache 2.0 erscheinen.

Diese zeitliche Trennung ist entscheidend. Bis zur tatsächlichen Veröffentlichung können unabhängige Entwickler weder die Gewichte prüfen noch nachvollziehen, ob Lizenz, Laufzeitumgebung und Dokumentation den angekündigten offenen Betrieb praktisch ermöglichen.

Wenig aktive Parameter bedeutet nicht automatisch ein kleines Modell

Bei einem Mixture-of-Experts-Modell werden für einen einzelnen Textbaustein nur ausgewählte Teile des Netzes berechnet. Beam aktiviert nach Herstellerangaben rund 23 Milliarden seiner 501 Milliarden Parameter. Das kann den Rechenaufwand pro Ausgabe senken, obwohl das gesamte Modell sehr viel Wissen und Spezialisierung in unterschiedlichen Expertenblöcken speichern soll.

Der Kniff spart aber nicht im gleichen Verhältnis Speicher. Für einen lokalen oder selbst betriebenen Einsatz müssen die Gewichte grundsätzlich verfügbar gehalten und zwischen Prozessoren oder Beschleunigern bewegt werden. Welche Hardware Beam tatsächlich benötigt, ist ohne Model Card, konkrete Präzisionsformate und Messwerte zum Speicherbedarf noch offen. Für den heimischen Gaming-PC klingt 501 Milliarden deshalb eher nach Rechenzentrum als nach neuer Desktop-App.

Reflection wirbt mit drei- bis viermal weniger Inferenzrechenaufwand gegenüber bestimmten größeren Vergleichsmodellen. Die eigene Methodik nutzt dafür eine Schätzung aus aktiven Parametern und erzeugten Textbausteinen. Sie lässt unter anderem die Verarbeitung langer Eingaben, kontextabhängige Attention-Kosten und den Aufwand des eigentlichen Serverbetriebs außen vor. Das ist eine interessante Effizienzangabe, aber noch keine gemessene Strom- oder Preisrechnung.

Die Benchmark-Tabelle zeigt Stärken und deutliche Grenzen

Reflection stellt Beam vor allem als Arbeitstier für Code und Agenten dar. In den eigenen Ergebnissen erreicht das Modell 80,9 Prozent auf SWE-bench Verified und 80,1 Punkte auf Terminal-Bench 2.1. Auf DeepSWE v1.1 liegt Beam mit 44,4 Punkten knapp über dem von Reflection aufgeführten Wert für GLM-5.2, aber deutlich hinter neueren Vergleichsmodellen wie GLM-5.3, Kimi K3 und DeepSeek V4.1 Flash.

Auch bei Werkzeugnutzung und allgemeinen Wissenstests ergibt sich kein einheitlicher Vorsprung. Einige Resultate sind stark, andere liegen sichtbar hinter den besten Modellen der Vergleichstabelle. Mehrere Felder bleiben zudem leer, weil konkurrierende Anbieter keine Werte gemeldet haben. Aus einer solchen Tabelle lässt sich daher kein allgemeiner Sieg ableiten.

Die Ergebnisse stammen bislang vom Hersteller und wurden noch nicht unabhängig bestätigt. Erst reproduzierbare Tests mit den veröffentlichten Gewichten können zeigen, wie Beam mit anderen Laufzeitumgebungen, realen Codebasen, deutschen Aufgaben und langen Agentenläufen umgeht.

Training im industriellen Maßstab

Nach Angaben des Unternehmens wurde das Basismodell mit 23,8 Billionen Textbausteinen aus Webinhalten, öffentlichen Quellen und lizenzierten Datensätzen vortrainiert. Für die anschließende Verstärkung durch Reinforcement Learning erzeugte Reflection mehr als 100 Millionen Trainingsläufe. Dafür seien vier Wochen lang 10.500 Nvidia-GB300-GPUs eingesetzt worden.

Das Modell soll Kontexte von bis zu einer Million Textbausteinen verarbeiten können. Beim großen Verstärkungslauf waren die Trainingsumgebungen laut Reflection auf höchstens 256.000 Textbausteine ausgelegt. Solche Maximalwerte sagen allein wenig darüber aus, wie zuverlässig ein Modell wichtige Details über sehr lange Dokumente hinweg findet. Dafür fehlen noch unabhängige Langzeittests.

Auch die Sicherheitsbewertung ist noch nicht öffentlich. Reflection beschreibt ein separates Training für Sicherheit und Ausrichtung sowie Tests mit schädlichen, mehrstufigen und werkzeugbasierten Szenarien. Die konkreten Resultate will das Unternehmen erst mit dem technischen Bericht vorlegen.

Relevant wird Beam erst beim zweiten Teil der Veröffentlichung

Beam ist für die Open-Weight-Landschaft interessant, weil ein finanzstarkes US-Labor ausdrücklich mit preisgünstigen und anpassbaren Modellen aus China konkurrieren will. Für Unternehmen können selbst kontrollierte Gewichte Vorteile bei Datenschutz, Anpassung und Abhängigkeit von einzelnen API-Anbietern bieten. Diese Vorteile entstehen jedoch erst, wenn Gewichte, Lizenz und brauchbare Betriebswerkzeuge tatsächlich verfügbar sind.

Die Ankündigung liefert damit einen überprüfbaren Fahrplan, aber noch kein fertiges Open-Weight-Paket. Der wichtige Termin ist nicht der Tag der Präsentation. Entscheidend wird der Tag sein, an dem Entwickler Beam herunterladen, betreiben und gegen die großen Versprechen testen können.

00:00 / 00:00