Datum: 16. August 2026
Gentian by cybiont erweitert vLLM für Inferenz und Megatron für Training auf den NVIDIA-Multi-GPU-Servern, die eine Organisation bereits betreibt. Zwei öffentliche Ergebnisse — und etwas Drittes, das neu ist.
Mehr Kontext aus denselben acht GPUs
Auf acht NVIDIA-B200-GPUs bediente Gentian 1,3 Millionen Token in fp16 und fp32, mit
bestandener numerischer Prüfung bei einem Residuum von 7,23e-6 gegen eine Toleranz von 0,03. Der
herkömmliche all_gather-Pfad erschöpfte den Gerätespeicher bei rund einer halben Million.
Das ist ein Kapazitätsergebnis, kein Geschwindigkeitsergebnis.
Ein Cache, der hält, während der Bestand wächst
Auf Llama-3.3-70B bei TP=8 auf acht NVIDIA-H100-GPUs hielt die kanonische Policy die Prefix-Cache-Trefferquote zwischen 95,29 % und 98,91 % über eine Erhebung von 10 auf 48 Dokumente, bei demselben Speicherbudget von 0,85. Über dieselbe Erhebung fiel die LRU-Baseline von 12,52 % auf 2,67–2,92 %, den beiden Replikaten bei 48 Dokumenten.
Das ist Stabilität der Trefferquote, keine Durchsatzaussage.
Ein Transformer läuft in der Hardware
Auf AWS F2 (VU47P) führt das Narrow-Streaming-Mesh TinyLlama-1.1B durchgängig aus — alle zweiundzwanzig Decoder-Schichten über vier Mesh-Knoten, mit jeder Teilschicht im Datenpfad: RMSNorm, Q/K/V-Projektionen, RoPE, KV-Cache-Schreibzugriffe, Grouped-Query-Attention, Residuen, SwiGLU, dann finale Norm, Logits-Projektion und Sampling. Bei 125 MHz, mit geschlossenem Post-Route-Timing und null fehlerhaften Endpunkten von 1'096'820.
Das ausgegebene Token stimmt exakt mit der Referenzimplementierung überein. Diese Übereinstimmung ist der Nachweis, dass ein Pfad über zweiundzwanzig Schichten durchgängig korrekt ist — sie ist die Evidenz, nicht die Leistung.
Es ist eine funktionale Inbetriebnahme, kein Leistungsträger: Aussagen zu Durchsatz oder Latenz folgen daraus nicht. Der Fold wird vom Host orchestriert, auf Basis von Beobachtungen aus dem FPGA — auf dem FPGA selbst läuft der Fold nicht.
Neunzehn Makros bis DRC-sauberem GDS
Neunzehn Logik-Makros bis zu DRC-sauberem GDS gehärtet, im akademischen 7-nm-PDK ASAP7, über 6,03 mm² Logik-Floorplan. Logik; SRAM als Blackbox. Echte Physical-Design-Evidenz; kein Tape-out.
Beide Ausprägungen liefern korrekte Ergebnisse
Gentian stützt sich nicht mehr allein auf Argumentation auf Softwareebene. Es läuft auf den GPUs, die ein Kunde bereits besitzt, es führt ein echtes Sprachmodell in Hardware aus, und seine Logik hat die physikalische Implementierung durchlaufen. „Halten diese Invarianten dem Silizium stand" ist keine Frage mehr, sondern zwei Artefakte.
Software ist das, womit Sie heute arbeiten können. Das Hardwareprogramm ist längerfristige Forschung an demselben Entwurf.
Anfragen
Eine abgegrenzte Evaluation beginnt mit einem benannten Workload: Modell, Geräteanzahl und -topologie, die Grenze, an die Sie heute stossen, und was als Ergebnis zählen würde. Aussage und Abnahmekriterien werden schriftlich vereinbart, bevor Integrationsarbeit beginnt.
- Pilotprojekte und Integration: pilot@cybiont.com
- Investment und strategische Partnerschaft: investors@cybiont.com
- Forschung: research@cybiont.com
Die Gentian-Seite führt jedes Ergebnis mit seinen vollständigen Messbedingungen. Der signierte Antwortnachweis lässt sich offline in zwei Befehlen prüfen.