Gentian ist Software für Multi-GPU-Produktivserver. Sie erweitert Inferenz und Training, auf einem Knoten oder auf mehreren, und läuft auf der NVIDIA-Hardware, die ein Kunde bereits besitzt. Gezeigt sind heute vLLM für Inferenz und Megatron für Training; der Ansatzpunkt ist nicht auf sie beschränkt. Weder eine Ersatzplattform noch ein besonderer Hardwaremodus ist nötig.
Gentian ist nach dem Enzian benannt – einer Wildblume, in Europa weit verbreitet, typisch für die Schweizer Alpen und in der traditionellen Medizin verwendet.
Drei Produktfähigkeiten
Längerer Kontext
Auf acht NVIDIA-B200-GPUs bediente Gentian 1,3 Millionen Token in fp16 und fp32, mit
bestandener numerischer Prüfung bei einem Residuum von 7,23e-6 gegen eine Toleranz von 0,03. Der
herkömmliche all_gather-Pfad erschöpfte den Gerätespeicher bei rund einer halben Million.
Dies ist ein Kapazitätsergebnis, kein Geschwindigkeitsergebnis. Dieser Punkt bei 1,3 Millionen Token ist eine nachgewiesene Untergrenze, keine Obergrenze: Der Referenz-Oracle selbst erschöpfte den Speicher erst darüber. Der Einsatzbereich für Context Parallelism beginnt dort, wo Tensor Parallelism die Zahl der KV-Heads übersteigt, oder bei MLA; für eine gewöhnliche Llama-70B-Konfiguration mit TP=8 wird aus diesem Mechanismus allein kein Vorteil behauptet.
Zwischengespeichertes Retrieval
Auf Llama-3.3-70B bei TP=8 auf 8×NVIDIA H100 und mit
gpu-memory-utilization=0.85 hielt Gentians kanonische Policy die Prefix-Cache-Trefferquote zwischen 95,29 % und 98,91 % über eine Erhebung von 10 auf 48 Dokumenten. Über
dieselbe Erhebung lag LRU zwischen 12,52 % und 2,67–2,92 %, den beiden Replikaten
bei 48 Dokumenten.
Das ist ein Ergebnis zur Stabilität der Trefferquote. Es ist weder ein Durchsatzverhältnis noch eine Geschwindigkeitsaussage. Der Wert liegt im serverseitigen Deployment: Das vLLM-Plugin setzt eine konsistente Reihenfolge ohne Engine-Fork, Client-Änderungen oder Abstimmung zwischen Tenants um. Der Ordnungsalgorithmus selbst wird nicht als neu beansprucht.
Ein Nachweis für jede Antwort
Jede Antwort kann einen signierten Nachweis tragen. Bei einer realen vLLM-Antwort auf serienmässiger NVIDIA-Blackwell-Hardware ohne Confidential-Computing-Modus signierte ein von cybiont kontrollierter Schlüssel erst, nachdem ein registriertes NVIDIA-Gerät eine frische, an diese Antwort gebundene Challenge beantwortet hatte. Der Nachweis blieb unabhängig prüfbar, nachdem Signierprozess und GPU-Pfad nicht mehr verfügbar waren.
Das Ergebnis belegt Geräteanwesenheit bei der Autorisierung. Es belegt weder, dass die GPU die Antwort berechnet hat, noch dass sie physisch lokal war. Firmware-Messungen wurden nicht bewertet, Widerruf wurde nicht geprüft, Anwesenheit war nicht durchgehend, und es wird keine Leistungseigenschaft belegt. Modell-, Eingabe- und Antwortfelder sind signierte Festlegungen, keine Ausführungsattestierung.
Gültigen und manipulierten Nachweis holen und offline prüfen.
Die Kapazitäts- und Cache-Zahlen oben sind berichtete Messungen; ihre Rohbündel werden auf dieser Website nicht veröffentlicht. Das Antwortnachweis-Paket ist das Ergebnis, das ein Besucher hier unabhängig wiederholen kann.
Integrationsschnittstelle und ihre Grenze
- vLLM-Inferenz: ein serverseitiger Plugin-Pfad ohne Engine-Fork oder Client-Änderungen sowie die durch das öffentliche Paket demonstrierte Sidecar-Anbindung des Antwortnachweises.
- Megatron-Training: ein Attention-Spec-Slot-Adapter, der über das reale Megatron-Core-
GPTModelaufgerufen wird, mit einem Training-Nachweisbaustein. - Topologie: Die Produktabdeckung umfasst Multi-GPU-Server mit einem oder mehreren Knoten. Die öffentlichen Zahlen auf dieser Seite stammen aus benannten Single-Node-Messungen mit acht GPUs.
Gentian ist bereit für ein bezahltes Kunden-Integrationspilotprojekt mit definierten Workloads, Geräten, Aussagen und Abnahmekriterien, das auf eine Qualifizierung für den Produktivbetrieb hinführt.
Silizium
Die Architektur existiert zweifach in Hardware: einmal durch den Physical-Design-Fluss eines 7-nm-Prozesses geführt, einmal auf einem FPGA, auf dem ein echtes Sprachmodell läuft. Beide Ausprägungen liefern korrekte Ergebnisse — womit „halten diese Invarianten dem Silizium stand" keine Frage mehr ist, sondern zwei Artefakte.
Neunzehn Logik-Makros bis zu DRC-sauberem GDS gehärtet, im akademischen 7-nm-PDK ASAP7: 6,03 mm² Floorplan. Logik; SRAM als Blackbox. Echte Physical-Design-Evidenz; kein Tape-out.
Auf AWS F2 (VU47P) führt das Narrow-Streaming-Mesh TinyLlama-1.1B durchgängig aus — alle zweiundzwanzig Decoder-Schichten über vier Mesh-Knoten, mit jeder Teilschicht im Datenpfad: RMSNorm, Q/K/V-Projektionen, RoPE, KV-Cache-Schreibzugriffe, Grouped-Query-Attention, Residuen, SwiGLU, dann finale Norm, Logits-Projektion und Sampling. Bei 125 MHz, mit geschlossenem Post-Route-Timing und null fehlerhaften Endpunkten von 1'096'820.
Das ausgegebene Token stimmt exakt mit der Referenzimplementierung überein. Diese Übereinstimmung ist der Nachweis, dass ein Pfad über zweiundzwanzig Schichten durchgängig korrekt ist — sie ist die Evidenz, nicht die Leistung.
Es ist eine funktionale Inbetriebnahme, kein Leistungsträger: Aussagen zu Durchsatz oder Latenz folgen daraus nicht. Davon getrennt — eine andere Fähigkeit, nicht Teil dieses Inferenzpfads — wird der Fold vom Host orchestriert, auf Basis von Beobachtungen aus dem FPGA. Auf dem FPGA selbst läuft der Fold nicht.
Zwei Ausprägungen einer Architektur. Gentian wird als Software ausgeliefert; dies ist die längerfristige Forschung an demselben Entwurf, deren öffentlichen Umfang der Forschungsindex beschreibt.
Einen Workload qualifizieren
Eine Evaluation beginnt mit einem benannten Workload: Modell, Geräteanzahl und -topologie, die Grenze, an die Sie heute stossen, und was als Ergebnis zählen würde. Daraus ergibt sich, ob die obige Evidenz auf Ihren Fall zutrifft; Aussage und Abnahmekriterien werden schriftlich vereinbart, bevor Integrationsarbeit beginnt. Zurück kommen eine abgegrenzte Integrationsbewertung und ein gemessenes Ergebnis unter den vereinbarten Bedingungen.
Schreiben Sie mit diesen fünf Angaben an pilot@cybiont.com — oder mit der Frage, die noch dazwischensteht.