Zum Inhalt springen

Gentian – Messwerte und Integrationsgrenzen

Gentian-Programm-Mark

Gentian ist Software für Multi-GPU-Produktivserver. Sie erweitert Inferenz und Training, auf einem Knoten oder auf mehreren, und läuft auf der NVIDIA-Hardware, die ein Kunde bereits besitzt. Gezeigt sind heute vLLM für Inferenz und Megatron für Training; der Ansatzpunkt ist nicht auf sie beschränkt. Weder eine Ersatzplattform noch ein besonderer Hardwaremodus ist nötig.

Gentian ist nach dem Enzian benannt – einer Wildblume, in Europa weit verbreitet, typisch für die Schweizer Alpen und in der traditionellen Medizin verwendet.

Drei Produktfähigkeiten

Längerer Kontext

Auf acht NVIDIA-B200-GPUs bediente Gentian 1,3 Millionen Token in fp16 und fp32, mit bestandener numerischer Prüfung bei einem Residuum von 7,23e-6 gegen eine Toleranz von 0,03. Der herkömmliche all_gather-Pfad erschöpfte den Gerätespeicher bei rund einer halben Million.

Dies ist ein Kapazitätsergebnis, kein Geschwindigkeitsergebnis. Dieser Punkt bei 1,3 Millionen Token ist eine nachgewiesene Untergrenze, keine Obergrenze: Der Referenz-Oracle selbst erschöpfte den Speicher erst darüber. Der Einsatzbereich für Context Parallelism beginnt dort, wo Tensor Parallelism die Zahl der KV-Heads übersteigt, oder bei MLA; für eine gewöhnliche Llama-70B-Konfiguration mit TP=8 wird aus diesem Mechanismus allein kein Vorteil behauptet.

Zwischengespeichertes Retrieval

Auf Llama-3.3-70B bei TP=8 auf 8×NVIDIA H100 und mit gpu-memory-utilization=0.85 hielt Gentians kanonische Policy die Prefix-Cache-Trefferquote zwischen 95,29 % und 98,91 % über eine Erhebung von 10 auf 48 Dokumenten. Über dieselbe Erhebung lag LRU zwischen 12,52 % und 2,67–2,92 %, den beiden Replikaten bei 48 Dokumenten.

Das ist ein Ergebnis zur Stabilität der Trefferquote. Es ist weder ein Durchsatzverhältnis noch eine Geschwindigkeitsaussage. Der Wert liegt im serverseitigen Deployment: Das vLLM-Plugin setzt eine konsistente Reihenfolge ohne Engine-Fork, Client-Änderungen oder Abstimmung zwischen Tenants um. Der Ordnungsalgorithmus selbst wird nicht als neu beansprucht.

Ein Nachweis für jede Antwort

Jede Antwort kann einen signierten Nachweis tragen. Bei einer realen vLLM-Antwort auf serienmässiger NVIDIA-Blackwell-Hardware ohne Confidential-Computing-Modus signierte ein von cybiont kontrollierter Schlüssel erst, nachdem ein registriertes NVIDIA-Gerät eine frische, an diese Antwort gebundene Challenge beantwortet hatte. Der Nachweis blieb unabhängig prüfbar, nachdem Signierprozess und GPU-Pfad nicht mehr verfügbar waren.

Das Ergebnis belegt Geräteanwesenheit bei der Autorisierung. Es belegt weder, dass die GPU die Antwort berechnet hat, noch dass sie physisch lokal war. Firmware-Messungen wurden nicht bewertet, Widerruf wurde nicht geprüft, Anwesenheit war nicht durchgehend, und es wird keine Leistungseigenschaft belegt. Modell-, Eingabe- und Antwortfelder sind signierte Festlegungen, keine Ausführungsattestierung.

Gültigen und manipulierten Nachweis holen und offline prüfen.

Die Kapazitäts- und Cache-Zahlen oben sind berichtete Messungen; ihre Rohbündel werden auf dieser Website nicht veröffentlicht. Das Antwortnachweis-Paket ist das Ergebnis, das ein Besucher hier unabhängig wiederholen kann.

Integrationsschnittstelle und ihre Grenze

  • vLLM-Inferenz: ein serverseitiger Plugin-Pfad ohne Engine-Fork oder Client-Änderungen sowie die durch das öffentliche Paket demonstrierte Sidecar-Anbindung des Antwortnachweises.
  • Megatron-Training: ein Attention-Spec-Slot-Adapter, der über das reale Megatron-Core-GPTModel aufgerufen wird, mit einem Training-Nachweisbaustein.
  • Topologie: Die Produktabdeckung umfasst Multi-GPU-Server mit einem oder mehreren Knoten. Die öffentlichen Zahlen auf dieser Seite stammen aus benannten Single-Node-Messungen mit acht GPUs.

Gentian ist bereit für ein bezahltes Kunden-Integrationspilotprojekt mit definierten Workloads, Geräten, Aussagen und Abnahmekriterien, das auf eine Qualifizierung für den Produktivbetrieb hinführt.

Silizium

Die Architektur existiert zweifach in Hardware: einmal durch den Physical-Design-Fluss eines 7-nm-Prozesses geführt, einmal auf einem FPGA, auf dem ein echtes Sprachmodell läuft. Beide Ausprägungen liefern korrekte Ergebnisse — womit „halten diese Invarianten dem Silizium stand" keine Frage mehr ist, sondern zwei Artefakte.

Neunzehn Logik-Makros bis zu DRC-sauberem GDS gehärtet, im akademischen 7-nm-PDK ASAP7: 6,03 mm² Floorplan. Logik; SRAM als Blackbox. Echte Physical-Design-Evidenz; kein Tape-out.

Auf AWS F2 (VU47P) führt das Narrow-Streaming-Mesh TinyLlama-1.1B durchgängig aus — alle zweiundzwanzig Decoder-Schichten über vier Mesh-Knoten, mit jeder Teilschicht im Datenpfad: RMSNorm, Q/K/V-Projektionen, RoPE, KV-Cache-Schreibzugriffe, Grouped-Query-Attention, Residuen, SwiGLU, dann finale Norm, Logits-Projektion und Sampling. Bei 125 MHz, mit geschlossenem Post-Route-Timing und null fehlerhaften Endpunkten von 1'096'820.

Das ausgegebene Token stimmt exakt mit der Referenzimplementierung überein. Diese Übereinstimmung ist der Nachweis, dass ein Pfad über zweiundzwanzig Schichten durchgängig korrekt ist — sie ist die Evidenz, nicht die Leistung.

Es ist eine funktionale Inbetriebnahme, kein Leistungsträger: Aussagen zu Durchsatz oder Latenz folgen daraus nicht. Davon getrennt — eine andere Fähigkeit, nicht Teil dieses Inferenzpfads — wird der Fold vom Host orchestriert, auf Basis von Beobachtungen aus dem FPGA. Auf dem FPGA selbst läuft der Fold nicht.

Zwei Ausprägungen einer Architektur. Gentian wird als Software ausgeliefert; dies ist die längerfristige Forschung an demselben Entwurf, deren öffentlichen Umfang der Forschungsindex beschreibt.

Einen Workload qualifizieren

Eine Evaluation beginnt mit einem benannten Workload: Modell, Geräteanzahl und -topologie, die Grenze, an die Sie heute stossen, und was als Ergebnis zählen würde. Daraus ergibt sich, ob die obige Evidenz auf Ihren Fall zutrifft; Aussage und Abnahmekriterien werden schriftlich vereinbart, bevor Integrationsarbeit beginnt. Zurück kommen eine abgegrenzte Integrationsbewertung und ein gemessenes Ergebnis unter den vereinbarten Bedingungen.

Schreiben Sie mit diesen fünf Angaben an pilot@cybiont.com — oder mit der Frage, die noch dazwischensteht.

Einen Workload qualifizieren →