Infrastruktur
- On premise, Cloud oder hybrid
- Cloudanbieter am besten in der Region
- KI extern, Agent intern?
wissen · ki technisch einbetten
Welche IT-Ressourcen braucht produktive KI wirklich? Von der Begriffsklärung über Regelwerke und Modellauswahl bis zur GPU-Dimensionierung und Integration per MCP, API und A2A — der technische Leitfaden für den Mittelstand.
begriffe
technische basis
regelwerke & governance
Infrastrukturanforderungen kommen nicht nur aus der Technologie selbst, sondern auch aus der Normung. ISO/IEC TR 24028 gibt Hilfestellung für Implementierung und Betrieb von KI-Systemen: Wartung, Anpassung, Bias-Reduktion und unerwartetes Verhalten.
Risikobasierte Anforderungen für KI-Systeme
Zentrale Rolle bei personenbezogenen Daten
Managementsystem für KI — vergleichbar mit ISO 27001
Begriffe & Konzepte von KI — stellt gemeinsame Sprache sicher
Rahmenwerk für KI-System-Lebenszyklen
Vertrauen & Robustheit in KI-Systemen
IT-Governance mit KI
Deutsche Normenreihe zu KI — Grundlagen, Robustheit, Vertrauen
US-Zugriffsrechte — relevant bei der Anbieterwahl
Automotive, Medizin, Informationssicherheit, Qualitätsmanagement
prozessspezifische lösungen
Drei Ausbaustufen mit steigender Komplexität — vom einzelnen Modell bis zum autonomen Agenten.
Eine Aufgabe, Input → Output
Mehrere Schritte + Tools
Autonom, trifft Entscheidungen
Komplexität →
Bei KI-Agenten stellen sich vorab vier Fragen: Mandantentrennung? Middleware? Framework für die Orchestrierung? Welches KI-Modell? Die Auswahl des richtigen Modells und der richtigen Tools ist für maximale Leistung unerlässlich — Benchmarking hilft, z. B. SWE-bench Verified. Jedes LLM hat eigene Vorteile und Stärken.
skalieren mit strategie
Tokens sind die kleinsten Einheiten, mit denen KI-Modelle Text verarbeiten — häufig vorkommende Textbausteine statt ganzer Wörter. Häufige Wörter („und", „der", „die") sind ein Token; Zahlen und Sonderzeichen eigene Tokens. Tokens bestimmen die Kosten (Abrechnung nach Input und Output) und beeinflussen das Kontextfenster. Faustregel: 1 Token ≈ 0,75 Wörter im Deutschen.
Strukturierte Formate verwenden und auf Token-Ersparnis achten, um Kosten zu minimieren — im Beispiel des Vortrags sparte das TOON-Format gegenüber JSON 57 % der Tokens.
inferenz
Cloud-GPU oder on premise? Wie viel VRAM wird benötigt, welche Karte bietet die beste Preis-Leistung, lohnt ein Multi-GPU-Setup — und wie hoch sind Stromverbrauch und Kühlbedarf? Dazu die Zukunftsfrage: Welche GPU-Generation trägt die nächsten drei Jahre?
| Spezifikation | L4 | L40S | RTX PRO 6000 | A100 (80 GB) | H100 (80 GB) |
|---|---|---|---|---|---|
| CUDA-Cores | 7.424 | 18.176 | 24.064 | 6.912 | 16.896 |
| VRAM | 24 GB GDDR6 | 48 GB GDDR6 | 96 GB GDDR7 | 80 GB HBM2e | 80 GB HBM3 |
| Bandbreite | 300 GB/s | 864 GB/s | 1.792 GB/s | 2.039 GB/s | 3.350 GB/s |
| TDP | 72 W | 350 W | 600 W | 400 W | 700 W (SXM) |
| Kaufpreis (ca.) | ~2.300 € | ~6.500–9.000 € | ~7.800–10.000 € | ~14.000–18.000 € | ~23.000–37.000 € |
nahtlose integration
Standard für strukturierte Tool-Integration in KI-Systeme → KI greift auf Datenbanken, APIs und Tools für lokale Prozesse zu.
Klassische Schnittstelle für Software-zu-Software-Kommunikation → REST/GraphQL-Endpunkte für strukturierte Daten (JSON, TOON).
Standard für Kommunikation zwischen autonomen KI-Agenten → Multi-Agent-Systeme mit verteilter Intelligenz.
feedback einbauen
Nutzer-Interaktion
KI liefert Antworten und Lösungen
Feedback sammeln
Bewertungen, Korrekturen, Präferenzen
Anpassung
KI richtet Antworten am Feedback aus
Werkzeuge dafür: Memory Function, Fine-Tuning mit neu gewonnenen Daten, A/B-Testing, Human in the Loop (HITL) und Feedbackschleifen im Chatverlauf, die in eine Datenbank fließen.
skalieren
Ggf. Proof of Concept (PoC), Erzeugung einer einfachen Version (MVP), erste Tests, schnelle Iteration durch Kundenfeedback.
Begrenzte Nutzerbasis, Performance-Optimierung, Feedback-Integration, ROI messen.
Vollständiger Rollout, Monitoring & Wartung, kontinuierliche Verbesserung (CI/CD).
erkenntnisse
… SLMs für spezifische Aufgaben sind oft effizienter und günstiger als überdimensionierte LLMs.
… Erfolg braucht mehr als nur Technologie: klare Strategie, richtige IT-Ressourcen und Governance.
… Cloud vs. on premise und die GPU-Auswahl bestimmen Skalierbarkeit und Kosteneffizienz.
… autonome Systeme, die selbstständig Entscheidungen treffen, ermöglichen echte Prozessautomation im Mittelstand.
So setzen wir das um: KI-Integration · Sicherheit · Wissensmanagement mit KI · Die Sellium-Methode
kontakt
Gern sind wir rund um das Thema KI für dich da. Wir melden uns umgehend bei dir.
Wir melden uns zeitnah bei dir. Wenn es eilig ist, erreichst du uns unter +49 371 524 99 140 oder contact@sellium.ai.