KI lokal betreiben —
ohne Cloud-Abhängigkeit
YADS unterstützt lokale LLMs via Ollama und jeden OpenAI-kompatiblen Endpoint. Diese Seite dokumentiert jeden KI-Einsatzpunkt in YADS, welche LLMs verwendet werden und welche lokalen Modelle mit 24 GB VRAM optimal funktionieren.
KI-Einsatzpunkte in YADS
Jede Stelle im YADS-Quellcode, an der ein LLM aufgerufen wird, mit Zweck und unterstützten Anbietern.
| # | Feature | Was das LLM tut | Anbieter | Standardmodelle | Edition |
|---|---|---|---|---|---|
| 1 | Finding-Erklärung | Erklärt ein einzelnes Security-Finding in verständlicher Sprache — Schweregrad, Auswirkung, Kontext | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 2 | Massen-Erklärung | Gleichzeitige KI-Erklärung mehrerer Findings — beschleunigt die Triage erheblich | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 3 | Executive Summary | Erzeugt eine C-Level-taugliche Zusammenfassung aller Scan-Ergebnisse — Risikobewertung, Kernprobleme, Empfehlungen | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 4 | Natürlichsprachliche Suche | Übersetzt Freitexteingaben ("zeige alle kritischen SSL-Probleme auf *.de-Domains") in strukturierte DB-Filter | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 5 | JS Supply Chain Analyse | Bewertet JavaScript-Bibliotheken auf Supply-Chain-Risiken — veraltete Versionen, bekannt kompromittierte Pakete | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 6 | Banner-Analyse | Analysiert Dienst-Banner (SSH, HTTP, SMTP) auf Versions-Disclosure und Verwundbarkeits-Indikatoren | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 7 | Infrastruktur-Risikobewertung | Aggregierte KI-Risikobewertung aller Scan-Daten für Reports — Risikoscore, Findings, Empfehlungen | Ollama OpenAI Anthropic Custom | llama3.2 / gpt-4o-mini / claude-haiku |
Enterprise |
| 8 | OSINT-Bedrohungsanalyse | Synthetisiert OSINT-Daten (Datenlecks, Threat Intel, offene Buckets, CVEs) zu einem strukturierten Bedrohungsdossier | Ollama OpenAI Anthropic Custom | llama3.2 / gpt-4o-mini / claude-haiku |
Enterprise |
| 9 | Lateral Movement Vorhersage | APT-Simulation — prognostiziert Angriffspfade durch gemeinsam genutzte Infrastruktur via Graph-Analyse | Ollama OpenAI Anthropic Custom | llama3.2 / gpt-4o-mini / claude-haiku |
Enterprise |
| 10 | KI-Modul-Generator (Lab) | Generiert vollständige Python-Scanner-Module aus Security-Findings — 8192 Token Output-Budget | OpenAI Anthropic Custom | gpt-4o-mini / claude-haiku |
Enterprise |
| 11 | Predictive Threat Movement | Vorhersage von Bedrohungsbewegungen auf Basis der Infrastruktur-Graphanalyse — per Tenant konfigurierbar | Ollama OpenAI Anthropic Custom | Tenant-konfiguriert | Enterprise |
| 12 | Behebungsempfehlungen | KI-generierte Schritt-für-Schritt-Anleitungen zur Behebung von Findings — Fallback auf regelbasierte Empfehlungen | OpenAI Anthropic | gpt-4o-mini / claude-haiku |
Enterprise |
| 13 | KI DNS-Bereinigung | Automatisierte Verifizierung verwaister DNS-Einträge und Subdomain-Takeover — entkoppelt von der Finding-Erklärung | Ollama OpenAI Anthropic | qwen2.5-coder:7b / gpt-4o-mini |
Enterprise |
OpenAI — gpt-4o-mini, gpt-4o
Standard-Provider für alle ai_assistant.py-Features
Verwendet für:
Lokale Alternativen mit 24 GB VRAM
| Modell | Parameter | VRAM (Q4) | Qualität für YADS | Einschränkungen |
|---|---|---|---|---|
| Mistral Small 3.1 | 24B | ~14 GB | ★★★★★ |
Kein natives Function-Calling — JSON-Output erfordert Format-Erzwingung
Schwächer bei komplexer Code-Generierung (KI-Modul-Lab)
~6 Tokens/Sek. — Massen-Erklärungen spürbar langsam
|
| Qwen2.5-Coder 32B | 32B | ~20 GB | ★★★★★ |
Auf Code optimiert — schwächer bei natürlichsprachlichen Security-Erklärungen
Langsam bei langen Prompts (Executive Summary mit vielen Findings)
Nahe VRAM-Limit — keine Parallelverarbeitung möglich
|
| Llama 3.3 70B (Q2_K_S) | 70B | ~23 GB | ★★★★★ |
Extreme Quantisierung führt zu Qualitätsverlust — Halluzinationen nehmen zu
~2–3 Tokens/Sek. — für Echtzeit-Nutzung unpraktikabel
KI-Modul-Generator kann bei Q2 subtil fehlerhaften Code produzieren
|
Anthropic — claude-haiku-4-5, claude-sonnet-4-6
Paralleler Standard-Provider — per Tenant via llm_provider = "anthropic" konfigurierbar
Verwendet für:
Lokale Alternativen mit 24 GB VRAM
| Modell | Parameter | VRAM (Q4) | Qualität für YADS | Einschränkungen |
|---|---|---|---|---|
| Mistral Nemo 12B | 12B | ~8 GB | ★★★★★ |
Zu schwach für komplexe Reasoning-Tasks (OSINT-Synthese, Lateral Movement)
JSON-Adhärenz bei langen Prompts schlecht — in der Praxis Retries nötig
Nur für einfache Einzel-Finding-Erklärungen geeignet
|
| DeepSeek-R1 32B | 32B | ~20 GB | ★★★★★ |
Chinesischer Ursprung — mögliche DSGVO/Compliance-Bedenken im Enterprise-Kontext
Langsame Inferenz durch Chain-of-Thought Reasoning-Tokens
Thinking-Tokens blähen Token-Zählung auf, erscheinen aber nicht im Output
|
| Gemma 3 27B | 27B | ~18 GB | ★★★★★ |
Gelegentliche JSON-Format-Fehler — YADS entfernt Markdown-Fences, Struktur kann trotzdem brechen
Schwächeres Security-Domain-Wissen als spezialisierte Modelle
Multimodale Weights belegen mehr VRAM als reine Text-Varianten
|
Ollama — llama3.2 und beliebige lokale Modelle
Primärer lokaler Provider für llm_service.py — vollständig selbst gehostet, keine Cloud-Abhängigkeit
Verwendet für:
Empfohlene Modelle mit 24 GB VRAM
| Modell | Parameter | VRAM (Q4) | Qualität für YADS | Einschränkungen |
|---|---|---|---|---|
| Llama 3.1 8B | 8B | ~5 GB | ★★★★★ |
Zu klein für Lateral Movement Prediction und KI-Modul-Lab
JSON-Format häufig fehlerhaft bei komplexen Schemata
Nur für einfache Risiko-Summaries — nicht für Produktion empfohlen
|
| Mistral Small 3.1 24B | 24B | ~14 GB | ★★★★★ |
Ollama liefert keine Token-Daten — KI-Kosten-Dashboard zeigt 0
Benötigt
"format": "json" im Ollama-Request für validen JSON-OutputGute Balance aus Qualität und Geschwindigkeit — empfohlener Einstieg
|
| Qwen2.5-Coder 7B | 7B | ~5 GB | ★★★★★ |
Extrem schnell (50+ Tokens/Sek.) auf Consumer-Hardware
Perfekt für DNS-Bereinigung und einfache Finding-Erklärungen
Geringer VRAM-Footprint erlaubt paralleles Laden von Modellen
|
| Qwen2.5 32B | 32B | ~20 GB | ★★★★★ |
Nahe vollem VRAM — kein paralleles Modell-Loading möglich
VRAM-bewusstes Laden & Health-Checks erforderlich (durch YADS unterstützt)
Beste lokale Option für alle YADS-Tasks inkl. Code-Generierung
|
LLM_PROVIDER = ollama
LLM_API_URL = http://ollama:11434
LLM_MODEL = qwen2.5:32b # beste Allround-Option bei 24 GB VRAM
# Für KI-Modul-Lab (Code-Generierung) empfohlen:
LLM_MODEL = qwen2.5-coder:32b
Allgemeine Einschränkungen lokaler Modelle
📊 Kein Token-Tracking
Ollama liefert keine Usage-Daten. Das KI-Kosten-Dashboard zeigt 0 Tokens und 0 Kosten für alle lokalen Modell-Aufrufe — Token-Tracking funktioniert nur mit OpenAI und Anthropic.
🔧 JSON-Output-Zuverlässigkeit
YADS erwartet streng formatiertes JSON von jedem KI-Aufruf. Kleinere Modelle brechen das Schema häufig. YADS entfernt Markdown-Fences automatisch, kann aber strukturell ungültiges JSON nicht reparieren.
⏱️ Latenz
24B+-Modelle laufen mit 4–8 Tokens/Sek. auf einer einzelnen Consumer-GPU. Executive Summaries und Massen-Erklärungen mit vielen Findings können 60–180 Sekunden dauern.
🧪 KI-Modul-Generator
Benötigt 8192+ Output-Token und starkes Instruction-Following. Modelle unter 24B scheitern zuverlässig daran, vollständige, syntaktisch korrekte Python-Module zu produzieren.
🔒 Datenschutz-Vorteil
Lokale Modelle verarbeiten keine Daten außerhalb der eigenen Infrastruktur. Scan-Ergebnisse, Domain-Namen und Findings verlassen das Netzwerk nie — ideal für DSGVO-sensible Umgebungen.
💡 Custom Endpoint
LLM_PROVIDER=custom und LLM_API_URL auf jeden OpenAI-kompatiblen Endpoint zeigen — LM Studio, vLLM, LocalAI oder llama.cpp mit HTTP-Server funktionieren alle.