OPEN BETA OPEN BETA
Lokale KI & LLM-Alternativen

KI lokal betreiben —
ohne Cloud-Abhängigkeit

YADS unterstützt lokale LLMs via Ollama und jeden OpenAI-kompatiblen Endpoint. Diese Seite dokumentiert jeden KI-Einsatzpunkt in YADS, welche LLMs verwendet werden und welche lokalen Modelle mit 24 GB VRAM optimal funktionieren.

13
KI-Einsatzpunkte
3
Unterstützte Cloud-Anbieter
100%
Durch lokale Modelle ersetzbar
24 GB
VRAM für beste lokale Modelle

KI-Einsatzpunkte in YADS

Jede Stelle im YADS-Quellcode, an der ein LLM aufgerufen wird, mit Zweck und unterstützten Anbietern.

# Feature Was das LLM tut Anbieter Standardmodelle Edition
1 Finding-Erklärung Erklärt ein einzelnes Security-Finding in verständlicher Sprache — Schweregrad, Auswirkung, Kontext OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
2 Massen-Erklärung Gleichzeitige KI-Erklärung mehrerer Findings — beschleunigt die Triage erheblich OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
3 Executive Summary Erzeugt eine C-Level-taugliche Zusammenfassung aller Scan-Ergebnisse — Risikobewertung, Kernprobleme, Empfehlungen OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
4 Natürlichsprachliche Suche Übersetzt Freitexteingaben ("zeige alle kritischen SSL-Probleme auf *.de-Domains") in strukturierte DB-Filter OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
5 JS Supply Chain Analyse Bewertet JavaScript-Bibliotheken auf Supply-Chain-Risiken — veraltete Versionen, bekannt kompromittierte Pakete OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
6 Banner-Analyse Analysiert Dienst-Banner (SSH, HTTP, SMTP) auf Versions-Disclosure und Verwundbarkeits-Indikatoren OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
7 Infrastruktur-Risikobewertung Aggregierte KI-Risikobewertung aller Scan-Daten für Reports — Risikoscore, Findings, Empfehlungen Ollama OpenAI Anthropic Custom llama3.2 / gpt-4o-mini / claude-haiku Enterprise
8 OSINT-Bedrohungsanalyse Synthetisiert OSINT-Daten (Datenlecks, Threat Intel, offene Buckets, CVEs) zu einem strukturierten Bedrohungsdossier Ollama OpenAI Anthropic Custom llama3.2 / gpt-4o-mini / claude-haiku Enterprise
9 Lateral Movement Vorhersage APT-Simulation — prognostiziert Angriffspfade durch gemeinsam genutzte Infrastruktur via Graph-Analyse Ollama OpenAI Anthropic Custom llama3.2 / gpt-4o-mini / claude-haiku Enterprise
10 KI-Modul-Generator (Lab) Generiert vollständige Python-Scanner-Module aus Security-Findings — 8192 Token Output-Budget OpenAI Anthropic Custom gpt-4o-mini / claude-haiku Enterprise
11 Predictive Threat Movement Vorhersage von Bedrohungsbewegungen auf Basis der Infrastruktur-Graphanalyse — per Tenant konfigurierbar Ollama OpenAI Anthropic Custom Tenant-konfiguriert Enterprise
12 Behebungsempfehlungen KI-generierte Schritt-für-Schritt-Anleitungen zur Behebung von Findings — Fallback auf regelbasierte Empfehlungen OpenAI Anthropic gpt-4o-mini / claude-haiku Enterprise
13 KI DNS-Bereinigung Automatisierte Verifizierung verwaister DNS-Einträge und Subdomain-Takeover — entkoppelt von der Finding-Erklärung Ollama OpenAI Anthropic qwen2.5-coder:7b / gpt-4o-mini Enterprise
🟢

OpenAI — gpt-4o-mini, gpt-4o

Standard-Provider für alle ai_assistant.py-Features

Verwendet für:

🔍 Finding-Erklärung 📋 Massen-Erklärung 📊 Executive Summary 🔎 NL-Suche 📦 JS Supply Chain 🏷️ Banner-Analyse 🧪 KI-Modul-Generator 🛡️ Behebungsempfehlungen

Lokale Alternativen mit 24 GB VRAM

Modell Parameter VRAM (Q4) Qualität für YADS Einschränkungen
Mistral Small 3.1 24B ~14 GB ★★★★
Kein natives Function-Calling — JSON-Output erfordert Format-Erzwingung
Schwächer bei komplexer Code-Generierung (KI-Modul-Lab)
~6 Tokens/Sek. — Massen-Erklärungen spürbar langsam
Qwen2.5-Coder 32B 32B ~20 GB ★★★★★
Auf Code optimiert — schwächer bei natürlichsprachlichen Security-Erklärungen
Langsam bei langen Prompts (Executive Summary mit vielen Findings)
Nahe VRAM-Limit — keine Parallelverarbeitung möglich
Llama 3.3 70B (Q2_K_S) 70B ~23 GB ★★★★
Extreme Quantisierung führt zu Qualitätsverlust — Halluzinationen nehmen zu
~2–3 Tokens/Sek. — für Echtzeit-Nutzung unpraktikabel
KI-Modul-Generator kann bei Q2 subtil fehlerhaften Code produzieren
🟡

Anthropic — claude-haiku-4-5, claude-sonnet-4-6

Paralleler Standard-Provider — per Tenant via llm_provider = "anthropic" konfigurierbar

Verwendet für:

🔍 Finding-Erklärung 📋 Massen-Erklärung 📊 Executive Summary 🔎 NL-Suche 📦 JS Supply Chain 🏷️ Banner-Analyse 🧪 KI-Modul-Generator 🛡️ Behebungsempfehlungen 📈 Token-Tracking (usage field)

Lokale Alternativen mit 24 GB VRAM

Modell Parameter VRAM (Q4) Qualität für YADS Einschränkungen
Mistral Nemo 12B 12B ~8 GB ★★★★★
Zu schwach für komplexe Reasoning-Tasks (OSINT-Synthese, Lateral Movement)
JSON-Adhärenz bei langen Prompts schlecht — in der Praxis Retries nötig
Nur für einfache Einzel-Finding-Erklärungen geeignet
DeepSeek-R1 32B 32B ~20 GB ★★★★★
Chinesischer Ursprung — mögliche DSGVO/Compliance-Bedenken im Enterprise-Kontext
Langsame Inferenz durch Chain-of-Thought Reasoning-Tokens
Thinking-Tokens blähen Token-Zählung auf, erscheinen aber nicht im Output
Gemma 3 27B 27B ~18 GB ★★★★
Gelegentliche JSON-Format-Fehler — YADS entfernt Markdown-Fences, Struktur kann trotzdem brechen
Schwächeres Security-Domain-Wissen als spezialisierte Modelle
Multimodale Weights belegen mehr VRAM als reine Text-Varianten
🟣

Ollama — llama3.2 und beliebige lokale Modelle

Primärer lokaler Provider für llm_service.py — vollständig selbst gehostet, keine Cloud-Abhängigkeit

Verwendet für:

📈 Infrastruktur-Risikobewertung 🕵️ OSINT-Bedrohungsanalyse 🗺️ Lateral Movement Vorhersage 🧪 KI-Modul-Generator 📡 Predictive Analytics

Empfohlene Modelle mit 24 GB VRAM

Modell Parameter VRAM (Q4) Qualität für YADS Einschränkungen
Llama 3.1 8B 8B ~5 GB ★★★★★
Zu klein für Lateral Movement Prediction und KI-Modul-Lab
JSON-Format häufig fehlerhaft bei komplexen Schemata
Nur für einfache Risiko-Summaries — nicht für Produktion empfohlen
Mistral Small 3.1 24B 24B ~14 GB ★★★★
Ollama liefert keine Token-Daten — KI-Kosten-Dashboard zeigt 0
Benötigt "format": "json" im Ollama-Request für validen JSON-Output
Gute Balance aus Qualität und Geschwindigkeit — empfohlener Einstieg
Qwen2.5-Coder 7B 7B ~5 GB ★★★★
Extrem schnell (50+ Tokens/Sek.) auf Consumer-Hardware
Perfekt für DNS-Bereinigung und einfache Finding-Erklärungen
Geringer VRAM-Footprint erlaubt paralleles Laden von Modellen
Qwen2.5 32B 32B ~20 GB ★★★★★
Nahe vollem VRAM — kein paralleles Modell-Loading möglich
VRAM-bewusstes Laden & Health-Checks erforderlich (durch YADS unterstützt)
Beste lokale Option für alle YADS-Tasks inkl. Code-Generierung
# Empfohlene Ollama-Konfiguration (docker-compose / System-Einstellungen)
LLM_PROVIDER = ollama
LLM_API_URL = http://ollama:11434
LLM_MODEL = qwen2.5:32b # beste Allround-Option bei 24 GB VRAM
# Für KI-Modul-Lab (Code-Generierung) empfohlen:
LLM_MODEL = qwen2.5-coder:32b

Allgemeine Einschränkungen lokaler Modelle

📊 Kein Token-Tracking

Ollama liefert keine Usage-Daten. Das KI-Kosten-Dashboard zeigt 0 Tokens und 0 Kosten für alle lokalen Modell-Aufrufe — Token-Tracking funktioniert nur mit OpenAI und Anthropic.

🔧 JSON-Output-Zuverlässigkeit

YADS erwartet streng formatiertes JSON von jedem KI-Aufruf. Kleinere Modelle brechen das Schema häufig. YADS entfernt Markdown-Fences automatisch, kann aber strukturell ungültiges JSON nicht reparieren.

⏱️ Latenz

24B+-Modelle laufen mit 4–8 Tokens/Sek. auf einer einzelnen Consumer-GPU. Executive Summaries und Massen-Erklärungen mit vielen Findings können 60–180 Sekunden dauern.

🧪 KI-Modul-Generator

Benötigt 8192+ Output-Token und starkes Instruction-Following. Modelle unter 24B scheitern zuverlässig daran, vollständige, syntaktisch korrekte Python-Module zu produzieren.

🔒 Datenschutz-Vorteil

Lokale Modelle verarbeiten keine Daten außerhalb der eigenen Infrastruktur. Scan-Ergebnisse, Domain-Namen und Findings verlassen das Netzwerk nie — ideal für DSGVO-sensible Umgebungen.

💡 Custom Endpoint

LLM_PROVIDER=custom und LLM_API_URL auf jeden OpenAI-kompatiblen Endpoint zeigen — LM Studio, vLLM, LocalAI oder llama.cpp mit HTTP-Server funktionieren alle.

🏠

Vollständige Privatsphäre — null Cloud-Abhängigkeit

YADS wurde von Grund auf so konzipiert, dass es ohne Cloud-KI funktioniert. Jedes KI-Feature hat entweder einen regelbasierten Fallback oder degradiert graceful, wenn kein LLM konfiguriert ist. YADS kann vollständig offline betrieben werden, mit einem eigenen GPU-Server via Ollama verbunden oder Cloud-APIs nur für bestimmte Features genutzt werden, während andere lokal bleiben. Die Entscheidung liegt bei dir — und die Umstellung erfordert nicht mehr als das Ändern von zwei Konfigurationswerten.

KI-Feature-Übersicht Installationsanleitung