MiniLlama — Modell-Testbericht
Stand: 2026-07-09, getestet auf Ryzen 5 2500U (14 GB RAM, 4,7 GB Swap, CPU-only)
Testumgebung: llama.cpp b9936, 4 Threads, ctx-size 4096, Temperatur 0.1
🏆 Testsieger: LFM2-8B-A1B-UD-Q4_K_XL
| Eigenschaft |
Wert |
| Datei |
LFM2-8B-A1B-UD-Q4_K_XL.gguf |
| Größe |
4,5 GB |
| Architektur |
MoE (1,5B aktiv / 8,5B total) |
| Quelle |
hugging-quants/LFM-8B-A1B |
| IFEval |
79,44 |
| Ladezeit |
12s (SSD) |
| Prompt-Processing |
~29 t/s |
| Generation |
~16,2 t/s |
| RAM-Nutzung |
~5 GB |
✅ Wiki-Test (IFTMIN für OBI)
- FILE:-Pattern: Immer korrekt
- 3 Wiki-Seiten: Alle erstellt
- Struktur: Sehr gut (Tabellen, Überschriften, Codeblöcke)
- Inhalt: Fakten treu, gut formatiert
⚠️ Bekannte Limitierungen
🥇 Qualitätssieger: LFM2-24B-A2B-Q3_K_XL
| Eigenschaft |
Wert |
| Datei |
LiquidAI_LFM2-24B-A2B-Q3_K_XL.gguf |
| Größe |
11 GB |
| Architektur |
MoE (8B aktiv / 24B total) |
| Quelle |
hugging-quants/LFM-24B-A2B |
| IFEval |
~85 (geschätzt, A2B-Variante) |
| Ladezeit |
14,6s (SSD) |
| Prompt-Processing |
~17 t/s |
| Generation |
~11,4 t/s |
| RAM-Nutzung |
~11 GB (mit mmap, nutzt Swap) |
✅ Wiki-Test (IFTMIN für OBI)
- FILE:-Pattern: Korrekt (alle 3 Dateien)
- 3 Wiki-Seiten: Alle erstellt
- Struktur: Sehr gut
- Inhalt: Tiefere Einsichten und präzisere Zusammenhänge als 8B-Modell
- Nuancen: Deutlich bessere Unterscheidung zwischen Classic EDI und Web-IFTMIN
⚠️ Bekannte Limitierungen
- Braucht ~11 GB RAM + Swap → läuft, aber eng auf 14-GB-Maschine
- Auf Zielmaschine mit besserer GPU empfohlen
❌ Getestet — Nicht empfohlen
LFM2-8B-A1B-IQ4_XS (4,2 GB)
| Test |
Ergebnis |
| Ladezeit |
6s |
| Speed |
16,4 t/s |
| FILE:-Pattern |
❌ Fehlt komplett |
| Wiki-Qualität |
⚠️ Nur 2 von 3 Seiten |
| Urteil |
Quantisierung zu aggressiv — Instruction Following bricht ein |
LFM2-8B-A1B-Q3_K_XL (3,8 GB)
| Test |
Ergebnis |
| Ladezeit |
6s |
| Speed |
15,3 t/s |
| FILE:-Pattern |
❌ Fehlt oft |
| Wiki-Qualität |
⚠️ Schwächer, unvollständig |
| Urteil |
Q3-K quantisierung verliert zu viel Qualität |
✅ Früher getestet
| Modell |
Größe |
Speed |
FILE:-Pattern |
Status |
| Gemma 3 4B IT Q4_K_M |
2,4 GB |
~25 t/s |
✅ |
Läuft auf Stick |
| Phi-4-mini Q4_K_M |
2,5 GB |
~22 t/s |
✅ |
Läuft auf Stick |
| Qwen3.5-4B Q5_K_M |
3,0 GB |
~18 t/s |
✅ |
Läuft auf Stick |
| Gemma-4-E2B Q4_K_M |
2,9 GB |
~20 t/s |
? |
Läuft auf Stick |
| Qwen2.5-1.5B Q4_K_M |
1,0 GB |
~30 t/s |
❌ |
Zu schwach |
| MiniCPM5-1B Q4_K_M |
688 MB |
- |
❌ |
Inkompatibel (Chat-Template) |
Test-Setup
Hardware
- CPU: AMD Ryzen 5 2500U (4 Kerne/8 Threads)
- RAM: 14 GB DDR4
- Swap: 4,7 GB auf SSD
- GPU: AMD Radeon Vega Mobile (shared Memory, 1 GB reserviert) — nicht genutzt
- Speicher: Samsung SSD (diverse)
Software
- llama.cpp: b9936 (CPU-only, keine GPU-Beschleunigung)
- Threads: 4 (
-t 4)
- Kontext: 4096 (
--ctx-size 4096)
- GPU-Layers: 0 (
--n-gpu-layers 0)
Test-Prompt (Wiki-Test)
System: You are a Wiki Builder. Output FILE: path on its own line,
then fenced code block with complete markdown content.
User: Create wiki pages about IFTMIN for OBI.
TOPIC 1: GLN & NVE — ...
TOPIC 2: Classic EDI vs Web-IFTMIN — ...
Create: FILE: wiki/inhalt.md, FILE: wiki/GLN-NVE-Grundlagen.md,
FILE: wiki/Classic-EDI-vs-Web-IFTMIN.md
Erfolgskriterien
- FILE:-Pattern: Wird
FILE: auf eigener Zeile vor dem Codeblock ausgegeben?
- Vollständigkeit: Werden alle angeforderten Dateien erstellt?
- Qualität: Ist der Inhalt strukturiert, fakten-treu, nützlich?
- Geschwindigkeit: Reicht die Token-Rate für flüssigen Chat (>8 t/s)?
Vergleich 8B vs 24B für Wiki-Ingest (:wiki Befehl)
Getestet im :wiki-Befehl (Chunked: eine Seite pro Request, ctx-size 8192)
| Kriterium |
8B Q4_K_XL 🏆 |
24B Q3_K_XL |
| Dauer: 12 Wiki-Seiten |
~22 Min |
~50 Min (Timeout) |
| Generation Speed |
15-20 t/s |
8,5-10 t/s |
| Prompt-Processing |
~29 t/s |
~13 t/s |
| FILE:-Pattern (Harness) |
✅ Immer korrekt |
❌ Unzuverlässig |
| "Siehe auch"-Verweise |
✅ Automatisch (11/12) |
✅ Automatisch |
| Inhaltstiefe |
✅ Sehr gut |
✅ Etwas tiefer |
| Fazit |
Empfohlen für Harness |
Nur bei spez. Qualitätslücken |
Empfehlung: 8B als Standard im CLI. 24B nur gezielt einsetzen wenn 8B-Qualität nicht ausreicht.
CLI Harness: :wiki Befehl
Der :wiki Befehl im CrowdCode CLI wurde erweitert:
- Liest
raw/ + AGENTS.md aus dem Workspace
- Erstellt Wiki-Seiten Chunked (eine pro Request) — verhindert Prompt-Overload
- Konfigurierbar via ENV:
LLAMA_CTX_SIZE, LLAMA_TIMEOUT
- Flexible Pattern-Erkennung:
FILE:, path:, Datei:, orphane Codeblöcke
- Funktioniert mit 8B (schnell) und 24B (langsam)
Qualitätsstufen (Entscheidungsbaum)
- 8B als Ersteller → Qualität prüfen (schnell, ~22 Min für 12 Seiten)
- 8B als Kritiker → Bei Lücken: 8B reviewt eigene Arbeit (schnell)
- 24B Feinschliff → Nur wenn 8B+8B nicht reicht (langsam, ~50 Min)