MiniLlama/MODELS.md
xray c1a984b22b update: 24B/8B Modell-Tests, :wiki-Befehl, wiki-Doku, Modell-Vergleich
- MODELS.md: 8B vs 24B Vergleich, :wiki-Doku, Entscheidungsbaum
- README.md: 24B mit ⚠️ Manuell markiert (FILE:-Pattern unzuverlässig)
- SESSION_HANDOVER.md: Neue Session 14:30-18:00
- TEST_SCENARIO.md: Referenz-Testszenario
- crowdcode.js: 24B-Kompatibilität (flexible FILE:-Erkennung,
  :wiki-Befehl, configurable Timeout/GPU/Context via ENV,
  Streaming AbortController, Orphan-Codeblock-Detection)
2026-07-10 09:42:29 +02:00

5.4 KiB

MiniLlama — Modell-Testbericht

Stand: 2026-07-09, getestet auf Ryzen 5 2500U (14 GB RAM, 4,7 GB Swap, CPU-only) Testumgebung: llama.cpp b9936, 4 Threads, ctx-size 4096, Temperatur 0.1


🏆 Testsieger: LFM2-8B-A1B-UD-Q4_K_XL

Eigenschaft Wert
Datei LFM2-8B-A1B-UD-Q4_K_XL.gguf
Größe 4,5 GB
Architektur MoE (1,5B aktiv / 8,5B total)
Quelle hugging-quants/LFM-8B-A1B
IFEval 79,44
Ladezeit 12s (SSD)
Prompt-Processing ~29 t/s
Generation ~16,2 t/s
RAM-Nutzung ~5 GB

Wiki-Test (IFTMIN für OBI)

  • FILE:-Pattern: Immer korrekt
  • 3 Wiki-Seiten: Alle erstellt
  • Struktur: Sehr gut (Tabellen, Überschriften, Codeblöcke)
  • Inhalt: Fakten treu, gut formatiert

⚠️ Bekannte Limitierungen

  • Keine

🥇 Qualitätssieger: LFM2-24B-A2B-Q3_K_XL

Eigenschaft Wert
Datei LiquidAI_LFM2-24B-A2B-Q3_K_XL.gguf
Größe 11 GB
Architektur MoE (8B aktiv / 24B total)
Quelle hugging-quants/LFM-24B-A2B
IFEval ~85 (geschätzt, A2B-Variante)
Ladezeit 14,6s (SSD)
Prompt-Processing ~17 t/s
Generation ~11,4 t/s
RAM-Nutzung ~11 GB (mit mmap, nutzt Swap)

Wiki-Test (IFTMIN für OBI)

  • FILE:-Pattern: Korrekt (alle 3 Dateien)
  • 3 Wiki-Seiten: Alle erstellt
  • Struktur: Sehr gut
  • Inhalt: Tiefere Einsichten und präzisere Zusammenhänge als 8B-Modell
  • Nuancen: Deutlich bessere Unterscheidung zwischen Classic EDI und Web-IFTMIN

⚠️ Bekannte Limitierungen

  • Braucht ~11 GB RAM + Swap → läuft, aber eng auf 14-GB-Maschine
  • Auf Zielmaschine mit besserer GPU empfohlen

Getestet — Nicht empfohlen

LFM2-8B-A1B-IQ4_XS (4,2 GB)

Test Ergebnis
Ladezeit 6s
Speed 16,4 t/s
FILE:-Pattern Fehlt komplett
Wiki-Qualität ⚠️ Nur 2 von 3 Seiten
Urteil Quantisierung zu aggressiv — Instruction Following bricht ein

LFM2-8B-A1B-Q3_K_XL (3,8 GB)

Test Ergebnis
Ladezeit 6s
Speed 15,3 t/s
FILE:-Pattern Fehlt oft
Wiki-Qualität ⚠️ Schwächer, unvollständig
Urteil Q3-K quantisierung verliert zu viel Qualität

Früher getestet

Modell Größe Speed FILE:-Pattern Status
Gemma 3 4B IT Q4_K_M 2,4 GB ~25 t/s Läuft auf Stick
Phi-4-mini Q4_K_M 2,5 GB ~22 t/s Läuft auf Stick
Qwen3.5-4B Q5_K_M 3,0 GB ~18 t/s Läuft auf Stick
Gemma-4-E2B Q4_K_M 2,9 GB ~20 t/s ? Läuft auf Stick
Qwen2.5-1.5B Q4_K_M 1,0 GB ~30 t/s Zu schwach
MiniCPM5-1B Q4_K_M 688 MB - Inkompatibel (Chat-Template)

Test-Setup

Hardware

  • CPU: AMD Ryzen 5 2500U (4 Kerne/8 Threads)
  • RAM: 14 GB DDR4
  • Swap: 4,7 GB auf SSD
  • GPU: AMD Radeon Vega Mobile (shared Memory, 1 GB reserviert) — nicht genutzt
  • Speicher: Samsung SSD (diverse)

Software

  • llama.cpp: b9936 (CPU-only, keine GPU-Beschleunigung)
  • Threads: 4 (-t 4)
  • Kontext: 4096 (--ctx-size 4096)
  • GPU-Layers: 0 (--n-gpu-layers 0)

Test-Prompt (Wiki-Test)

System: You are a Wiki Builder. Output FILE: path on its own line,
        then fenced code block with complete markdown content.

User: Create wiki pages about IFTMIN for OBI.
      TOPIC 1: GLN & NVE — ...
      TOPIC 2: Classic EDI vs Web-IFTMIN — ...
      Create: FILE: wiki/inhalt.md, FILE: wiki/GLN-NVE-Grundlagen.md,
              FILE: wiki/Classic-EDI-vs-Web-IFTMIN.md

Erfolgskriterien

  1. FILE:-Pattern: Wird FILE: auf eigener Zeile vor dem Codeblock ausgegeben?
  2. Vollständigkeit: Werden alle angeforderten Dateien erstellt?
  3. Qualität: Ist der Inhalt strukturiert, fakten-treu, nützlich?
  4. Geschwindigkeit: Reicht die Token-Rate für flüssigen Chat (>8 t/s)?

Vergleich 8B vs 24B für Wiki-Ingest (:wiki Befehl)

Getestet im :wiki-Befehl (Chunked: eine Seite pro Request, ctx-size 8192)

Kriterium 8B Q4_K_XL 🏆 24B Q3_K_XL
Dauer: 12 Wiki-Seiten ~22 Min ~50 Min (Timeout)
Generation Speed 15-20 t/s 8,5-10 t/s
Prompt-Processing ~29 t/s ~13 t/s
FILE:-Pattern (Harness) Immer korrekt Unzuverlässig
"Siehe auch"-Verweise Automatisch (11/12) Automatisch
Inhaltstiefe Sehr gut Etwas tiefer
Fazit Empfohlen für Harness Nur bei spez. Qualitätslücken

Empfehlung: 8B als Standard im CLI. 24B nur gezielt einsetzen wenn 8B-Qualität nicht ausreicht.

CLI Harness: :wiki Befehl

Der :wiki Befehl im CrowdCode CLI wurde erweitert:

  • Liest raw/ + AGENTS.md aus dem Workspace
  • Erstellt Wiki-Seiten Chunked (eine pro Request) — verhindert Prompt-Overload
  • Konfigurierbar via ENV: LLAMA_CTX_SIZE, LLAMA_TIMEOUT
  • Flexible Pattern-Erkennung: FILE:, path:, Datei:, orphane Codeblöcke
  • Funktioniert mit 8B (schnell) und 24B (langsam)

Qualitätsstufen (Entscheidungsbaum)

  1. 8B als Ersteller → Qualität prüfen (schnell, ~22 Min für 12 Seiten)
  2. 8B als Kritiker → Bei Lücken: 8B reviewt eigene Arbeit (schnell)
  3. 24B Feinschliff → Nur wenn 8B+8B nicht reicht (langsam, ~50 Min)