MiniLlama/MODELS.md
xray c1a984b22b update: 24B/8B Modell-Tests, :wiki-Befehl, wiki-Doku, Modell-Vergleich
- MODELS.md: 8B vs 24B Vergleich, :wiki-Doku, Entscheidungsbaum
- README.md: 24B mit ⚠️ Manuell markiert (FILE:-Pattern unzuverlässig)
- SESSION_HANDOVER.md: Neue Session 14:30-18:00
- TEST_SCENARIO.md: Referenz-Testszenario
- crowdcode.js: 24B-Kompatibilität (flexible FILE:-Erkennung,
  :wiki-Befehl, configurable Timeout/GPU/Context via ENV,
  Streaming AbortController, Orphan-Codeblock-Detection)
2026-07-10 09:42:29 +02:00

158 lines
5.4 KiB
Markdown

# MiniLlama — Modell-Testbericht
> Stand: 2026-07-09, getestet auf **Ryzen 5 2500U** (14 GB RAM, 4,7 GB Swap, CPU-only)
> Testumgebung: llama.cpp b9936, 4 Threads, ctx-size 4096, Temperatur 0.1
---
## 🏆 Testsieger: LFM2-8B-A1B-UD-Q4_K_XL
| Eigenschaft | Wert |
|---|---|
| **Datei** | `LFM2-8B-A1B-UD-Q4_K_XL.gguf` |
| **Größe** | 4,5 GB |
| **Architektur** | MoE (1,5B aktiv / 8,5B total) |
| **Quelle** | [hugging-quants/LFM-8B-A1B](https://huggingface.co/hugging-quants/LFM-8B-A1B) |
| **IFEval** | 79,44 |
| **Ladezeit** | 12s (SSD) |
| **Prompt-Processing** | ~29 t/s |
| **Generation** | ~16,2 t/s |
| **RAM-Nutzung** | ~5 GB |
### ✅ Wiki-Test (IFTMIN für OBI)
- **FILE:-Pattern:** Immer korrekt
- **3 Wiki-Seiten:** Alle erstellt
- **Struktur:** Sehr gut (Tabellen, Überschriften, Codeblöcke)
- **Inhalt:** Fakten treu, gut formatiert
### ⚠️ Bekannte Limitierungen
- Keine
---
## 🥇 Qualitätssieger: LFM2-24B-A2B-Q3_K_XL
| Eigenschaft | Wert |
|---|---|
| **Datei** | `LiquidAI_LFM2-24B-A2B-Q3_K_XL.gguf` |
| **Größe** | 11 GB |
| **Architektur** | MoE (8B aktiv / 24B total) |
| **Quelle** | [hugging-quants/LFM-24B-A2B](https://huggingface.co/hugging-quants/LFM-24B-A2B) |
| **IFEval** | ~85 (geschätzt, A2B-Variante) |
| **Ladezeit** | 14,6s (SSD) |
| **Prompt-Processing** | ~17 t/s |
| **Generation** | ~11,4 t/s |
| **RAM-Nutzung** | ~11 GB (mit mmap, nutzt Swap) |
### ✅ Wiki-Test (IFTMIN für OBI)
- **FILE:-Pattern:** Korrekt (alle 3 Dateien)
- **3 Wiki-Seiten:** Alle erstellt
- **Struktur:** Sehr gut
- **Inhalt:** Tiefere Einsichten und präzisere Zusammenhänge als 8B-Modell
- **Nuancen:** Deutlich bessere Unterscheidung zwischen Classic EDI und Web-IFTMIN
### ⚠️ Bekannte Limitierungen
- Braucht ~11 GB RAM + Swap → läuft, aber eng auf 14-GB-Maschine
- Auf Zielmaschine mit besserer GPU empfohlen
---
## ❌ Getestet — Nicht empfohlen
### LFM2-8B-A1B-IQ4_XS (4,2 GB)
| Test | Ergebnis |
|---|---|
| Ladezeit | 6s |
| Speed | 16,4 t/s |
| FILE:-Pattern | ❌ **Fehlt komplett** |
| Wiki-Qualität | ⚠️ Nur 2 von 3 Seiten |
| **Urteil** | Quantisierung zu aggressiv — Instruction Following bricht ein |
### LFM2-8B-A1B-Q3_K_XL (3,8 GB)
| Test | Ergebnis |
|---|---|
| Ladezeit | 6s |
| Speed | 15,3 t/s |
| FILE:-Pattern | ❌ **Fehlt oft** |
| Wiki-Qualität | ⚠️ Schwächer, unvollständig |
| **Urteil** | Q3-K quantisierung verliert zu viel Qualität |
---
## ✅ Früher getestet
| Modell | Größe | Speed | FILE:-Pattern | Status |
|---|---|---|---|---|
| Gemma 3 4B IT Q4_K_M | 2,4 GB | ~25 t/s | ✅ | Läuft auf Stick |
| Phi-4-mini Q4_K_M | 2,5 GB | ~22 t/s | ✅ | Läuft auf Stick |
| Qwen3.5-4B Q5_K_M | 3,0 GB | ~18 t/s | ✅ | Läuft auf Stick |
| Gemma-4-E2B Q4_K_M | 2,9 GB | ~20 t/s | ? | Läuft auf Stick |
| Qwen2.5-1.5B Q4_K_M | 1,0 GB | ~30 t/s | ❌ | Zu schwach |
| MiniCPM5-1B Q4_K_M | 688 MB | - | ❌ | Inkompatibel (Chat-Template) |
---
## Test-Setup
### Hardware
- **CPU:** AMD Ryzen 5 2500U (4 Kerne/8 Threads)
- **RAM:** 14 GB DDR4
- **Swap:** 4,7 GB auf SSD
- **GPU:** AMD Radeon Vega Mobile (shared Memory, 1 GB reserviert) — nicht genutzt
- **Speicher:** Samsung SSD (diverse)
### Software
- **llama.cpp:** b9936 (CPU-only, keine GPU-Beschleunigung)
- **Threads:** 4 (`-t 4`)
- **Kontext:** 4096 (`--ctx-size 4096`)
- **GPU-Layers:** 0 (`--n-gpu-layers 0`)
### Test-Prompt (Wiki-Test)
```text
System: You are a Wiki Builder. Output FILE: path on its own line,
then fenced code block with complete markdown content.
User: Create wiki pages about IFTMIN for OBI.
TOPIC 1: GLN & NVE — ...
TOPIC 2: Classic EDI vs Web-IFTMIN — ...
Create: FILE: wiki/inhalt.md, FILE: wiki/GLN-NVE-Grundlagen.md,
FILE: wiki/Classic-EDI-vs-Web-IFTMIN.md
```
### Erfolgskriterien
1. **FILE:-Pattern:** Wird `FILE:` auf eigener Zeile vor dem Codeblock ausgegeben?
2. **Vollständigkeit:** Werden alle angeforderten Dateien erstellt?
3. **Qualität:** Ist der Inhalt strukturiert, fakten-treu, nützlich?
4. **Geschwindigkeit:** Reicht die Token-Rate für flüssigen Chat (>8 t/s)?
---
## Vergleich 8B vs 24B für Wiki-Ingest (`:wiki` Befehl)
> Getestet im `:wiki`-Befehl (Chunked: eine Seite pro Request, ctx-size 8192)
| Kriterium | 8B Q4_K_XL 🏆 | 24B Q3_K_XL |
|-----------|-------------|--------------|
| **Dauer: 12 Wiki-Seiten** | **~22 Min** | ~50 Min (Timeout) |
| **Generation Speed** | 15-20 t/s | 8,5-10 t/s |
| **Prompt-Processing** | ~29 t/s | ~13 t/s |
| **FILE:-Pattern (Harness)** | ✅ Immer korrekt | ❌ Unzuverlässig |
| **"Siehe auch"-Verweise** | ✅ Automatisch (11/12) | ✅ Automatisch |
| **Inhaltstiefe** | ✅ Sehr gut | ✅ Etwas tiefer |
| **Fazit** | **Empfohlen für Harness** | Nur bei spez. Qualitätslücken |
**Empfehlung:** 8B als Standard im CLI. 24B nur gezielt einsetzen wenn 8B-Qualität nicht ausreicht.
## CLI Harness: `:wiki` Befehl
Der `:wiki` Befehl im CrowdCode CLI wurde erweitert:
- Liest `raw/` + `AGENTS.md` aus dem Workspace
- Erstellt Wiki-Seiten Chunked (eine pro Request) — verhindert Prompt-Overload
- Konfigurierbar via ENV: `LLAMA_CTX_SIZE`, `LLAMA_TIMEOUT`
- Flexible Pattern-Erkennung: `FILE:`, `path:`, `Datei:`, orphane Codeblöcke
- Funktioniert mit 8B (schnell) und 24B (langsam)
### Qualitätsstufen (Entscheidungsbaum)
1. **8B als Ersteller** → Qualität prüfen (schnell, ~22 Min für 12 Seiten)
2. **8B als Kritiker** → Bei Lücken: 8B reviewt eigene Arbeit (schnell)
3. **24B Feinschliff** → Nur wenn 8B+8B nicht reicht (langsam, ~50 Min)