# MAPA — żeby się nie pogubić (stan 2026-09-02)

> Nazwy, którymi mówimy o potoku (TEKST, PLAN, GŁOS, OBRAZ, SKŁADACZ, RENDER + KONTROLA): `SLOWNIK.md`.
> Jedna kartka. Cel: **tysiące, dziesiątki tysięcy filmów.** Faza: testujemy składniki i mierzymy, na ile skalują.
> Nie wybieramy dziś jednej metody — różne treści mogą dostać różne potoki. Szczegóły są w dokumentach niżej,
> ta kartka mówi tylko: CO mamy, W JAKIM STANIE, GDZIE to leży.

## Składniki sosu (metody) i ich stan

| składnik | do czego | stan | dowód / gdzie |
|---|---|---|---|
| **Silnik + kontrakt** (wytwórnia) | treści przewidywalne: zadania maturalne, importy gotowych scenariuszy | PRODUKCJA, 108 filmów; tryb „dowolny tekst" nieprzetestowany | `misc/wytwornia` (HANDOFF, KARTA_JAKOSCI, ledgery) |
| **Agent Opus pisze planszę** (fabryka V2) | treści schematowe z choreografią autorską, styl kanału | PRZETESTOWANE na 173 scenach kanału i 7 tablicach Mendla; drogie (~250 k tokenów/plansza) | `HANDOFF-2026-08-31.md` §2, §4; `przebiegi/20260831-*`, `20260901-mendel-base` |
| **Infografika + odkrywki + HyperFrames** (fabryka ig6–ig8) | omówienia rozdziałów książek, explainery z obrazem jako nośnikiem treści | PRZETESTOWANE na Mendlu 7/7; po obrazie 0 LLM; klatka 0 czysta; nagość tylko flaga | `HANDOFF-2026-09-02.md` §2, §6d–§6f; `www/produkcja_PMENDb.html` |
| **Reżyser** (tekst → tablice z dominantą) | każdy potok: dzieli tekst na plansze i mówi, co jest najważniejsze | PRODUKCYJNY, 1 wywołanie codexa na film; kickery po polsku od dziś | `fabryka/prompty/REZYSER_V3.md`, `fabryka/biblioteka/06_produkcja.py` |
| **Lektor m04 + słowa z whispera** | wszystkie potoki | WSPÓLNY (ten sam serwer `:8772`) | `fabryka/biblioteka/10_polski_glos.py`, kanon `external_connections/tts` |
| **Sędzia bez LLM + bramka** | ocena odsłaniania warstw, decyzja warstwy vs cały obraz | PRODUKCYJNY, skalibrowany w labie | `fabryka/pilot/lab_wycinki_metryki.py`, `przebiegi/_lab-wycinki/C/RAPORT.md` |
| **Qwen na GPU** | krótkie sprawdzenia per obraz (nagość, postacie), wizja tylko w presecie `wolny` | UŻYWANY OSZCZĘDNIE; przy skali wąskie gardło, więc nigdy w pętli składania planszy | `fabryka/pilot/kontrola_tresci.py`, `regiony.py --model qwen` |
| **Biblioteka form + arsenał bloków + skiny** | wiedza dla agenta, styl | ZBUDOWANE (82 karty, 357 bloków, 9 skinów); używane w metodzie Opus | `baza/INDEKS.md`, `bloki/INDEKS.md`, `fabryka/skiny/` |
| **Obraz + głos + odkrywki, bez elementów wokół** (E0, „podłoga”) | najprostszy i najtańszy wariant: PLAN → obraz z warstwami → lektor; 0 tokenów na planszę poza PLANEM | POMYSŁ; da się zrobić z ig8 za 0 tokenów (wyciąć elementy poza obrazem, przerenderować) i porównać okiem z ig8 | uwaga usera 2026-09-02 („wracamy do punktu wyjścia”) |
| **Prezenterka (avatar 2D) w rogu** | „ludzki” element na każdej planszy bez GPU: jeden arkusz gpt-image-2 (3 lub 6 kształtów ust), usta z amplitudy albo z wizemów Rhubarba (MIT), op `usta` w silniku, moduł włączany/wyłączany jednym poleceniem | PROTOTYP działa (ig9-avatar: 7 scen, głos f06, film 803 s); EchoMimicV3 (GPU) przetestowany: działa, ~22 s GPU na 1 s filmu przy 384², artefakty ust → nie na skalę, ewentualnie intro | `fabryka/avatar/`, `fabryka/biblioteka/14_avatar.py`, `przebiegi/20260902-mendel-ig9-avatar`, `przebiegi/_ab-avatar` |
| **Postać‑symbol (karty emocji z jednego arkusza gpt‑image‑2)** | WTRĄCENIE, nie avatar (pojawia się przy celu na 3–5 s, planer 0 tokenów, warianty rysunku); koncept usera; zestaw mia_v2 = 16 pozycji zaprojektowanych przez Codexa (umiar) (Hoser / Mia z Hyperlingua): jedna postać, 16+ kart emocji/póz przełączanych na granicach zdań, karty specjalne per film z interakcją z treścią; bez lip‑synca, 0 GPU, 0 LLM w renderze | PROTOTYP DZIAŁA (`_ab-avatar/t02-karty`, CZYSTY); następne: emocje i wtrącenia z PLANU, drugi głos postaci („za skomplikowane”), wyższa rozdzielczość kart | `fabryka/avatar/karty/`, `arkusz_siatka.py`, `14_avatar.py --tryb karty`, HANDOFF §6v |
| **Prezenterka 3D (VRM + three-vrm w HyperFrames)** | jakość VTubera z Twitcha: rig VRM, ciało z GOTOWYCH klipów mocap (retarget Mixamo→VRM z oficjalnego przykładu three-vrm), usta/oczy z czasu, CPU, deterministycznie | DZIAŁA (`_ab-avatar/t02-vrm-girl`, check CZYSTY); od 2026-09-03 ruch z klipów: idle ↔ mowa z bramki energii lektora; klipy RPM „z gwiazdką” (licencja tylko RPM), Mixamo do pobrania przez usera, CC0 = FreeMotionPack1/Quaternius; podmiana postaci = plik .vrm | `fabryka/avatar/avatar3d.mjs`, `14_avatar.py --tryb vrm --ruch rpm`, `fabryka/avatar/ruch/LICENCJE.md`, HANDOFF §6j–§6v |
| **Codex jako agent-plansza** (E1) | czy planszę ze snippetem da się złożyć tanio bez Opusa | POMYSŁ, nieprzetestowany od czasu snippetów | `POROWNANIE-WYTWORNIA-vs-FABRYKA-2026-09-02.md` §6 |
| **Klocek „infografika" w silniku wytwórni** (E2) | przeniesienie łańcucha obrazów do kręgosłupa wytwórni | POMYSŁ, wycena w godzinach nieznana | tamże |

## Routing wstępny (do potwierdzenia liczbami)

- przewidywalne, egzaminacyjne, importowane → **silnik + kontrakt**
- schematowe, gdzie liczy się wyraz i choreografia → **agent Opus** (setki filmów, nie tysiące)
- rozdziały książek, omówienia z obrazem → **infografika + odkrywki**, plansza docelowo przez silnik lub tani model

## Co dziś ogranicza skalę (od najważniejszego)

1. Kto składa planszę: agent Opus ≈ 16× więcej tokenów niż silnik, na ciaśniejszej kwocie.
2. Render HyperFrames: 2–4 min maszyny na film, dysk przy równoległości.
3. Człowiek przed wysyłką: przy tysiącach zostaje próbkowanie i bramki automatyczne.
4. Qwen: jeden serwer dla wszystkich potoków — tylko sekundowe sprawdzenia.

## Dokumenty (co czytać, kiedy)

- Chcę wiedzieć, co robiliśmy i co osiągnęliśmy → `HANDOFF-AUDYT-2026-09-02.md`
- Chcę wznowić pracę / znać stan narzędzi → `HANDOFF-2026-09-02.md` (§0 i §7)
- Chcę zrozumieć decyzję „wytwórnia czy fabryka" → canvas `www/wytwornia-czy-fabryka.html`, doc `POROWNANIE-…md`
- Chcę dowodów krok po kroku → `HANDOFF-2026-08-31.md` (dziennik §1–§30)
- Chcę uruchomić coś konkretnego → `README.md` (potoki i komendy)

## Następna rzecz, która zmniejszy chaos

Jedna tablica wyników dla wszystkich metod, te same miary na minutę filmu: tokeny per model, minuty maszyny,
dolary poza kwotą, odsetek bez twardych flag, odsetek bez człowieka. Źródła: ledgery wytwórni + dzienniki
i transkrypty fabryki. Wtedy każdy nowy test od razu ląduje w porównaniu, a routing wynika z liczb.
