Kansho/docs/architecture/technical/voice_and_media.md

62 lines
2.4 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters

This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.

---
title: "Kanshō Sprache und Medien"
version: "0.1"
status: "Arbeitsstand"
date: "2026-08-19"
product_family: "Jinkendo"
document_role: "Technical Chapter / Voice / Transcription / Media"
parent_document: "technische_zielarchitektur.md"
---
# Kanshō Sprache und Medien
Kanonisches Home für Spracheingabe und Transkription. Fachlich erforderlich, Ausprägung offen (`produktvision_und_produktidentitaet.md` §19.5). Interview G3 ist nicht abgeschlossen.
## 1. Anforderung
Auf dem Smartphone darf Reflexion nicht zwingend Tippen erfordern. Transkription ist eine zentrale technische Funktion.
Sie ist kein Freibrief für Cloud-Speech ohne Policy.
## 2. Egress-Klasse
Transkriptionsdienste sind eine **eigene Trust- und Policy-Zone** (`guardrails.md` §13). Ein ZDR-LLM-Endpoint legalisiert nicht denselben Audiostream oder denselben Klartext an einen Speech-Provider.
Klasse-A-Identität und unnötige Quasi-Identifikatoren gelten auch für Metadaten von Audio (Dateiname, GPS, Geräte-ID).
## 3. Offene Ausprägung
Nicht entschieden, daher kein Implementierungszwang in v0.1:
- Live vs. nachträgliche Transkription
- lokal vs. serverseitig vs. externer Speech-Dienst
- Bearbeitung vor Übernahme in den Dialog
- Sprecher-/Pausenlogik
- lange Aufnahmen
- Audio löschen nach Transkript vs. als Medium behalten
- Push-to-talk vs. Daueraufnahme
- Offline-Transkription
## 4. Leitplanken für jede spätere Wahl
- Das Transkript wird zur Originalrepräsentation des Dialogs oder zu einer klar gekennzeichneten Ableitung; die Regel muss dokumentiert werden, bevor Re-Grounding darauf aufsetzt.
- Nutzerkorrektur vor Persistenz als bevorzugte Richtung (fachlich offen, technisch vorbereiten).
- Fail Closed: kein unsicherer Cloud-Speech-Fallback.
- Journal- und Writing-Profile laufen auf Text nach Korrektur, nicht auf Roh-ASR-Fehlern als „persönlicher Stil“.
## 5. Entscheidungsstand
| Thema | Stand | Status |
|---|---|---|
| Transkription erforderlich | ja | entschieden (fachlich) |
| Eigener Egress-Typ | ja | entschieden (fachlich) |
| Verfahren, Vendor, Speicherdauer Audio | | offen |
## 6. Offene Fragen
Siehe Interview G3. Zusätzlich: Wie verhält sich Voice zum Working Context, während ein Thread-Wechsel erkannt wird?
## 7. Querverweise
- `privacy_gateway.md`, `frontend_pwa_shell.md`, `memory_storage_and_offline.md`
- Fachlich: `../functional/produktvision_und_produktidentitaet.md` §19.5