Plusieurs gros ajouts :
- Possibilité de discuter avec un PDF ; RAG ou analyse approfondie. Enlèvement de l'autre outil PDF de discussion qui analysait d'abord un PDF en proposant directement une intégration sans attendre qu'on pose de question - Mise en place de l'import directement dans les outils dans la sidebar - Mise en place d'un outil pour créer des tables aléatoires avec possibilité d'utiliser pendant la partie - Mise en place d'un outil pour mettre en place des PNJ, scènes, chapitre.... directement à partir de la discussion avec le PDF - Mise en place RAG avec mistal-embeding ou nomic si on utilise ollama - Mise en place mistral, google en fournisseurs alternatifs pour l'IA dans le cloud - version 0.11.0-bêta
This commit is contained in:
@@ -53,3 +53,27 @@ def _split_oversized(paragraph: str, enc, target_tokens: int) -> list[str]:
|
||||
for i in range(0, len(tokens), target_tokens):
|
||||
out.append(enc.decode(tokens[i : i + target_tokens]))
|
||||
return out
|
||||
|
||||
|
||||
def split_in_half(text: str) -> tuple[str, str]:
|
||||
"""Coupe `text` en deux moitiés ~égales, de préférence sur un saut de ligne
|
||||
proche du milieu (pour ne pas trancher en plein mot/phrase).
|
||||
|
||||
Sert au repli anti-troncature des imports : quand la SORTIE d'un morceau est
|
||||
coupée (le modèle ne peut pas tout réécrire en une réponse), on retraite ce
|
||||
morceau en deux moitiés. Renvoie ('', '') si le texte est trop court pour
|
||||
être découpé utilement (garde-fou anti-récursion infinie).
|
||||
"""
|
||||
text = text.strip()
|
||||
if len(text) < 400:
|
||||
return "", ""
|
||||
mid = len(text) // 2
|
||||
# Cherche un saut de ligne juste avant le milieu, sinon juste après.
|
||||
cut = text.rfind("\n", 0, mid)
|
||||
if cut < len(text) // 4:
|
||||
nxt = text.find("\n", mid)
|
||||
cut = nxt if nxt != -1 else mid
|
||||
left, right = text[:cut].strip(), text[cut:].strip()
|
||||
if not left or not right:
|
||||
return "", ""
|
||||
return left, right
|
||||
|
||||
20
brain/app/application/embeddings.py
Normal file
20
brain/app/application/embeddings.py
Normal file
@@ -0,0 +1,20 @@
|
||||
"""Port d'embeddings (RAG des notebooks).
|
||||
|
||||
Abstraction du calcul de vecteurs : un texte → une liste de floats. Les adapters
|
||||
concrets (Ollama local, Mistral cloud) la satisfont par duck typing, comme pour
|
||||
les LLMProvider. Le RAG n'en dépend que via cette interface.
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
from typing import Protocol
|
||||
|
||||
|
||||
class EmbeddingError(Exception):
|
||||
"""Échec du calcul d'embeddings (modèle indisponible, réseau, quota…)."""
|
||||
|
||||
|
||||
class EmbeddingProvider(Protocol):
|
||||
"""Calcule les vecteurs d'une liste de textes (ordre préservé)."""
|
||||
|
||||
async def embed(self, texts: list[str]) -> list[list[float]]:
|
||||
...
|
||||
@@ -12,9 +12,14 @@ from __future__ import annotations
|
||||
|
||||
import logging
|
||||
|
||||
from app.application.chunking import chunk_text
|
||||
from app.application.llm_json import load_json_object
|
||||
from app.application.chunking import chunk_text, split_in_half
|
||||
from app.application.llm_json import load_json_object, looks_like_truncated_json
|
||||
from app.application.llm_retry import generate_with_retry
|
||||
from app.application.streaming import with_heartbeat
|
||||
|
||||
# Repli anti-troncature : si la sortie d'un morceau est coupée, on le retraite en
|
||||
# 2 moitiés. Borné en profondeur (3 niveaux => jusqu'à 8 sous-blocs).
|
||||
_MAX_SPLIT_DEPTH = 3
|
||||
from app.domain.models import (
|
||||
ArcProposal,
|
||||
CampaignImportResult,
|
||||
@@ -22,7 +27,7 @@ from app.domain.models import (
|
||||
RoomProposal,
|
||||
SceneProposal,
|
||||
)
|
||||
from app.domain.ports import LLMProvider, PdfTextExtractor
|
||||
from app.domain.ports import LLMProvider, LLMProviderError, PdfTextExtractor
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
@@ -229,8 +234,30 @@ class ImportCampaignUseCase:
|
||||
}
|
||||
|
||||
merger = _TreeMerger()
|
||||
skipped = 0
|
||||
last_error: str | None = None
|
||||
for i, chunk in enumerate(chunks):
|
||||
merger.add(await self._map_chunk(chunk, index=i, total=total))
|
||||
# RÉSILIENCE : un morceau qui échoue (provider saturé, quota, etc.) est
|
||||
# SAUTÉ — on ne perd pas tout l'import pour autant. On n'abandonne que
|
||||
# si AUCUN morceau ne passe (cf. après la boucle).
|
||||
# HEARTBEAT : keep-alive pendant l'appel LLM pour ne jamais laisser le
|
||||
# flux SSE silencieux (sinon le Core coupe sur timeout d'inactivité).
|
||||
try:
|
||||
arcs_payload: list[dict] | None = None
|
||||
async for kind, payload in with_heartbeat(
|
||||
self._map_chunk(chunk, index=i, total=total)
|
||||
):
|
||||
if kind == "heartbeat":
|
||||
yield {"type": "heartbeat", "current": i + 1, "total": total}
|
||||
else:
|
||||
arcs_payload = payload
|
||||
merger.add(arcs_payload or [])
|
||||
except LLMProviderError as exc:
|
||||
skipped += 1
|
||||
last_error = str(exc)
|
||||
logger.warning("Morceau %s/%s ignoré (échec LLM) : %s", i + 1, total, exc)
|
||||
yield {"type": "chunk_failed", "current": i + 1, "total": total,
|
||||
"message": str(exc)[:300]}
|
||||
arcs, chapters, scenes = merger.counts()
|
||||
yield {
|
||||
"type": "progress",
|
||||
@@ -239,42 +266,74 @@ class ImportCampaignUseCase:
|
||||
"arc_count": arcs,
|
||||
"chapter_count": chapters,
|
||||
"scene_count": scenes,
|
||||
"skipped": skipped,
|
||||
}
|
||||
|
||||
if total > 0 and skipped == total:
|
||||
# Tout a échoué : "done" vide serait trompeur → erreur explicite.
|
||||
yield {"type": "error",
|
||||
"message": "Tous les morceaux ont échoué auprès du fournisseur IA. "
|
||||
f"Dernier message : {last_error or 'inconnu'}"}
|
||||
return
|
||||
|
||||
yield {
|
||||
"type": "done",
|
||||
"arcs": _serialize_arcs(merger.result()),
|
||||
"page_count": doc.page_count,
|
||||
"ocr_page_count": doc.ocr_page_count,
|
||||
"skipped": skipped,
|
||||
}
|
||||
|
||||
# --- MAP : un morceau → sous-arbre ---------------------------------------
|
||||
|
||||
async def _map_chunk(self, chunk: str, *, index: int, total: int) -> list[dict]:
|
||||
return await self._extract_arcs(chunk, index=index, total=total, depth=0)
|
||||
|
||||
async def _extract_arcs(
|
||||
self, text: str, *, index: int, total: int, depth: int
|
||||
) -> list[dict]:
|
||||
"""Extrait l'arborescence d'un texte. Si la SORTIE est tronquée, retraite le
|
||||
texte en DEUX moitiés et concatène — le `_TreeMerger` final dédoublonne par
|
||||
nom (un arc/chapitre coupé entre les moitiés est recollé)."""
|
||||
prompt = (
|
||||
_MAP_SYSTEM.format(default_arc=_DEFAULT_ARC_NAME)
|
||||
+ f"\n\n--- EXTRAIT {index + 1}/{total} ---\n{chunk}\n\n"
|
||||
+ f"\n\n--- EXTRAIT {index + 1}/{total} ---\n{text}\n\n"
|
||||
"Renvoie maintenant le JSON de l'arborescence."
|
||||
)
|
||||
raw = await generate_with_retry(
|
||||
self._llm, prompt, output_format="json", temperature=_TEMPERATURE)
|
||||
return self._parse_arcs(raw, index=index)
|
||||
arcs, truncated = self._parse_arcs(raw, index=index)
|
||||
|
||||
if truncated and depth < _MAX_SPLIT_DEPTH:
|
||||
left, right = split_in_half(text)
|
||||
if left and right:
|
||||
logger.info(
|
||||
"Morceau %s : sortie tronquée → re-découpage en 2 moitiés (niveau %s).",
|
||||
index, depth + 1)
|
||||
a = await self._extract_arcs(left, index=index, total=total, depth=depth + 1)
|
||||
b = await self._extract_arcs(right, index=index, total=total, depth=depth + 1)
|
||||
return a + b
|
||||
if truncated:
|
||||
logger.warning(
|
||||
"Morceau %s : sortie tronquée, profondeur max atteinte — partiel conservé.", index)
|
||||
return arcs
|
||||
|
||||
@staticmethod
|
||||
def _parse_arcs(raw: str, *, index: int) -> list[dict]:
|
||||
"""Parse robuste : objet JSON équilibré, ou récupération partielle si tronqué."""
|
||||
def _parse_arcs(raw: str, *, index: int) -> tuple[list[dict], bool]:
|
||||
"""Parse robuste → (arcs, tronqué). `tronqué`=True si récupération partielle."""
|
||||
parsed, recovered = load_json_object(raw)
|
||||
if parsed is None:
|
||||
logger.warning("Morceau %s : aucun objet JSON exploitable, ignoré.", index)
|
||||
return []
|
||||
if recovered:
|
||||
logger.warning(
|
||||
"Morceau %s : sortie tronquée — récupération des éléments complets "
|
||||
"(envisagez des morceaux plus petits).", index)
|
||||
truncated = looks_like_truncated_json(raw)
|
||||
if not truncated:
|
||||
logger.warning(
|
||||
"Morceau %s : aucun objet JSON exploitable, ignoré. "
|
||||
"Début de la réponse du modèle : %r",
|
||||
index, (raw or "").strip()[:300] or "(réponse VIDE)")
|
||||
return [], truncated
|
||||
if isinstance(parsed, dict):
|
||||
arcs = parsed.get("arcs", [])
|
||||
return arcs if isinstance(arcs, list) else []
|
||||
return []
|
||||
return (arcs if isinstance(arcs, list) else []), recovered
|
||||
return [], recovered
|
||||
|
||||
|
||||
def _serialize_arcs(arcs: list[ArcProposal]) -> list[dict]:
|
||||
|
||||
@@ -14,9 +14,16 @@ from __future__ import annotations
|
||||
|
||||
import logging
|
||||
|
||||
from app.application.chunking import CHUNK_TARGET_TOKENS, chunk_text
|
||||
from app.application.llm_json import load_json_object
|
||||
from app.application.chunking import CHUNK_TARGET_TOKENS, chunk_text, split_in_half
|
||||
from app.application.llm_json import load_json_object, looks_like_truncated_json
|
||||
from app.application.llm_retry import generate_with_retry
|
||||
from app.application.streaming import with_heartbeat
|
||||
|
||||
# Repli anti-troncature : si la SORTIE d'un morceau est coupée (le modèle ne peut
|
||||
# pas tout réécrire en une réponse), on retraite ce morceau en 2 moitiés. Borné en
|
||||
# profondeur pour éviter une récursion infinie (3 niveaux => jusqu'à 8 sous-blocs ;
|
||||
# 1-2 niveaux suffisent en pratique, le reste est un garde-fou).
|
||||
_MAX_SPLIT_DEPTH = 3
|
||||
from app.domain.models import RulesImportResult
|
||||
from app.domain.ports import LLMProvider, LLMProviderError, PdfTextExtractor
|
||||
|
||||
@@ -95,6 +102,24 @@ class _SectionMerger:
|
||||
return {title: "\n\n".join(parts) for title, parts in self._merged.items()}
|
||||
|
||||
|
||||
def _combine_sections(a: dict[str, str], b: dict[str, str]) -> dict[str, str]:
|
||||
"""Fusionne deux dicts de sections (issus des 2 moitiés d'un morceau re-découpé).
|
||||
|
||||
Titres insensibles à la casse : un même titre présent des deux côtés (une section
|
||||
coupée par le re-découpage) voit ses contenus concaténés au lieu d'être écrasés.
|
||||
"""
|
||||
out = dict(a)
|
||||
by_lower = {k.lower(): k for k in out}
|
||||
for title, content in b.items():
|
||||
key = by_lower.get(title.lower())
|
||||
if key is not None:
|
||||
out[key] = f"{out[key]}\n\n{content}".strip()
|
||||
else:
|
||||
out[title] = content
|
||||
by_lower[title.lower()] = title
|
||||
return out
|
||||
|
||||
|
||||
class ImportRulesUseCase:
|
||||
"""Transforme un PDF de règles en proposition de sections markdown."""
|
||||
|
||||
@@ -152,48 +177,103 @@ class ImportRulesUseCase:
|
||||
}
|
||||
|
||||
merger = _SectionMerger()
|
||||
skipped = 0
|
||||
last_error: str | None = None
|
||||
for i, chunk in enumerate(chunks):
|
||||
new_titles = merger.add(await self._map_chunk(chunk, index=i, total=total))
|
||||
# RÉSILIENCE : un morceau qui échoue est SAUTÉ, l'import continue.
|
||||
# Abandon seulement si AUCUN morceau ne passe (cf. après la boucle).
|
||||
# HEARTBEAT : on émet des keep-alive pendant l'appel LLM (long sur un
|
||||
# provider lent) pour que le flux SSE ne soit jamais coupé par le Core.
|
||||
new_titles: list[str] = []
|
||||
try:
|
||||
sections: dict[str, str] | None = None
|
||||
async for kind, payload in with_heartbeat(
|
||||
self._map_chunk(chunk, index=i, total=total)
|
||||
):
|
||||
if kind == "heartbeat":
|
||||
yield {"type": "heartbeat", "current": i + 1, "total": total}
|
||||
else:
|
||||
sections = payload
|
||||
new_titles = merger.add(sections or {})
|
||||
except LLMProviderError as exc:
|
||||
skipped += 1
|
||||
last_error = str(exc)
|
||||
logger.warning("Morceau %s/%s ignoré (échec LLM) : %s", i + 1, total, exc)
|
||||
yield {"type": "chunk_failed", "current": i + 1, "total": total,
|
||||
"message": str(exc)[:300]}
|
||||
yield {
|
||||
"type": "progress",
|
||||
"current": i + 1,
|
||||
"total": total,
|
||||
"new_sections": new_titles,
|
||||
"skipped": skipped,
|
||||
}
|
||||
|
||||
if total > 0 and skipped == total:
|
||||
yield {"type": "error",
|
||||
"message": "Tous les morceaux ont échoué auprès du fournisseur IA. "
|
||||
f"Dernier message : {last_error or 'inconnu'}"}
|
||||
return
|
||||
|
||||
yield {
|
||||
"type": "done",
|
||||
"sections": merger.result(),
|
||||
"page_count": doc.page_count,
|
||||
"ocr_page_count": doc.ocr_page_count,
|
||||
"skipped": skipped,
|
||||
}
|
||||
|
||||
# --- MAP : un morceau → sections -----------------------------------------
|
||||
|
||||
async def _map_chunk(self, chunk: str, *, index: int, total: int) -> dict[str, str]:
|
||||
return await self._extract_sections(chunk, index=index, total=total, depth=0)
|
||||
|
||||
async def _extract_sections(
|
||||
self, text: str, *, index: int, total: int, depth: int
|
||||
) -> dict[str, str]:
|
||||
"""Extrait les sections d'un texte. Si la SORTIE est tronquée, retraite le
|
||||
texte en DEUX moitiés (chacune produit une réponse complète) et fusionne —
|
||||
ainsi aucune section n'est perdue, quel que soit le plafond de sortie."""
|
||||
prompt = (
|
||||
_MAP_SYSTEM.format(
|
||||
canonical="\n".join(f" - {s}" for s in _CANONICAL_SECTIONS)
|
||||
)
|
||||
+ f"\n\n--- EXTRAIT {index + 1}/{total} ---\n{chunk}\n\n"
|
||||
+ f"\n\n--- EXTRAIT {index + 1}/{total} ---\n{text}\n\n"
|
||||
"Renvoie maintenant le JSON des sections."
|
||||
)
|
||||
raw = await generate_with_retry(
|
||||
self._llm, prompt, output_format="json", temperature=_TEMPERATURE)
|
||||
return self._parse_sections(raw, index=index)
|
||||
sections, truncated = self._parse_sections(raw, index=index)
|
||||
|
||||
if truncated and depth < _MAX_SPLIT_DEPTH:
|
||||
left, right = split_in_half(text)
|
||||
if left and right:
|
||||
logger.info(
|
||||
"Morceau %s : sortie tronquée → re-découpage en 2 moitiés (niveau %s).",
|
||||
index, depth + 1)
|
||||
a = await self._extract_sections(left, index=index, total=total, depth=depth + 1)
|
||||
b = await self._extract_sections(right, index=index, total=total, depth=depth + 1)
|
||||
return _combine_sections(a, b)
|
||||
if truncated:
|
||||
logger.warning(
|
||||
"Morceau %s : sortie tronquée, profondeur max atteinte — partiel conservé.", index)
|
||||
return sections
|
||||
|
||||
@staticmethod
|
||||
def _parse_sections(raw: str, *, index: int) -> dict[str, str]:
|
||||
"""Parse robuste : objet JSON équilibré, ou récupération partielle si tronqué."""
|
||||
def _parse_sections(raw: str, *, index: int) -> tuple[dict[str, str], bool]:
|
||||
"""Parse robuste → (sections, tronqué). `tronqué`=True si récupération partielle."""
|
||||
parsed, recovered = load_json_object(raw)
|
||||
if parsed is None:
|
||||
logger.warning("Morceau %s : aucun objet JSON exploitable, ignoré.", index)
|
||||
return {}
|
||||
if recovered:
|
||||
logger.warning(
|
||||
"Morceau %s : sortie tronquée — récupération des sections complètes "
|
||||
"(envisagez des morceaux plus petits).", index)
|
||||
# Rien d'exploitable : soit prose (échec), soit JSON coupé avant toute
|
||||
# structure complète (→ on signalera 'tronqué' pour re-découper).
|
||||
truncated = looks_like_truncated_json(raw)
|
||||
if not truncated:
|
||||
logger.warning(
|
||||
"Morceau %s : aucun objet JSON exploitable, ignoré. "
|
||||
"Début de la réponse du modèle : %r",
|
||||
index, (raw or "").strip()[:300] or "(réponse VIDE)")
|
||||
return {}, truncated
|
||||
if not isinstance(parsed, dict):
|
||||
logger.warning("Morceau %s : le LLM n'a pas renvoyé un objet, ignoré.", index)
|
||||
return {}
|
||||
return {str(k): str(v) for k, v in parsed.items()}
|
||||
return {}, False
|
||||
return {str(k): str(v) for k, v in parsed.items()}, recovered
|
||||
|
||||
@@ -13,6 +13,16 @@ et tout ce qui suit. Renvoie None si aucun objet complet n'est trouvé
|
||||
from __future__ import annotations
|
||||
|
||||
import json
|
||||
import re
|
||||
|
||||
# Blocs de "réflexion" des modèles raisonneurs (Nemotron, DeepSeek-R1, QwQ…).
|
||||
# Leur contenu est de la prose truffée d'accolades qui piège le détecteur de JSON
|
||||
# (et n'est jamais la réponse) → on le retire avant toute analyse.
|
||||
_REASONING_RE = re.compile(r"<think(?:ing)?>.*?</think(?:ing)?>", re.DOTALL | re.IGNORECASE)
|
||||
|
||||
|
||||
def _strip_reasoning(raw: str) -> str:
|
||||
return _REASONING_RE.sub("", raw)
|
||||
|
||||
|
||||
def load_json_object(raw: str) -> tuple[object | None, bool]:
|
||||
@@ -24,6 +34,7 @@ def load_json_object(raw: str) -> tuple[object | None, bool]:
|
||||
auquel cas le second élément vaut True.
|
||||
(None, False) si rien d'exploitable.
|
||||
"""
|
||||
raw = _strip_reasoning(raw)
|
||||
obj = extract_json_object(raw)
|
||||
if obj is not None:
|
||||
try:
|
||||
@@ -39,6 +50,18 @@ def load_json_object(raw: str) -> tuple[object | None, bool]:
|
||||
return None, False
|
||||
|
||||
|
||||
def looks_like_truncated_json(raw: str) -> bool:
|
||||
"""La sortie ressemble-t-elle à un JSON COUPÉ (accolades/crochets non refermés)
|
||||
plutôt qu'à de la prose ? Sert à déclencher un re-découpage même quand RIEN n'a
|
||||
pu être récupéré (cas où le 1er contenu est si long qu'il est coupé avant toute
|
||||
sous-structure complète). On exige un contenu substantiel pour éviter les
|
||||
faux positifs sur une courte réponse non-JSON."""
|
||||
s = (raw or "").strip()
|
||||
if "{" not in s or len(s) < 100:
|
||||
return False
|
||||
return s.count("{") > s.count("}") or s.count("[") > s.count("]")
|
||||
|
||||
|
||||
def extract_json_object(raw: str) -> str | None:
|
||||
if not raw:
|
||||
return None
|
||||
|
||||
@@ -18,7 +18,10 @@ from app.domain.ports import LLMProvider, LLMProviderError
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
_ATTEMPTS = 4
|
||||
# 3 tentatives : assez pour absorber un hoquet transitoire, sans s'acharner des
|
||||
# minutes sur un modèle durablement lent/saturé (les heartbeats gardent le flux
|
||||
# vivant, mais inutile de faire patienter l'utilisateur 15 min pour rien).
|
||||
_ATTEMPTS = 3
|
||||
_BASE_DELAY_SECONDS = 3.0
|
||||
# Un rate limit (429) "par minute" ne se libère pas en 2-3s : on attend plus
|
||||
# longtemps pour ces erreurs-là (le free tier OpenRouter plafonne ~20 req/min).
|
||||
|
||||
90
brain/app/application/notebook_chat.py
Normal file
90
brain/app/application/notebook_chat.py
Normal file
@@ -0,0 +1,90 @@
|
||||
"""Use case : chat ANCRÉ sur les sources d'un notebook (RAG).
|
||||
|
||||
À chaque message, on retrouve les passages pertinents des sources (via le RAG) et
|
||||
on les injecte dans le prompt système, en plus du contexte de campagne. Le modèle
|
||||
répond donc en s'appuyant sur la/les source(s) — pas sur ses connaissances générales.
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
from typing import AsyncIterator
|
||||
|
||||
from app.application.notebook_rag import NotebookRagUseCase
|
||||
from app.domain.models import ChatMessage
|
||||
from app.domain.ports import LLMChatProvider
|
||||
|
||||
_SYSTEM_PROMPT = """Tu es un assistant de jeu de rôle qui aide à ADAPTER une source (PDF) à la CAMPAGNE de l'utilisateur.
|
||||
|
||||
Tu disposes de DEUX connaissances, toutes deux ci-dessous :
|
||||
1) LA CAMPAGNE de l'utilisateur (sa structure arcs/chapitres/scènes, ses PNJ, son univers) ;
|
||||
2) LA SOURCE (extraits pertinents du PDF).
|
||||
|
||||
Règles :
|
||||
- Pour une question sur SA CAMPAGNE (ex. « mon chapitre 3 », « mes PNJ »), appuie-toi sur la section CAMPAGNE.
|
||||
- Pour une question sur le livre, appuie-toi sur les EXTRAITS DE LA SOURCE.
|
||||
- CROISE les deux pour proposer des adaptations cohérentes avec sa campagne existante.
|
||||
- N'invente pas ce qui ne figure ni dans la campagne ni dans la source ; si tu ne sais pas, dis-le.
|
||||
- Quand un extrait porte un numéro de page (« (p. 12) »), cite-le (« d'après la p. 12 »).
|
||||
|
||||
{context_block}
|
||||
--- EXTRAITS PERTINENTS DE LA SOURCE ---
|
||||
{sources_block}
|
||||
--- FIN DES EXTRAITS ---
|
||||
|
||||
PROPOSITIONS D'INTÉGRATION (IMPORTANT) :
|
||||
Quand l'utilisateur veut CRÉER ou ADAPTER un élément concret pour sa campagne (un PNJ,
|
||||
une scène, un chapitre, un arc, une table aléatoire), termine ta réponse par un ou
|
||||
plusieurs BLOCS D'ACTION — un objet JSON par bloc, dans une clôture ```loremind-action.
|
||||
L'interface les transformera en boutons « Créer dans la campagne ». N'en mets que si
|
||||
c'est pertinent et explicitement souhaité. Formats acceptés :
|
||||
|
||||
```loremind-action
|
||||
{{"type": "npc", "name": "Nom", "description": "Fiche en quelques phrases."}}
|
||||
```
|
||||
```loremind-action
|
||||
{{"type": "scene", "name": "Nom", "description": "Résumé", "content": "Déroulé détaillé."}}
|
||||
```
|
||||
```loremind-action
|
||||
{{"type": "chapter", "name": "Nom", "description": "Résumé du chapitre."}}
|
||||
```
|
||||
```loremind-action
|
||||
{{"type": "arc", "name": "Nom", "description": "Résumé", "arcType": "LINEAR"}}
|
||||
```
|
||||
```loremind-action
|
||||
{{"type": "table", "name": "Nom", "diceFormula": "1d8", "entries": [{{"minRoll":1,"maxRoll":4,"label":"...","detail":"..."}}]}}
|
||||
```
|
||||
|
||||
Réponds en français, de façon utile et concise. Mets le texte explicatif AVANT les blocs d'action."""
|
||||
|
||||
|
||||
class NotebookChatUseCase:
|
||||
def __init__(self, rag: NotebookRagUseCase, llm: LLMChatProvider) -> None:
|
||||
self._rag = rag
|
||||
self._llm = llm
|
||||
|
||||
async def stream(
|
||||
self,
|
||||
source_ids: list[str],
|
||||
messages: list[ChatMessage],
|
||||
context: str = "",
|
||||
top_k: int = 6,
|
||||
) -> AsyncIterator[str]:
|
||||
last_user = next((m.content for m in reversed(messages) if m.role == "user"), "")
|
||||
passages = await self._rag.retrieve(source_ids, last_user, top_k=top_k)
|
||||
sources_block = (
|
||||
"\n\n".join(self._format_passage(p) for p in passages)
|
||||
if passages else "(aucun passage pertinent trouvé dans les sources)"
|
||||
)
|
||||
context_block = (
|
||||
f"--- TA CAMPAGNE ---\n{context.strip()}\n--- FIN CAMPAGNE ---\n\n"
|
||||
if context.strip() else "--- TA CAMPAGNE ---\n(aucune donnée de campagne)\n--- FIN CAMPAGNE ---\n\n"
|
||||
)
|
||||
system_prompt = _SYSTEM_PROMPT.format(
|
||||
context_block=context_block, sources_block=sources_block)
|
||||
async for token in self._llm.stream_chat(messages, system_prompt=system_prompt):
|
||||
yield token
|
||||
|
||||
@staticmethod
|
||||
def _format_passage(p: dict) -> str:
|
||||
page = p.get("page")
|
||||
prefix = f"(p. {page}) " if page else ""
|
||||
return f"• {prefix}{p['text'].strip()}"
|
||||
127
brain/app/application/notebook_deep.py
Normal file
127
brain/app/application/notebook_deep.py
Normal file
@@ -0,0 +1,127 @@
|
||||
"""Use case « Analyse approfondie » d'un notebook : map-reduce sur TOUT le document.
|
||||
|
||||
Contrairement au chat RAG (qui ne ramène que les top-k extraits), ce mode lit
|
||||
l'INTÉGRALITÉ des sources par lots :
|
||||
- MAP : pour chaque lot, le modèle extrait ce qui est pertinent pour la question
|
||||
(ou « RAS » si rien) ;
|
||||
- REDUCE : il synthétise toutes les notes en une réponse finale (streamée).
|
||||
|
||||
→ Répond aux questions globales/exhaustives (« liste tous les… ») quel que soit le
|
||||
modèle, au prix de plusieurs appels (comme l'import). Le lot est dimensionné par
|
||||
`batch_tokens` (= taille de morceau d'import) : avec un modèle gros-contexte, peu de
|
||||
lots ; avec un petit modèle local, plus de lots (mais ça reste exhaustif).
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
import logging
|
||||
from typing import AsyncIterator
|
||||
|
||||
import tiktoken
|
||||
|
||||
from app.application.llm_retry import generate_with_retry
|
||||
from app.domain.models import ChatMessage
|
||||
from app.domain.ports import LLMChatProvider, LLMProvider, LLMProviderError
|
||||
from app.infrastructure import vector_store
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
_NO_MATCH = "RAS"
|
||||
_MAP_TEMPERATURE = 0.2
|
||||
|
||||
_MAP_PROMPT = """Voici un EXTRAIT d'un document. Extrais UNIQUEMENT les informations
|
||||
pertinentes pour répondre à la question ci-dessous. Conserve les détails utiles et
|
||||
indique les numéros de page (format « p. X »). Si l'extrait ne contient RIEN de
|
||||
pertinent, réponds EXACTEMENT « {no_match} » et rien d'autre.
|
||||
|
||||
QUESTION : {question}
|
||||
|
||||
--- EXTRAIT ---
|
||||
{excerpt}
|
||||
--- FIN EXTRAIT ---
|
||||
|
||||
Informations pertinentes (ou « {no_match} ») :"""
|
||||
|
||||
_REDUCE_SYSTEM = """Tu réponds à la question d'un MJ à partir de NOTES extraites de
|
||||
l'ENSEMBLE d'un document source (donc tu as une vue COMPLÈTE, pas un simple extrait).
|
||||
Synthétise ces notes en une réponse claire et structurée, cite les pages (« p. X »),
|
||||
et n'invente rien qui n'y figure pas. Si une CAMPAGNE est fournie ci-dessous, relie ta
|
||||
réponse à sa structure / ses PNJ pour des adaptations cohérentes.
|
||||
|
||||
{context_block}
|
||||
--- NOTES EXTRAITES DE TOUT LE DOCUMENT ---
|
||||
{notes_block}
|
||||
--- FIN DES NOTES ---
|
||||
|
||||
Réponds en français."""
|
||||
|
||||
|
||||
class NotebookDeepUseCase:
|
||||
def __init__(self, llm: LLMProvider, batch_tokens: int = 10000) -> None:
|
||||
self._llm = llm
|
||||
self._batch_tokens = max(2000, batch_tokens)
|
||||
|
||||
async def stream(
|
||||
self,
|
||||
source_ids: list[str],
|
||||
question: str,
|
||||
context: str = "",
|
||||
) -> AsyncIterator[dict]:
|
||||
"""Yield des évènements : {type:'progress',current,total}, {type:'token',token},
|
||||
{type:'done'}. (Les erreurs LLM des lots sont tolérées : lot ignoré.)"""
|
||||
chunks: list[dict] = []
|
||||
for sid in source_ids:
|
||||
chunks.extend(vector_store.all_chunks(sid))
|
||||
if not chunks:
|
||||
yield {"type": "token", "token": "Aucune source indexée à analyser."}
|
||||
yield {"type": "done"}
|
||||
return
|
||||
|
||||
batches = self._group(chunks)
|
||||
total = len(batches)
|
||||
notes: list[str] = []
|
||||
for i, batch in enumerate(batches):
|
||||
yield {"type": "progress", "current": i, "total": total}
|
||||
excerpt = "\n\n".join(
|
||||
f"(p. {c['page']}) {c['text'].strip()}" if c.get("page") else c["text"].strip()
|
||||
for c in batch
|
||||
)
|
||||
prompt = _MAP_PROMPT.format(no_match=_NO_MATCH, question=question, excerpt=excerpt)
|
||||
try:
|
||||
raw = await generate_with_retry(self._llm, prompt, temperature=_MAP_TEMPERATURE)
|
||||
except LLMProviderError as exc:
|
||||
logger.warning("Analyse approfondie : lot %s/%s ignoré : %s", i + 1, total, exc)
|
||||
continue
|
||||
answer = raw.strip()
|
||||
if answer and answer.upper().rstrip(".") != _NO_MATCH:
|
||||
notes.append(answer)
|
||||
yield {"type": "progress", "current": total, "total": total}
|
||||
|
||||
notes_block = "\n\n".join(notes) if notes else "(aucune information pertinente trouvée dans le document)"
|
||||
context_block = (
|
||||
f"--- TA CAMPAGNE (structure, PNJ, univers) ---\n{context.strip()}\n--- FIN CAMPAGNE ---\n\n"
|
||||
if context.strip() else ""
|
||||
)
|
||||
system_prompt = _REDUCE_SYSTEM.format(context_block=context_block, notes_block=notes_block)
|
||||
llm_chat: LLMChatProvider = self._llm # type: ignore[assignment]
|
||||
async for token in llm_chat.stream_chat(
|
||||
[ChatMessage(role="user", content=question)], system_prompt=system_prompt
|
||||
):
|
||||
yield {"type": "token", "token": token}
|
||||
yield {"type": "done"}
|
||||
|
||||
def _group(self, chunks: list[dict]) -> list[list[dict]]:
|
||||
"""Regroupe les extraits en lots ~`batch_tokens` (compte tiktoken)."""
|
||||
enc = tiktoken.get_encoding("cl100k_base")
|
||||
batches: list[list[dict]] = []
|
||||
current: list[dict] = []
|
||||
current_tokens = 0
|
||||
for c in chunks:
|
||||
t = len(enc.encode(c.get("text", "")))
|
||||
if current and current_tokens + t > self._batch_tokens:
|
||||
batches.append(current)
|
||||
current, current_tokens = [], 0
|
||||
current.append(c)
|
||||
current_tokens += t
|
||||
if current:
|
||||
batches.append(current)
|
||||
return batches
|
||||
79
brain/app/application/notebook_rag.py
Normal file
79
brain/app/application/notebook_rag.py
Normal file
@@ -0,0 +1,79 @@
|
||||
"""Use case RAG des notebooks : indexer une source PDF et retrouver les passages
|
||||
pertinents pour une question.
|
||||
|
||||
Chaîne d'indexation : PDF → extraction texte (+OCR) → découpage en extraits courts
|
||||
→ embeddings → stockage vectoriel (fichier). À la requête : on embed la question
|
||||
et on récupère les extraits les plus proches (cosinus) pour ancrer le chat.
|
||||
|
||||
Extraits PLUS COURTS que pour l'import (recopie) : ici on veut une granularité fine
|
||||
pour que la recherche pointe un passage précis, pas un demi-chapitre.
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
import logging
|
||||
|
||||
from app.application.chunking import chunk_text
|
||||
from app.application.embeddings import EmbeddingProvider
|
||||
from app.domain.ports import PdfTextExtractor
|
||||
from app.infrastructure import vector_store
|
||||
|
||||
logger = logging.getLogger(__name__)
|
||||
|
||||
_RAG_CHUNK_TOKENS = 600
|
||||
# Un extrait avec quasi aucun texte réel (en-tête/pied de page, fragment de numéro
|
||||
# de page isolé « 249 250 ») ne sert à rien en RAG → on l'écarte. Seuil bas et
|
||||
# conservateur : on ne coupe QUE les fragments quasi-vides, jamais une vraie phrase.
|
||||
_MIN_LETTERS = 15
|
||||
|
||||
|
||||
def _has_enough_text(piece: str) -> bool:
|
||||
return sum(c.isalpha() for c in piece) >= _MIN_LETTERS
|
||||
|
||||
|
||||
class NotebookRagUseCase:
|
||||
def __init__(
|
||||
self,
|
||||
extractor: PdfTextExtractor,
|
||||
embedder: EmbeddingProvider,
|
||||
chunk_target_tokens: int = _RAG_CHUNK_TOKENS,
|
||||
) -> None:
|
||||
self._extractor = extractor
|
||||
self._embedder = embedder
|
||||
self._chunk_target_tokens = chunk_target_tokens
|
||||
|
||||
async def index_source(self, source_id: str, pdf_bytes: bytes) -> dict:
|
||||
"""Extrait, découpe PAR PAGE (pour garder le n° de page → citations), embed
|
||||
et stocke une source. Renvoie un récap."""
|
||||
doc = self._extractor.extract(pdf_bytes)
|
||||
chunks: list[str] = []
|
||||
pages: list[int] = []
|
||||
for page in doc.pages:
|
||||
for piece in chunk_text(page.text, self._chunk_target_tokens):
|
||||
if not _has_enough_text(piece):
|
||||
continue # fragment quasi-vide (en-tête/pied/numéro) → ignoré
|
||||
chunks.append(piece)
|
||||
pages.append(page.index + 1) # n° de page 1-based pour l'affichage
|
||||
logger.info(
|
||||
"Indexation notebook source=%s : %s page(s) (%s OCR), %s extrait(s).",
|
||||
source_id, doc.page_count, doc.ocr_page_count, len(chunks),
|
||||
)
|
||||
if not chunks:
|
||||
vector_store.save(source_id, [], [])
|
||||
return {"chunks": 0, "page_count": doc.page_count, "ocr_page_count": doc.ocr_page_count}
|
||||
vectors = await self._embedder.embed(chunks)
|
||||
count = vector_store.save(source_id, chunks, vectors, pages)
|
||||
return {
|
||||
"chunks": count,
|
||||
"page_count": doc.page_count,
|
||||
"ocr_page_count": doc.ocr_page_count,
|
||||
}
|
||||
|
||||
async def retrieve(self, source_ids: list[str], query: str, top_k: int = 6) -> list[dict]:
|
||||
"""Passages les plus pertinents (toutes sources) pour `query`."""
|
||||
ids = [s for s in source_ids if vector_store.exists(s)]
|
||||
if not ids or not query.strip():
|
||||
return []
|
||||
query_vectors = await self._embedder.embed([query])
|
||||
if not query_vectors:
|
||||
return []
|
||||
return vector_store.search(ids, query_vectors[0], top_k)
|
||||
45
brain/app/application/streaming.py
Normal file
45
brain/app/application/streaming.py
Normal file
@@ -0,0 +1,45 @@
|
||||
"""Heartbeats pour garder un flux SSE 'vivant' pendant une coroutine longue.
|
||||
|
||||
Problème résolu : pendant un appel LLM lent (import sur provider gratuit), le
|
||||
Brain ne produit AUCUN évènement SSE. Le Core (WebClient) ne 'voit aucun item'
|
||||
et coupe la connexion sur timeout d'inactivité :
|
||||
|
||||
ReactiveException: Did not observe any item or terminal signal within Nms
|
||||
|
||||
C'est le piège classique du SSE long. La parade standard = envoyer un keep-alive
|
||||
périodique. `with_heartbeat` exécute une coroutine en émettant un évènement
|
||||
'heartbeat' toutes les `interval` secondes tant qu'elle tourne, puis son résultat
|
||||
('result', valeur). Le Core remet son chrono à zéro sur n'importe quel évènement
|
||||
reçu (même inconnu) → plus de coupure, quelle que soit la lenteur du modèle.
|
||||
"""
|
||||
from __future__ import annotations
|
||||
|
||||
import asyncio
|
||||
from typing import Any, AsyncIterator, Awaitable
|
||||
|
||||
# Bien sous le timeout d'inactivité du Core (600s) ET de tout proxy (nginx ~60s).
|
||||
HEARTBEAT_INTERVAL_SECONDS = 15.0
|
||||
|
||||
|
||||
async def with_heartbeat(
|
||||
coro: Awaitable[Any],
|
||||
*,
|
||||
interval: float = HEARTBEAT_INTERVAL_SECONDS,
|
||||
) -> AsyncIterator[tuple[str, Any]]:
|
||||
"""Exécute `coro` en émettant ('heartbeat', None) toutes les `interval`s tant
|
||||
qu'elle n'est pas terminée, puis ('result', valeur).
|
||||
|
||||
L'exception éventuelle de `coro` est propagée (re-levée par `task.result()`),
|
||||
donc l'appelant peut l'attraper normalement. Si l'itération est abandonnée
|
||||
(client déconnecté), la tâche sous-jacente est annulée.
|
||||
"""
|
||||
task: asyncio.Task = asyncio.ensure_future(coro)
|
||||
try:
|
||||
while not task.done():
|
||||
done, _ = await asyncio.wait({task}, timeout=interval)
|
||||
if not done:
|
||||
yield ("heartbeat", None)
|
||||
yield ("result", task.result())
|
||||
finally:
|
||||
if not task.done():
|
||||
task.cancel()
|
||||
Reference in New Issue
Block a user