Chat atelier : reranking LLM d un pool elargi (opt-in RAG_RERANK)
Recupere 3x top_k passages (max 24), fait noter leur pertinence par le LLM en un appel (temperature 0, extraits tronques a 600 car.), garde les top_k mieux notes (tri stable : a note egale l ordre cosinus est preserve). Best-effort : echec LLM ou notes inexploitables -> classement cosinus. Desactive par defaut (+1 appel avant le premier token) ; recommande avec un provider cloud rapide via RAG_RERANK=true. Co-Authored-By: Claude Opus 4.8 <noreply@anthropic.com>
This commit is contained in:
@@ -89,6 +89,13 @@ class Settings(BaseSettings):
|
||||
# False = relire TOUT le document à chaque question (exhaustivité maximale).
|
||||
deep_summary_filter: bool = True
|
||||
|
||||
# Reranking LLM du chat atelier : recupere un pool elargi (3x top_k, max 24)
|
||||
# puis fait NOTER la pertinence de chaque extrait par le LLM avant d'injecter
|
||||
# les top_k meilleurs. Meilleure precision sur les questions ambigues, MAIS
|
||||
# +1 appel LLM avant le premier token (quelques secondes sur un petit modele
|
||||
# local). Desactive par defaut ; recommande avec un provider cloud rapide.
|
||||
rag_rerank: bool = False
|
||||
|
||||
# Cosinus minimal pour qu'un extrait soit injecté dans le prompt du chat
|
||||
# atelier : en dessous, l'extrait n'a aucun rapport avec la question → mieux
|
||||
# vaut moins d'extraits que du bruit. Défaut conservateur (0.30) : les paires
|
||||
|
||||
Reference in New Issue
Block a user