Intelligence documentaire locale

Comprendre ses données. Garder les preuves.

MaStack transforme des documents dispersés en une base exploitable, puis permet à un agent local de rechercher, calculer et répondre en citant les éléments qui fondent sa conclusion.

Ce qui est déjà réel

Les chiffres ci-dessous viennent des campagnes et contrôles effectués sur la machine AIN1. Ils décrivent l’état testé, pas une promesse commerciale.

69/69
documents rattachés à un type valide
27/30
conclusions correctes au dernier test répété
15/30
réponses avec citations entièrement complètes
0
nombre final sans provenance dans cette campagne

Comment une réponse est produite

Le modèle n’accède pas librement à tout. Il enquête à travers des capacités bornées et observables.

01

Ingestion

PDF, images et données structurées sont lus, contrôlés et indexés.

02

Organisation

Documents, passages, champs, types et opérations sont conservés dans PostgreSQL.

03

Enquête

L’agent choisit une recherche documentaire, une requête SQL ou un calcul Python.

04

Calcul

Les entrées et les opérations restent visibles et reproductibles.

05

Réponse

La conclusion est rendue avec ses nombres, ses sources et ses limites.

Architecture actuelle

Une architecture locale, privée et remplaçable par composants. Le réseau sert à l’accès, pas à envoyer le fonds documentaire vers un service tiers.

Accès & orchestration
Interface MaStackApplication et API Python
TailscaleAccès privé entre les machines
NUCCode canonique, tests et orchestration
Cœur MaStack
Agent généralisteRecherche, interrogation et calcul traçable
list_documentssearch_passagessearch_fieldsread_documentquery_databaserun_python
PostgreSQLDocuments, types, champs, opérations et provenance
Machine d’inférence AIN1
AMD Radeon 8060SAccélération locale ROCm
llama.cppExécution des modèles quantifiés
llama-swapChargement des modèles à la demande

Les quatre difficultés principales

La puissance matérielle n’est pas le principal verrou. Les difficultés sont surtout liées à l’enquête, à la preuve et à l’intégration.

1

Trop d’itérations

Quand le contexte initial est insuffisant, l’agent multiplie les requêtes et peut transformer une question simple en longue enquête.

2

Citations incomplètes

La conclusion peut être correcte sans que chaque phrase et chaque nombre soient correctement rattachés à leur preuve.

3

Variabilité

Modèle, prompt, cache, budgets et version des outils doivent être figés pour obtenir des campagnes réellement comparables.

4

Consolidation produit

Les améliorations validées existent encore dans plusieurs branches de travail. Elles doivent être réunies avant la remise en service.

Où part le temps

La latence réseau est marginale. La durée dépend principalement du nombre d’étapes de raisonnement et d’appels aux outils.

Réseau interne
≈ 0,08 s
Question courante
10–15 s
Moyenne E2E
48,69 s
Pire enquête
595,63 s
Lecture importante
Changer de modèle peut accélérer le décodage, mais ne corrige pas un agent qui réalise vingt tours de trop. Le meilleur levier est de réduire l’enquête inutile, puis de construire les citations directement depuis les résultats déjà obtenus.

Chemin vers une version exploitable

La direction retenue est volontairement simple : supprimer les couches spécialisées, consolider, mesurer, puis remettre en ligne.

Étape 1 · maintenant

Consolider

Réunir les correctifs dans un seul candidat propre.

  • Six capacités génériques
  • Contexte initial compact
  • Budgets de tours et d’appels
Étape 2 · validation

Mesurer

Rejouer plusieurs fois le même benchmark, avec un environnement figé.

  • Exactitude
  • Citations et provenance
  • Latence par étape
Étape 3 · produit

Remettre en service

Déployer uniquement le candidat validé et surveiller les écarts réels.

  • API MaStack
  • Inférence dédiée
  • Télémétrie et reprise

MaStack ne cherche pas à remplacer les outils par un chatbot. Elle cherche à rendre les données interrogeables, calculables et vérifiables depuis une interface simple.