Retour au blog
6 min de lectureproduit

Transformer 800 000 mots en base de connaissances interrogeable

Trois ans de vidéos ≈ 800 000 mots que personne ne peut chercher. La méthode en 5 étapes — et l'erreur que presque tous les créateurs commettent au départ.

Rédigé avec assistance IA par Kirikat — faits vérifiés sur sources publiques datées.

La plupart des créateurs sont assis sur bien plus de matière qu'ils ne l'imaginent. Trois ans de vidéos hebdomadaires, c'est environ cent heures de parole — huit cent mille mots. Une newsletter bimensuelle pendant deux ans ajoute cinquante mille mots. Et personne, vous compris, n'arrive à y retrouver quoi que ce soit.

Transformer cette archive en quelque chose d'interrogeable relève moins de la technologie que de la préparation. Voici ce qui compte vraiment, dans l'ordre — avec, en fin d'article, les questions qu'on nous pose le plus souvent.

La méthode en 30 secondes

Par quoi commencer ? Les 20 % qui portent les questions

Commencez par les dix questions qu'on vous pose le plus, pas par tout votre catalogue. Retrouvez le contenu où vous avez le mieux répondu à chacune : c'est votre premier import. Il couvrira l'essentiel du trafic réel et il sera juste, ce qui installe la confiance immédiatement.

Le réflexe inverse — tout importer — est l'erreur la plus fréquente. La qualité de recherche est inversement proportionnelle au bruit : plus l'index contient de matière médiocre, plus souvent un passage médiocre remporte la recherche et devient la réponse.

Le reste viendra ensuite, quand les vraies conversations vous montreront ce qui manque.

Quels formats fonctionnent le mieux ?

Le texte d'abord, puis les PDF, puis l'audio et la vidéo — dans cet ordre de fiabilité. Voici pourquoi, format par format :

Texte (articles, newsletters, notes). Le plus simple et le plus fiable. Aucune perte de transcription, structure propre. Si vous n'avez le temps que pour un format, prenez celui-là.

PDF. Très bien, avec une réserve : un PDF qui n'est qu'un scan de page est une image, pas du texte. Si vous ne pouvez pas sélectionner les mots dans votre lecteur, il faut d'abord de l'OCR — Kirikat le déclenche automatiquement sur les PDF scannés, mais un document né numérique restera toujours plus précis.

Vidéos et podcasts. La transcription automatique est excellente aujourd'hui, mais pas exempte d'erreurs, surtout sur les noms propres, les marques et le jargon technique. Prévoyez dix minutes pour relire la transcription de vos épisodes les plus importants et corriger les fautes récurrentes. Un modèle qui a appris le nom de votre produit de travers le répétera de travers indéfiniment.

Commentaires et messages privés. Tentant, car c'est là que vivent les vraies questions, mais prudence : on y trouve aussi les mots et les données personnelles d'autrui. Si vous les utilisez, extrayez vos réponses, pas le fil entier.

Pourquoi la structure prime-t-elle sur le volume ?

Parce qu'un système de recherche ne lit pas votre archive en entier : il en extrait des passages d'environ 300 à 400 mots et répond à partir d'eux. Chez Kirikat, chaque document importé est découpé en fragments de cette taille, indexés individuellement. Si un fragment dit « comme expliqué plus haut, faites pareil mais avec l'autre variable », il est inexploitable hors contexte — et c'est exactement hors contexte qu'il sera retrouvé.

Deux habitudes règlent l'essentiel :

  • Utilisez de vrais titres. Ils indiquent où commencent et finissent les idées — le découpage les suit.
  • Répétez le sujet de temps en temps. « Pour le levain, l'hydratation doit être… » survit à l'extraction. « Pour ça, il faut… » non.

Inutile de réécrire votre archive. L'appliquer aux nouveaux contenus suffit ; l'ancien matériel sera simplement un peu moins performant, et les journaux de conversation vous diront lequel.

Que doit-il répondre quand il ne sait pas ?

« Je n'ai pas traité ce point » — jamais une improvisation qui sonne comme vous. Toute base de connaissances a des trous, et c'est dans les trous que meurt la confiance. C'est un choix de conception : un personnage IA digne de ce nom refuse d'inventer et cite la source de chaque réponse — vous pouvez le vérifier en direct sur le Kirikat de démonstration d'une boulangerie genevoise : demandez-lui un prix qui n'est pas publié, il vous renverra vers la boutique.

Même chose pour les sujets sur lesquels vous avez changé d'avis. Si votre conseil de 2023 contredit celui de 2026, le système ira chercher l'ancien sans hésiter. Retirez la pièce périmée de l'index, ou ajoutez une version plus récente et plus nette qui remportera la recherche.

Combien de temps demande l'entretien ?

Quinze minutes par semaine, en trois gestes :

  1. Lisez les conversations. Cherchez deux choses : les réponses fausses, et les questions sans bonne réponse.
  2. Corrigez les fausses à la source — rectifiez la transcription, retirez l'article périmé.
  3. Transformez les questions sans réponse en contenu. C'est la partie qui se rentabilise toute seule : votre audience vous tend une liste priorisée de ce qu'il faut produire ensuite, avec ses propres mots. Pour beaucoup de créateurs, cette liste vaut davantage que les revenus d'abonnement.

Quel résultat espérer, concrètement ?

Bien préparée, une base de connaissances répond correctement à la grande majorité des questions courantes, cite d'où vient chaque réponse, et assume le reste. Ce n'est pas magique, et ça n'a pas besoin de l'être. Cela signifie simplement que la quatre-centième personne qui demande quel appareil vous utilisez obtient une bonne réponse immédiatement — et que vous récupérez votre soirée.

Questions fréquentes

Combien de contenu faut-il pour démarrer ? Dix bonnes réponses suffisent. Une base de dix documents justes bat une base de mille documents bruités : commencez petit, laissez les conversations réelles guider les imports suivants.

Quels formats puis-je importer dans Kirikat ? Texte brut, articles web (par URL), PDF — y compris scannés, l'OCR est automatique —, documents Office, images (décrites automatiquement), et audio ou vidéo via transcription. Le texte natif reste le format le plus fiable.

L'IA peut-elle inventer des réponses ? Elle est conçue pour l'inverse : chaque réponse est ancrée dans un passage de votre contenu et la source est citée. Quand aucun passage ne correspond, elle le dit — c'est la différence fondamentale avec un chatbot générique.

Mes contenus servent-ils à entraîner d'autres modèles ? Non. Votre base de connaissances n'alimente que votre propre personnage IA ; elle n'est ni partagée entre créateurs ni utilisée pour entraîner des modèles tiers.

Combien de temps prend l'import initial ? Quelques minutes par document : le découpage et l'indexation sont automatiques. La seule étape qui mérite votre temps est la relecture des transcriptions de vos contenus les plus importants.

Votre archive, c'est des années de réponses déjà écrites. Rendez-les interrogeables →

À lire ensuite