Une explication simple

Ce que je construis avec Jarvis

Maman, cette page est pour t’expliquer tranquillement le projet sur lequel je travaille. Jarvis est le nom que j’ai donné à un assistant personnel que je construis petit à petit.

L’idée en quelques mots

Tu utilises déjà ChatGPT, donc tu connais le principe d’un modèle qui reçoit une demande et produit une réponse. Jarvis reprend cette possibilité, mais l’insère dans un environnement que je contrôle : mes outils, mes documents, mes sources et des règles précises sur ce que le système a le droit de faire.

Jarvis n’est donc pas un autre chatbot. C’est plutôt une architecture d’assistant personnel : plusieurs programmes spécialisés coopèrent, tandis qu’un noyau central conserve le contexte, applique les permissions et décide quelle capacité utiliser.

En une phrase : Jarvis est un système que je construis pour transformer des informations dispersées en contexte utile, tout en gardant la maîtrise des données, des outils et des décisions.

Comment ça fonctionne

On peut le décrire comme une composition de fonctions : une source entre dans un premier traitement, le résultat devient l’entrée du suivant, puis l’ensemble produit une information exploitable. Chaque étape a un contrat et peut être testée séparément.

Un exemple concret : de la voix au contexte

Si je produis un enregistrement, un moteur de transcription — par exemple Whisper — estime le texte correspondant à la parole. Un worker, c’est-à-dire un programme qui travaille en arrière-plan, prend ensuite ce texte et peut produire un résumé. Les transcriptions, les résumés et les états de traitement sont conservés dans des fichiers et une base SQLite.

Le résumé n’est pas considéré comme la vérité : il reste relié à sa source. C’est l’équivalent, en informatique, d’un résultat calculé que l’on conserve avec ses données d’entrée et ses conditions de calcul.

Un serveur, concrètement

Un serveur n’est pas forcément une grande machine dans une entreprise. Ici, c’est souvent simplement un programme qui reste disponible et attend une demande sur le réseau. Par exemple, un service peut recevoir un texte, effectuer un traitement, puis renvoyer un résultat. La machine peut être mon ordinateur, mon téléphone ou un autre appareil auquel j’ai donné un accès contrôlé.

Le mot « serveur » décrit donc surtout un rôle : un programme qui rend un service. Il ne signifie pas automatiquement que mes données partent sur Internet.

Pourquoi je fais ça

Mon travail, mes recherches, mes idées et mes projets produisent beaucoup d’informations. Le problème n’est pas seulement de les stocker : c’est de pouvoir retrouver le bon élément, dans le bon contexte, au moment où il devient utile.

Je construis donc un système qui relie expérimentation, mémoire et automatisation. Cela me permet de travailler sur la voix, les logiciels, le téléphone, les messages et l’intelligence artificielle sans traiter chaque sujet comme un projet isolé.

Je ne cherche pas à fabriquer un robot magique. Je cherche à construire un système modulaire, observable et améliorable, qui me fasse gagner du temps sans me retirer la décision.

Ce que cela peut m’apporter

  • reconstituer un contexte à partir de plusieurs sources ;
  • résumer des textes, des enregistrements ou des échanges ;
  • conserver la provenance d’une information ;
  • automatiser des tâches répétitives avec des limites explicites ;
  • tester des hypothèses et améliorer mes méthodes de travail.

Ce que cela demande

  • du temps pour concevoir et programmer ;
  • des essais, des erreurs et des corrections ;
  • une séparation stricte entre données, programmes et secrets ;
  • des tests et des vérifications indépendantes ;
  • la patience nécessaire pour distinguer une démonstration d’un résultat seulement plausible.

Ce que Jarvis ne fait pas

Jarvis ne remplace pas mon jugement. Un modèle de langage produit une réponse vraisemblable ; il ne garantit pas à lui seul sa vérité. Pour une décision importante, je dois contrôler les sources et le raisonnement.

Je fais donc attention à séparer les informations personnelles, les messages, les fichiers audio et les programmes. Je garde aussi des traces de ce qui a été testé.

Où j’en suis

Le projet possède déjà plusieurs sous-systèmes : transcription audio locale, génération de résumés, mémoire sur fichiers et SQLite, identification vocale séparée, liaison avec le téléphone Android, intégration WhatsApp et outil de construction de petites applications web.

La partie WhatsApp a été travaillée avec une passerelle dédiée, une base de session et une API locale. Le système historique reste un fallback tant que la migration complète n’est pas validée. Cette distinction entre « opérationnel », « expérimental » et « prévu » est importante pour ne pas confondre une architecture documentée avec un service réellement disponible.

La transcription et les résumés sont séparés afin de pouvoir modifier un composant sans déstabiliser les autres. C’est une forme de modularité : chaque sous-système peut évoluer derrière une interface connue.

Le plus important : Jarvis n’est pas un produit fini que j’aurais acheté. C’est un projet que je construis et que j’améliore progressivement. Certaines parties fonctionnent déjà, d’autres sont encore des essais ou des plans, et je vérifie cet état dans le code et les tests plutôt que de me fier aux annonces.

Si tu veux retenir seulement trois choses

  1. Jarvis est une architecture d’assistant personnel que je programme et que j’observe moi-même.
  2. Il transforme des sources — voix, messages, fichiers — en informations organisées et réutilisables.
  3. Je dois rester maître des données, des permissions, des actions et de la validation finale.

Le vocabulaire peut sembler technique, mais l’idée est assez classique : définir des entrées, des transformations, des sorties et des contrôles. La difficulté est de rendre cette chaîne fiable, privée et utile dans la vie réelle. C’est précisément ce que je suis en train de construire.