infrastructure d'IA privée

Nos téléphones dorment. Ils pourraient réfléchir

Chaque appareil de la maison fait tourner un modèle de langage entier. Un coordinateur sait en continu lequel est branché, frais et libre, et lui confie la requête. Tout le monde interroge une seule adresse, compatible avec l'API d'OpenAI. Aucune phrase ne quitte le cercle des appareils.

APK signée maison, hors Play Store : il faut autoriser les sources inconnues.

une appAPI OpenAIcoordinateurbatterie · chaleurréseau · modèleendormidébranchéau travail4,7 tok/sen retrait43 °C

Ce que c'est, en trois phrases

un appareil, un modèle

Le modèle n'est pas découpé entre les appareils. Chaque téléphone charge un modèle entier, adapté à ce qu'il sait faire. Un appareil lent ne ralentit donc personne d'autre : il prend juste moins de travail.

l'appareil tire le travail

Rien n'est poussé vers un téléphone. C'est lui qui réclame du travail quand il en est capable. Un appareil qui s'éteint, se déconnecte ou chauffe cesse simplement de demander — sa requête repart ailleurs.

une seule adresse

Le coordinateur expose une API compatible OpenAI. Les applications existantes changent l'URL et la clé, rien d'autre.

Pourquoi c'est intéressant

Rien ne part chez un tiers

Une question posée à un service cloud est lue, journalisée et conservée par une entreprise. Ici, le texte va d'un appareil de la maison à un autre. Le seul intermédiaire est le coordinateur, qui achemine sans stocker de conversation.

Une requête peut même être marquée privée : elle ne tourne alors que sur vos propres appareils, jamais sur celui de quelqu'un d'autre — quitte à attendre qu'un des vôtres soit disponible.

Du matériel déjà payé, déjà branché

Un téléphone passe la nuit sur son chargeur à ne rien faire. Un ordinateur fixe reste allumé des heures sans rien calculer. Le cluster ne demande aucun achat : il occupe des appareils déjà là, au moment où ils ne servent à personne.

Pas d'abonnement, pas de facturation au million de tokens.

Ce que ça coûte vraiment

Voici les mesures réelles du premier appareil du parc, un Redmi Note 14 Pro 5G. Rien n'est extrapolé d'une fiche technique.

4 à 5tokens/s

génération sur un modèle 3B en Q4

1,46s

chargement du modèle en mémoire

51,2Go/s

bande passante mémoire — le vrai plafond

Autrement dit : c'est plus lent qu'un service cloud d'un ordre de grandeur, et un téléphone qui génère chauffe et se décharge. Les deux sont assumés, et le coordinateur en tient compte avant de confier quoi que ce soit.

Pourquoi c'est lent, et ce que ça coûte au téléphone

C'est lent, et c'est mesuré

4 à 5 tokens par seconde : une réponse de trois cents mots prend une bonne minute. Ce n'est pas un défaut de réglage. Ce qui plafonne un téléphone, ce n'est ni son processeur ni ses 12 Go de mémoire, c'est sa bande passante mémoire de 51,2 Go/s — chaque token généré relit tout le modèle.

On ne déduit donc plus le modèle des caractéristiques annoncées : l'application mesure elle-même le débit de l'appareil au premier lancement, et c'est cette mesure qui décide de ce qu'il fera.

Un téléphone qui génère chauffe et se décharge

Une génération continue fait monter la température, et Android bride le processeur au bout d'une minute environ : le débit peut perdre la moitié. La batterie descend visiblement si l'appareil n'est pas branché.

C'est pour ça que le coordinateur lit la batterie, la température et le réseau avant de confier quoi que ce soit. Sous 40 % de batterie sans chargeur, au-delà de 42 °C, ou sur réseau mobile quand le WiFi est exigé, l'appareil est mis en retrait — et l'écran dit pourquoi. Vous pouvez aussi le mettre en pause d'un geste, à tout moment.

Participer

  1. 01

    Prêter un appareil

    Installez l'application Android, laissez-la choisir un modèle adapté et branchez le téléphone la nuit. Le service tourne au premier plan, avec une notification permanente : vous voyez ce qu'il fait, et vous l'arrêtez quand vous voulez.

  2. 02

    Se connecter, puis entrer

    La connexion se fait avec Google : elle dit qui vous êtes, donc quels appareils sont les vôtres. Il faut ensuite échanger un code d'invitation, donné par quelqu'un de la famille — c'est lui qui ouvre la porte, et il rend votre clé d'API.

  3. 03

    Brancher vos outils

    Pointez n'importe quel client compatible OpenAI sur l'adresse du cluster avec votre clé.

L'application ne passe pas par le Play Store : autorisez l'installation depuis des sources inconnues, puis ouvrez le fichier téléchargé. Les mises à jour se réinstallent par-dessus.

Voir une requête, de bout en bout

Si aucun appareil ne sert le modèle demandé, la requête est mise en file d'attente durable et attend son tour. Il n'y a pas de repli vers une API cloud : c'est un choix, pas un oubli.

curl
curl https://api-cluster.vpsdashboard.space/v1/chat/completions \
  -H "Authorization: Bearer VOTRE_CLE" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen2.5-3b-instruct-q4_k_m",
    "messages": [{"role": "user", "content": "Bonjour"}]
  }'
Ce qu'on ne fait pas
  • — Aucun repli vers un fournisseur cloud quand le parc est vide.
  • — Aucune conversation dans les journaux ni dans les statistiques.
  • — Aucun modèle découpé entre plusieurs appareils.