Ce qui a été annoncé, et ce qui ne l’a pas été

Le 3 juin 2026, Google a présenté Gemma 4 12B, décrit comme un modèle multimodal « unifié » et « sans encodeur » : les entrées visuelles et audio sont traitées directement par le modèle de langage, sans module séparé. Google le présente comme le premier modèle de taille moyenne doté d’entrées audio natives, et indique qu’il tourne avec 16 Go de mémoire graphique (VRAM) ou de mémoire unifiée, soit moins de la moitié de l’empreinte mémoire du modèle Gemma 4 de 26 milliards de paramètres. Le modèle est publié sous licence Apache 2.0, une licence permissive, et proposé sur Hugging Face, Kaggle, Ollama, LM Studio et l’application Google AI Edge Gallery.

Quelques jours plus tôt, lors de la keynote de Jensen Huang au Computex (31 mai au soir, heure de Californie, soit le 1er juin à Taipei), NVIDIA a présenté RTX Spark : un GPU Blackwell RTX de 6 144 cœurs CUDA associé à un processeur Grace de 20 cœurs conçu avec MediaTek, annoncé à 1 pétaflop de performance IA. NVIDIA décrit trois familles d’appareils : des portables, un mini-PC destiné à faire tourner des agents personnels en continu et une station de travail DGX pour Windows. ASUS, Gigabyte, HP, Lenovo et MSI font partie des constructeurs cités, et Microsoft fournit Windows.

Ce qui n’a pas été dit est aussi important : ni prix public de référence pour RTX Spark dans l’annonce, ni date de disponibilité en France. Les performances annoncées sont celles des éditeurs ; elles restent à vérifier sur vos propres usages.

Pourquoi l’IA locale intéresse une petite entreprise

Faire tourner un modèle sur un poste de l’entreprise répond d’abord à une question de confidentialité : un devis, un contrat, un dossier client ou un échange avec un avocat n’a pas à quitter la machine pour être résumé ou classé. Le deuxième argument est le coût marginal : une fois le matériel payé, chaque requête supplémentaire ne coûte que l’électricité. Le troisième est l’autonomie : un modèle local fonctionne sans connexion et ne dépend pas des conditions d’un fournisseur, un sujet que la semaine suivante allait rendre très concret (voir notre article sur la suspension de Claude Fable 5).

Les limites existent. Un modèle de 12 milliards de paramètres reste moins capable que les grands modèles en ligne sur les tâches longues ou complexes. Il faut le mettre à jour, surveiller la mémoire et le temps de réponse, et surtout sécuriser le poste lui-même : si l’ordinateur portable est volé, les données qu’il traite partent avec lui. L’IA locale déplace le risque, elle ne le supprime pas.

Trois usages réalistes dès maintenant

Sans promettre de miracle, trois usages se prêtent bien à un modèle local de cette taille :

  • Résumer et classer des documents internes : comptes rendus, courriels, PDF de fournisseurs, sans les confier à un service tiers.
  • Transcrire ou traduire des notes vocales : Google met en avant les entrées audio natives de Gemma 4 12B ; c’est précisément le type de promesse à tester sur vos enregistrements, avec vos accents et votre vocabulaire métier.
  • Préparer des brouillons : réponses types, trames de devis, fiches produit. L’agent prépare, une personne relit et envoie. Rien ne part seul.

Ce qu’il faut tester avant d’adopter

La qualité sur vos propres documents, le temps de réponse sur votre machine réelle (pas sur une fiche technique), la mémoire effectivement consommée pendant une journée de travail et la facilité de mise à jour. Un modèle « qui tient en 16 Go » peut rester inconfortable si d’autres logiciels lourds tournent en parallèle.

La méthode AXDIA : mesurer avant de décider

Nous recommandons une démarche en quatre étapes, qui tient en une demi-journée :

  1. Choisir vingt tâches réelles représentatives de votre activité, avec les documents correspondants (anonymisés si besoin).
  2. Comparer le modèle local et un service en ligne sur ces vingt tâches, en notant la qualité à l’aveugle, le temps et le coût.
  3. Décider tâche par tâche : local pour les données sensibles et les tâches simples, service en ligne pour les tâches difficiles et sans données confidentielles. Le mode hybride est souvent le bon.
  4. Documenter quelles données vont où, et le réviser à chaque changement d’outil.

Dans Prompt OS, la profondeur « Modèle local » écrit des missions plus courtes, une étape à la fois, avec l’obligation de demander l’information manquante plutôt que de l’inventer : c’est le format qui convient le mieux aux modèles exécutés sur un poste. Si vous voulez un outil local sur mesure plutôt qu’un bricolage, voyez notre offre d’outil IA sur mesure.

Conclusion

L’IA locale ne remplace pas les grands modèles en ligne ; elle devient un second outil, réservé aux données que l’on ne veut pas confier et aux tâches simples à fort volume. La semaine du 6 juin 2026 a surtout montré que les modèles ouverts et le matériel grand public convergent. Pour une petite entreprise, le bon réflexe n’est ni l’enthousiasme ni le rejet : c’est un test d’une demi-journée sur ses propres documents.