Le marché de l'IA on-device atteint 30,74 milliards de dollars en 2026, avec un CAGR de 17,46 % jusqu'en 2031. Qualcomm, Apple et MediaTek équipent smartphones, PC et appareils IoT de NPU capables d'exécuter des LLMs localement.
Les Neural Processing Units (NPU) sont devenus le composant central des SoC modernes. Leur rôle : exécuter des inférences d'IA localement, sans envoyer de données au cloud, avec une consommation énergétique 10 à 50 fois inférieure au GPU.
45 TOPS (Hexagon NPU). Équipe 40 % des PC Android premium en 2026. Permet de faire tourner Llama 3.2 8B localement en temps réel. Déploiement en production sur Lenovo ThinkPad, Samsung Galaxy Book.
35 TOPS (Neural Engine). Utilisé dans iPhone 17 et MacBook Pro M4. Apple Intelligence traite les requêtes personnelles sur l'appareil, données jamais envoyées aux serveurs Apple.
50 TOPS. Équipe les flagships Android haut de gamme (Xiaomi, OPPO, Vivo). Génération d'images et traduction temps réel 100 % locale.
48 TOPS (NPU Intel Arc). Certifié Copilot+ PC par Microsoft. Permet l'exécution de modèles SLM (Small Language Models) comme Phi-3 Mini directement dans Windows.
Une nouvelle génération de Small Language Models (SLM) est optimisée pour les NPU embarqués :
Les entreprises les plus efficaces adoptent une architecture hybride : les tâches simples (résumé, classification, extraction) tournent en local sur NPU ; les tâches complexes (raisonnement multi-étapes, génération longue) sont envoyées au cloud. Ce split réduit les coûts tout en maintenant la performance.
Vision industrielle et contrôle qualité en temps réel. Caméras intelligentes avec NPU embarqué remplacent les serveurs de traitement centralisés.
Appareils médicaux connectés (ECG, imagerie portable). L'inférence locale garantit la conformité HIPAA/RGPD.
Terminaux de scan et chariots autonomes avec décision locale. Fonctionne dans les zones de signal faible.
Détection de fraude sur le terminal bancaire. Authentification biométrique locale sans envoi des données au serveur.
Molderez Consult SRL conçoit votre architecture edge AI : on-device, hybride ou cloud selon vos contraintes de confidentialité et de performance.
Concevoir mon architecture IA