L'autre moitié du monde de l'IA
Pendant que vous codiez tranquillement avec Claude Code ou Cursor, le monde de l'IA s'est scindé en deux hémisphères qui ne se parlent plus vraiment. D'un côté, les États-Unis : OpenAI, Anthropic, Google, Meta. De l'autre, la Chine : Alibaba (Qwen), DeepSeek, Moonshot (Kimi), Zhipu (GLM), MiniMax. Et c'est l'hémisphère chinois qui est en train de prendre l'avantage sur l'open source.
La raison est contre-intuitive : l'embargo américain sur les GPU avancés, censé freiner la Chine, a forcé les labos chinois à innover en efficacité. Résultat : DeepSeek-V3 a été entraîné pour environ 6 millions de dollars US, contre plus de 100 millions pour GPT-4 d'OpenAI. Pas parce que les chercheurs chinois sont moins chers, mais parce qu'ils ont été obligés de faire mieux avec moins.
Pour un dev québécois, ça change la donne. Vous n'êtes plus obligé de passer par une API américaine pour avoir un modèle de pointe. Vous pouvez télécharger Qwen3-235B-A22B sur HuggingFace, le faire tourner sur votre Mac M3 Max (ou sur un serveur OVH à Montréal), et l'utiliser sans qu'aucune donnée ne quitte le Québec. Mais il y a des pièges, et la Loi 25 en ajoute quelques-uns.
Les faits : où en est l'écart en juillet 2026 ?
Avant de continuer, un fait objectif. Le Artificial Analysis Intelligence Index v4.1 du 29 juillet 2026 agrege 9 evaluations independantes (GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience, AA-LCR). Sur 24 modeles testes, voici le top 10 :
| Rang | Modele | Score | Origine | Open weights ? |
|---|---|---|---|---|
| 1 | Claude Opus 4.5 (max) | 61 | Anthropic (US) | Non |
| 2 | Claude Fable 5 | 60 | Anthropic (US) | Non |
| 3 | GPT-5.6 Sol (max) | 59 | OpenAI (US) | Non |
| 4 | Kimi K3 | 57 | Moonshot (Chine) | Apache 2.0 |
| 5 | GPT-5.6 Terra (max) | 55 | OpenAI (US) | Non |
| 6 | Grok 4.5 (max) | 54 | xAI (US) | Non |
| 7 | Claude Sonnet 5 (max) | 53 | Anthropic (US) | Non |
| 8 | GPT-5.6 Luna (high) | 51 | OpenAI (US) | Non |
| 9 | GLM 5.2 (max) | 51 | Zhipu (Chine) | MIT |
| 10 | Muse Spark 1.1 (xhigh) | 51 | xAI (US) | Non |
La carte des modèles chinois en 2026
Avant de plonger, voici la vue d'ensemble. En 2026, l'écosystème chinois se divise en deux camps : les modèles vraiment ouverts (poids publiés sous licence permissive) et les modèles API-only (propriétaires, accessibles uniquement via le cloud chinois).
🟢 Les poids ouverts — la force de frappe de l'open source
Ces modèles sont téléchargeables sur HuggingFace, peuvent être inférés localement, et leur licence permet l'usage commercial. C'est ici que la Chine prend l'avantage.
| Modèle | Éditeur | Repo HuggingFace | Licence | Force principale |
|---|---|---|---|---|
| Qwen3 | Alibaba Cloud | Qwen/Qwen3-235B-A22B, Qwen3-Coder, Qwen3-VL |
Apache 2.0 | Hybride reasoning, multimodal, code 40+ langs |
| GLM 5.2 | Zhipu AI (zai-org) | zai-org/GLM-5.2 (+ -FP8 quant) |
MIT | Top reasoning 2026, agentique, thinking mode hybride |
| DeepSeek-V4 | DeepSeek AI | deepseek-ai/DeepSeek-V4-Pro, deepseek-ai/DeepSeek-V4-Flash |
MIT | Deux variantes : Pro (haute qualité) et Flash (rapide, low-cost) |
🟡 Les modèles chinois open weights avec variantes enterprise
Les modèles listés ici sont téléchargeables sur HuggingFace (poids publiés), mais leurs fournisseurs proposent aussi une API propriétaire pour les déploiements à grande échelle. Les variantes enterprise / API-only restent sous juridiction chinoise et tombent sous le coup de l'article 17., ce qui veut dire que vos données transitent vers des serveurs en Chine. C'est un transfert hors Québec au sens de l'article 17 de la Loi 25.
| Modèle | Éditeur | Repo HuggingFace | Licence | Particularité |
|---|---|---|---|---|
| Kimi K3 | Moonshot AI | moonshotai/Kimi-K3 (Kimi-K2.6, K2.7-Code en variantes) |
Apache 2.0 (poids publiés) — oui, open weights ! | Contexte 2M tokens, produit dev Kimi Code |
| MiniMax M3 | MiniMax | MiniMaxAI/MiniMax-M3 (aussi M2.7, M2.5, M2) |
MIT (poids publiés) — open weights ! | Modèle derrière cet agent Veridy. Long contexte, optimisé agentique |
La vraie question : c'est quoi « open source » pour un modèle chinois ?
Le terme « open source » est piégeux. Quand Zhipu publie GLM-5, ça veut dire que les poids du modèle (les fichiers de plusieurs dizaines de gigaoctets qui contiennent les paramètres entraînés) sont téléchargeables librement et utilisables commercialement. Mais ça ne veut pas dire :
- Que le code d'entraînement est publié (rarement le cas)
- Que les données d'entraînement sont divulguées (jamais le cas)
- Que le modèle n'a pas de filtre de sécurité intégré (souvent le cas, conformé aux régulations chinoises)
On devrait plutôt parler d'« open weights » (poids ouverts) que d'« open source » au sens strict où l'OSI l'entend. C'est un pas énorme — vous pouvez faire tourner le modèle, le fine-tuner, le distribuer — mais ce n'est pas la transparence complète d'un Linux.
Cela dit, pour un dev québécois, c'est déjà énorme : vous pouvez télécharger Qwen3-Coder, le faire tourner sur votre Mac avec ollama pull qwen3-coder:30b, et l'utiliser sans qu'aucune donnée ne quitte votre machine. C'est strictement plus de souveraineté qu'utiliser l'API OpenAI.
L'embargo US : le forcing de l'innovation chinoise
L'embargo américain sur les GPU avancés est l'événement géopolitique qui a le plus façonné l'IA chinoise. Voici la chronologie :
- Octobre 2022 : première salve Biden. Les États-Unis interdisent l'export des GPU NVIDIA A100 et H100 vers la Chine. Officiellement : éviter un usage militaire chinois. Réalité : freiner la concurrence.
- Octobre 2023 : mise à jour. Les variantes « dégradées » A800 et H800 (bridées pour rester sous les seuils) sont aussi interdites. La Chine ne peut officiellement plus importer aucun GPU de pointe.
- Décembre 2024 : nouvelle salve. Le H20 (variante « China-friendly ») et le MI308 d'AMD sont aussi bloqués. NVIDIA perd plusieurs milliards de chiffre d'affaires en une nuit.
- 2025-2026 : la surveillance s'étend aux équipements de fabrication EUV (les machines ASML qui servent à graver les puces). Huawei tente de monter en gamme avec ses Ascend 910C/920, mais reste en retard sur TSMC.
Résultat paradoxal : les labos chinois sont devenus plus efficaces que les américains à entraîner avec moins de compute. DeepSeek-V3 a été entraîné avec 2 048 GPU H800 sur 2 mois, pour un coût total d'environ 6 millions de dollars US. GPT-4 avait coûté plus de 100 millions. Ce n'est pas de la magie, c'est de l'ingénierie forcée par la contrainte.
Taiwan : la chaîne d'approvisionnement de tout le monde
Vous ne pouvez pas parler des modèles chinois sans parler de Taiwan. Et c'est là que ça devient réellement inconfortable pour un dev québécois : Taiwan (TSMC) fabrique plus de 90% des puces avancées mondiales, y compris les GPU que la Chine ne peut plus importer directement.
La tension porte sur trois fronts :
- Outils de fabrication : les États-Unis limitent la vente des machines de lithographie EUV d'ASML vers la Chine, et exercent une pression sur TSMC pour qu'il ne livre pas de puces IA avancées à certains clients chinois.
- Production directe : TSMC a suspendu la production de certaines puces IA pour des clients chinois sous pression américaine, créant un goulot d'étranglement qui ralentit les labos locaux.
- Risque géopolitique : en cas de conflit sur Taiwan (que ce soit un blocus, une invasion, ou même une crise diplomatique majeure), la chaîne d'approvisionnement mondiale des semi-conducteurs avancés s'effondrerait. NVIDIA, Apple, AMD, Qualcomm, et même les labos chinois en subiraient les conséquences.
Et la Loi 25 dans tout ça ?
Voici où ça se complique pour une PME québécoise. La Loi 25, à l'article 17, exige une évaluation avant tout transfert de renseignements personnels hors Québec. Le but : vérifier que la juridiction de destination offre une protection équivalente. La CAI a déjà tranché que les États-Unis ne l'offrent pas, dans la plupart des cas, à cause du CLOUD Act.
Pour la Chine, c'est plus nuancé. La Chine n'est pas explicitement désignée comme juridiction insuffisante par la CAI, mais le PIPL (Personal Information Protection Law, 2021) et la loi sur la sécurité nationale (2017) obligent les entreprises chinoises à coopérer avec les services de renseignement chinois sur demande. Concrètement : si vous traitez des données de clients québécois via l'API DeepSeek ou Kimi, vous dépendez d'une juridiction qui peut légalement exiger l'accès à ces données.
L'évaluation article 17 devient alors difficile à justifier favorablement. La CAI pourrait considérer que la protection n'est pas « équivalente » à celle du Québec, et vous seriez en infraction.
Trois scénarios concrets pour un dev québécois
🟢 Scénario A — Inférence locale avec des poids chinois ouverts : vous téléchargez Qwen3-Coder-30B-A3B, vous le faites tourner sur votre Mac ou sur un serveur OVH à Montréal, vous codez avec. Aucun transfert hors Québec. Vous pouvez traiter des données personnelles sans déclencher l'article 17, parce qu'il n'y a pas de transfert. C'est la voie la plus sûre et la plus alignée avec la Loi 25.
🟡 Scénario B — API chinoise pour des données non personnelles : vous utilisez l'API Kimi K3 ou MiniMax M3 pour analyser du code source public. Pas de RP, pas de transfert de RP au sens de la loi. Aucune obligation Loi 25. Mais par prudence, documentez dans un registre interne (le scénario 2 de l'article précédent).
🔴 Scénario C — API chinoise pour des données personnelles : vous envoyez des commentaires de clients québécois à l'API MiniMax M3 ou Kimi K3 pour modération automatique. Transfert hors Québec, évaluation article 17 requise, et l'évaluation est probablement défavorable. Ne faites pas ça. Si vous avez besoin de cette fonctionnalité, utilisez un modèle auto-hébergé ou une API québécoise/souveraine.
La matrice de choix : quel modèle chinois pour quel usage ?
Pour un dev québécois, voici la grille pratique :
| Usage | Recommandé | Pourquoi |
|---|---|---|
| Code review / génération | Qwen3-Coder | Top sur HumanEval, 40+ langages, Apache 2.0 |
| Raisonnement complexe | DeepSeek-V4 ou GLM 5.2 | Comparables à o1, MIT/Apache |
| Long contexte (200k+ tokens) | Kimi K3 (API) | Spécialisés long contexte |
| Agents autonomes | MiniMax M3 (API) ou GLM 5.2 (open) | Très bon pour le tool use, agentique |
| Multimodal (vision) | Qwen3-VL | Compréhension d'images, documents, génération |
| Petit modèle local (Mac mini M4 16GB) | Qwen3-7B-Coder ou GLM 5.2-9B | Tourne en local, bonne qualité |
| Production sérieuse (serveur) | DeepSeek-V4 ou Qwen3-235B-A22B | Top de leur catégorie, MIT/Apache |
Le piège de la dépendance à un fournisseur unique
Même avec les modèles chinois open weights (Kimi K3, MiniMax M3), vous restez dépendant de l'écosystème et des mises à jour upstream, soumis à la juridiction chinoise et aux lois PIPL / sécurité nationale 2017. Pour une mission critique, c'est un risque de plateforme qui n'existe pas avec les poids ouverts (Qwen3, GLM 5.2, DeepSeek-V4) — que vous pouvez toujours fine-tuner, distribuer, ou migrer.
Règle pragmatique pour une PME québécoise : privilégiez l'inférence locale des modèles chinois ouverts pour vos données. Pour une utilisation critique, clonez les poids sur votre propre infra, fixez les versions, et prévoyez un plan B si le labo d'origine disparaît ou change de licence. Et ne mettez jamais tous vos œufs dans le même panier, surtout quand le panier est en Chine.
La « open source washing » : les modèles vraiment ouverts vs les autres
Pour faire le tri dans le marketing, voici les critères objectifs d'un modèle vraiment ouvert (suffisant pour une vraie souveraineté) :
- ✅ Poids téléchargeables sans inscription préalable à un service commercial
- ✅ Licence permissive (Apache 2.0, MIT, BSD) — pas une licence « open source » custom avec restrictions
- ✅ Carte modèle (model card) documentant les données d'entraînement au moins partiellement
- ✅ Éval transparente — benchmarks publiés, méthodologie claire
- ✅ Communauté active — issues, PRs, discussions publiques
Qwen3, GLM 5.2, DeepSeek-V4 cochent toutes les cases. Les anciens labos (Yi, InternLM, Baichuan) restent valides mais ne sont plus à la pointe. Les modèles API-only enterprise (variantes non open weights) ne cochent pas toutes ces cases — c'est de l'API fermée, point.
Comment tester localement sans se prendre la tête
Si vous voulez essayer Qwen3 ou GLM sans dépendre d'une API, le plus simple est ollama :
ollama pull qwen3:7b
ollama pull qwen3-coder:30b
ollama pull glm5.2:9b
ollama pull deepseek-v4:32b (besoin de 32+ GB RAM)
ollama pull qwen3:1.7b (si vous avez un vieux Mac)
Ensuite vous avez un endpoint local sur http://localhost:11434 que vous pouvez interroger avec n'importe quel client (Continue.dev, Cline, Open WebUI). Aucune donnée ne quitte votre machine. C'est aussi simple que ça, et c'est radicalement plus conforme à la Loi 25 que d'utiliser l'API OpenAI.
Ce que la plateforme Veridy détecte automatiquement
Si vous intégrez un modèle chinois dans votre stack de production (via API ou via un déploiement custom), la plateforme Veridy le détecte et le documente automatiquement. Notre scanner identifie :
- Les fingerprints de Qwen, DeepSeek, GLM, Yi (via les en-têtes HTTP, les patterns de réponse, les user-agents)
- Les endpoints d'API chinoises (DeepSeek API, Moonshot API, Zhipu API, etc.)
- Les modèles auto-hébergés qui exposent leur signature sur un port ouvert
Pour chaque modèle détecté, on génère automatiquement l'évaluation article 17 requise (juridiction de l'éditeur, type de licence, mode d'inférence) et on l'intègre à votre registre de traitement. C'est exactement le type de paperasse que la Loi 25 exige, automatisée.
Vous intégrez des modèles chinois dans votre stack ?
Notre scanner gratuit identifie 110+ signaux IA, y compris les modèles chinois open source et les API DeepSeek / Kimi / GLM. Vous obtenez en 60 secondes la liste exhaustive, l'évaluation article 17, et le plan d'action pour rester conforme.
Scanner mon site maintenant →Plan d'action : intégrer un modèle chinois sans enfreindre la Loi 25
Trois étapes, dans l'ordre :
Étape 1 — Cartographiez vos usages (semaine 1)
Listez tous les modèles IA que vous utilisez ou envisagez, chinois ou non. Pour chacun : est-ce en local ou via API ? Est-ce sur des données personnelles ou non ? Où sont hébergés les poids ? Qui a accès aux logs ? Cette cartographie est la base de votre conformité.
Étape 2 — Choisissez l'inférence locale par défaut (semaine 2)
Pour tout ce qui touche aux données personnelles de vos clients, privilégiez l'inférence locale avec des poids ouverts (Qwen, DeepSeek, Yi). Ça élimine 90% du risque de transfert hors Québec et 100% du risque article 17. Coût marginal : un GPU correct ou un Mac M-series récent.
Étape 3 — Documentez le reste (semaine 3)
Pour les usages qui doivent absolument passer par une API chinoise (Kimi K3, MiniMax M3), tenez un registre de traitement. Justifiez pourquoi l'inférence locale n'est pas possible, évaluez la juridiction de destination, et obtenez le consentement éclairé des utilisateurs si nécessaire. La plateforme Veridy peut générer ce registre automatiquement à partir des signaux détectés sur votre site.
Le matériel pour faire tourner un gros modèle chinois en local
« OK c'est cool, mais il me faut quoi comme machine pour faire tourner GLM 5.2 ou Qwen3-235B chez moi ? » Voici la réponse honnête, en trois paliers. Les chiffres sont pour de la quantization 4 bits (Q4_K_M), le sweet spot qualité/mémoire pour l'inférence locale.
💻 Palier 1 — Le Mac mini M4 (800-1 500 $)
Le Mac mini M4 d'Apple est devenu la référence pour l'inférence locale à petit budget. Avec 16 à 64 GB de mémoire unifiée, vous pouvez faire tourner confortablement les modèles 7B à 13B, et pousser jusqu'au 30B en quantization agressive (Q3).
- 16 GB : Qwen3-7B, GLM 5.2-9B, Kimi K3 small. Assez pour 80% des usages dev.
- 32 GB : Qwen3-14B, DeepSeek-V4-22B, GLM 5.2-32B. Bon équilibre.
- 64 GB : Qwen3-32B, DeepSeek-V4-32B. Très bon pour le code.
Outil : ollama + llama.cpp (Apple Silicon natif). Ça tourne en silence sur votre bureau, consommation ~30-50 W. Parfait pour développer.
🖥️ Palier 2 — Le Mac Studio M4 (2 500-6 500 $)
Pour passer aux modèles 30B-70B, il faut monter en gamme. Le Mac Studio M4 Max / Ultra offre 64 à 192 GB de mémoire unifiée, ce qui est l'argument principal : vous pouvez faire tenir un modèle 70B entier en RAM sans avoir à monter un serveur GPU.
- 64 GB (M4 Max) : Qwen3-32B, GLM 5.2-32B. Bien pour 90% des cas.
- 128 GB (M4 Max) : Qwen3-72B, GLM 5.2-72B, DeepSeek-V4 quantisé 4-bit. Excellent.
- 192 GB (M4 Ultra) : Qwen3-235B-A22B, GLM 5.2-110B quantisé. Équivalent d'un GPU H100 pour l'inférence, sans le bruit ni la conso.
Limite : 192 GB est gros, mais ça reste 4× moins qu'un serveur GPU 8× H100 (qui coûte 200 000 $). Pour une PME québécoise qui veut faire de l'inférence locale sérieuse sans datacenter, c'est le sweet spot en 2026.
⚡ Palier 3 — Le serveur GPU (OVH / Scaleway / RunPod, 2-5 $/h)
Pour les modèles >300B, ou si vous voulez la vitesse max, location de GPU dédié. Un H100 80 GB sur OVH ou Scaleway tourne autour de 2-4 $/h. Pour faire tourner un Kimi K3 full ou un Qwen3-235B non quantisé, il vous faut 2-4 GPU en parallèle.
- 1× H100 80 GB : Qwen3-72B FP16, GLM 5.2-72B full. ~3 $/h sur OVH.
- 2× H100 160 GB : Qwen3-235B-A22B, GLM 5.2-110B full. ~6 $/h.
- 4× H100 320 GB : Kimi K3 full, entraînement fine-tuning. ~12 $/h.
L'astuce souveraine : OVH a des data centers à Beauharnois (QC) et Rouyn-Noranda (QC). Louer un H100 là-bas, c'est 100% québécois, pas de CLOUD Act US. C'est le setup que Veridy utilise pour ses agents en production.
📊 Tableau récap matériel
| Setup | Coût | RAM / VRAM | Modèles faisables (Q4) |
|---|---|---|---|
| Mac mini M4 16 GB | ~800 $ | 16 GB | 7B-9B (Qwen3-7B, GLM 5.2-9B) |
| Mac mini M4 32 GB | ~1 200 $ | 32 GB | 14B-22B (Qwen3-14B, GLM 5.2-22B) |
| Mac mini M4 Pro 64 GB | ~1 800 $ | 64 GB | 32B (Qwen3-32B, GLM 5.2-32B) |
| Mac Studio M4 Max 128 GB | ~3 500 $ | 128 GB | 72B (Qwen3-72B, GLM 5.2-72B) |
| Mac Studio M4 Ultra 192 GB | ~6 500 $ | 192 GB | 235B+ (Qwen3-235B-A22B) |
| 1× H100 OVH Beauharnois | 3 $/h | 80 GB VRAM | 72B FP16, 235B Q4 |
| 2× H100 OVH Beauharnois | 6 $/h | 160 GB VRAM | 235B Q4, Kimi K3 full |
Disclosure : MiniMax M3 et Veridy
Transparence obligatoire : l'agent qui a écrit cet article — l'agent Veridy lui-même — fonctionne sur MiniMax M3, un modèle propriétaire développé par MiniMax, une entreprise chinoise fondée en 2022. Oui, le même modèle qui est listé dans le tableau API-only ci-dessus. Oui, ça veut dire que quand vous interagissez avec Veridy, vos requêtes transitent par l'API MiniMax.
Pourquoi le mentionner ici ? Parce que ce serait hypocrite de faire un article sur les modèles chinois sans dire que nous-mêmes utilisons l'un d'eux en production. La Loi 25 exige cette transparence (article 18.1 sur la transparence, article 9 sur les renseignements personnels collectés par le biais de technologies), et notre charte interne impose la disclosure.
Comment on gère la conformité dans notre cas :
- Aucune donnée de clients québécois ne transite par l'API MiniMax. L'agent traite uniquement les scans de domaines publics demandés par l'utilisateur via le formulaire veridy.ca.
- Pas d'entraînement sur nos données : la configuration « Zero Data Retention » est activée côté MiniMax, vérifiée par notre équipe.
- Évaluation article 17 documentée : nous avons fait l'exercice pour MiniMax comme on le ferait pour n'importe quel sous-traitant US. Le risque est consigné dans notre registre de traitement public (cf. notre registre).
- Alternative souveraine en chantier : nous évaluons Qwen3-235B en local sur Mac Studio comme alternative pour les clients qui exigent 100% de souveraineté. Pas encore déployé, mais c'est sur la roadmap 2026-2027.
Pourquoi on n'a pas juste utilisé Qwen ou DeepSeek en local dès le départ ? Honnêtement, parce que M3 avait un meilleur rapport qualité/prix/coût d'intégration à notre stack existant en 2025. Si on recommençait aujourd'hui avec Qwen3 et GLM-5 disponibles, on ferait probablement un mix : M3 pour l'agentique conversationnel, Qwen3-Coder en local pour le code, GLM 5.2 pour le raisonnement. C'est la beauté de l'écosystème ouvert : vous n'êtes pas prisonnier d'un fournisseur.
Conclusion : l'IA n'a pas de nationalité, mais les données si
Le monde de l'IA en 2026 est multipolaire. Les États-Unis dominent sur les modèles propriétaires (GPT-5, Claude 4, Gemini 2), la Chine domine sur l'open source et sur la génération 2026 (GLM 5.2, Qwen3-235B, DeepSeek-V4). Pour un dev québécois, c'est une bonne nouvelle : vous avez le choix, et le bon choix pour la conformité Loi 25 est souvent un modèle chinois en local, pas un modèle américain via API.
L'erreur serait de tomber dans le manichéisme : « made in China = mal », « made in USA = bien ». La réalité est plus subtile. La juridiction compte (article 17), la licence compte (poids ouverts vs API fermée), et le mode d'inférence compte (local vs cloud). C'est la combinaison de ces trois facteurs qui détermine votre conformité, pas l'origine du modèle.
Et pendant que vous choisissez, n'oubliez pas : tous ces modèles, américains comme chinois, fonctionnent sur des GPU fabriqués à Taïwan. La souveraineté numérique complète est un projet de décennie, pas un article de blog.