
Let's Run DeepSeek V4 Flash vs Pro - Local AI Coding, Maths & Logic TESTED đ§
ExĂ©cutons DeepSeek V4 Flash vs Pro - Codage IA local, Maths et Logique TESTĂS đ§
Mots-clés
Résumé
155 mots
Ăvaluation critique
Valeur des informations & soliditĂ© de l’argumentation
La valeur de l’information rĂ©side dans le test concret et reproductible en partie, avec des mĂ©triques de performance prĂ©cises (tokens/s, mĂ©moire utilisĂ©e) et une comparaison entre plusieurs configurations. L’argumentation est solide pour les aspects mesurables, mais la partie visuelle repose sur une apprĂ©ciation subjective, sans double aveugle ni critĂšres objectifs. Les Ă©checs sont honnĂȘtement rapportĂ©s, ce qui renforce la crĂ©dibilitĂ©. Toutefois, l’absence de contrĂŽle strict des variables (tempĂ©rature, seed) limite la robustesse des conclusions.
Rigueur scientifique, qualité des sources, adéquation du titre
La rigueur scientifique est moyenne : le test est empirique mais non contrĂŽlĂ©, et les sources principales sont des rĂ©fĂ©rences Ă la page Hugging Face du modĂšle et Ă l’application Inferencer. Aucune source acadĂ©mique n’est citĂ©e. Le titre correspond exactement au contenu, et la description fournit des liens vers les ressources utilisĂ©es. L’analyse des commentaires (non fournis ici) ne peut ĂȘtre rĂ©alisĂ©e, mais les chiffres de likes et vues indiquent un intĂ©rĂȘt certain.
162 mots
Adéquation titre / contenu
Le titre correspond bien au contenu : la vidéo compare effectivement les versions Flash et Pro, testant codage, maths et logique, en local et sur le cloud.
Qualité & fiabilité
7/10
Le test est concret, avec des mesures de performance (tokens/s, mémoire) et une comparaison de plusieurs quantizations. Cependant, l'évaluation visuelle est subjective, certains tests échouent, et les conditions ne sont pas strictement contrÎlées (température, seed).
Moments clés
RepÚres établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Présentation des quantizations (Q9 et version reconditionnée) et configuration du test.
- Premier test de codage : génération d'un systÚme solaire 3D en un seul fichier.
- Test Flappy Bird : comparaison locale vs cloud, remarques sur la qualité visuelle.
- Questions de logique : voiture, médicaments, chirurgien, problÚme du trolley.
- ProblÚme mathématique de type IMO : résolution par la version Flash locale.
Sources citées
- DeepSeek-V4-Flash-MLX-9bit â ModĂšle utilisĂ© pour les tests locaux, version expĂ©rimentale.
- Inferencer App â Application utilisĂ©e pour exĂ©cuter le modĂšle localement.
- LG C2 42" Monitor â Moniteur utilisĂ© dans le setup (lien affiliĂ©).
- Mac Studio â Machine de test (Mac Studio M3 Ultra 512 Go) (lien affiliĂ©).
- MacBook Pro â Machine alternative Ă©voquĂ©e (lien affiliĂ©).
- QNAP NAS Drive â Stockage potentiel pour modĂšles (lien affiliĂ©).
- Kimi K2.6 â VidĂ©o compagnon sur Kimi K2.6.
- GLM 5.1 â VidĂ©o compagnon sur GLM 5.1.
- Expert Controls â VidĂ©o compagnon sur les contrĂŽles experts.
Apport & nouveautés
La vidĂ©o apporte un retour d’expĂ©rience pratique sur l’exĂ©cution locale d’un modĂšle de trĂšs grande taille (1,6 T de paramĂštres pour la version Pro), en testant une version Flash optimisĂ©e. Elle montre qu’une quantification adaptĂ©e permet de faire fonctionner un modĂšle performant avec environ 145 Go de mĂ©moire, rĂ©solvant un problĂšme mathĂ©matique difficile, ce qui n’avait pas Ă©tĂ© rĂ©ussi par des modĂšles plus volumineux dans des tests prĂ©cĂ©dents. Elle discute Ă©galement des compromis entre diffĂ©rentes stratĂ©gies de quantification (reconditionnement vs dĂ©quantification) et de l’importance du seed et de la tempĂ©rature pour la gĂ©nĂ©ration de code.
Pour aller plus loin :
- Mixture of experts â Architecture de modĂšle utilisĂ©e par DeepSeek et d’autres, permettant d’activer parcimonieusement les paramĂštres.
- Quantization (signal processing) â Concept gĂ©nĂ©ral de rĂ©duction de prĂ©cision numĂ©rique, appliquĂ© ici aux poids du modĂšle.
- MLX (GitHub) â Framework d’apprentissage automatique optimisĂ© pour les puces Apple, utilisĂ© pour l’infĂ©rence locale sur Mac.
151 mots
Profil radar
Le profil radar indique un niveau technique élevé (7/10), une quantité d'information importante (8/10), une qualité d'information moyenne (6/10) due à la subjectivité visuelle, et une fiabilité globale moyenne (6/10) en raison des conditions de test non contrÎlées.