
Does Step 3.7 Flash Actually Beat DeepSeek & Claude? 🫣 200K TOKENS+
Step 3.7 Flash a-t-il réellement battu DeepSeek et Claude ? 🫣 Plus de 200 000 jetons
Mots-clés
Résumé
183 mots
Évaluation critique
Valeur des informations & solidité de l’argumentation
La vidéo apporte une valeur empirique en testant le modèle dans des scénarios concrets, avec des mesures de vitesse (tokens par seconde) et des comptes rendus de succès ou d’échecs. L’argumentation est basée sur des exemples détaillés, mais elle reste subjective et dépendante du matériel utilisé. Le créateur ne fournit pas de méthodologie strictement scientifique (pas de répétition, pas de contrôle des variables), mais il offre une perspective utile pour les utilisateurs potentiels. La démonstration de l’échec en mathématiques, malgré une génération massive de tokens, est un point fort qui nuance les annonces marketing.
Rigueur scientifique, qualité des sources, adéquation du titre
Les sources citées dans la description incluent le lien Hugging Face pour le modèle, l’application Inferencer, et des vidéos compagnes. Aucune source externe n’est utilisée pour valider les résultats. La rigueur scientifique est limitée : les tests sont anecdotiques et non reproductibles, mais le créateur est transparent sur ses conditions (quantization, matériel). Le titre est accrocheur mais ne reflète pas une comparaison directe ; il oriente vers une évaluation de performance. L’adéquation titre/contenu est partielle, car le contenu est plus un test personnel qu’une étude comparative rigoureuse.
196 mots
Adéquation titre / contenu
Le titre promet une comparaison avec DeepSeek et Claude, mais la vidéo se concentre sur des tests pratiques sans comparaison directe, bien qu'elle mentionne les statistiques du Claw Eval où le modèle se positionne favorablement.
Qualité & fiabilité
7/10
La vidéo fournit des tests concrets et des mesures détaillées (tokens, vitesses), mais ils restent ponctuels, non reproductibles, et certains résultats sont contradictoires (échec en mathématiques, succès en génération d'images).
Moments clés
Repères établis par PSI à partir de la transcription : le créateur n'a pas défini de chapitres.
- Introduction et présentation des statistiques du modèle (Claw Eval).
- Test Flappy Bird 3D avec raisonnement désactivé.
- Test Flappy Bird en mode raisonnement faible et élevé.
- Comparaison avec la version cloud du site officiel.
- Test TiddlyWiki : génération réussie avec raisonnement désactivé.
- Test question sur le lavage de voiture et génération d'image SVG.
- Tentative de résolution d'un problème d'olympiade de mathématiques : échec après 198 471 tokens.
- Test de génération de scène de ville 3D et de visage humain.
- Test avec le harnais OpenClaw : appel d'outils et requête météo.
Sources citées
- Step 3.7 Flash sur Hugging Face — Page Hugging Face listant les modèles Step 3.7 Flash de InferencerLabs, utilisée pour télécharger le modèle.
- Inferencer App — Application utilisée pour l'inférence locale du modèle sur M3 Ultra.
- Vidéo sur Kimi K2.6 — Vidéo compagnon de la chaîne, liée à d'autres tests de modèles.
- Vidéo sur GLM 5.1 — Vidéo compagnon de la chaîne, liée à d'autres tests de modèles.
- Vidéo sur MTP AI Harness — Vidéo compagnon de la chaîne, liée à un harnais d'IA.
Références externes
Apport & nouveautés
Cette vidéo apporte un retour d’expérience concret sur l’utilisation locale de Step 3.7 Flash, en particulier ses performances sur des tâches de codage et de génération. Elle met en évidence des points forts (génération d’images SVG, clonage de wiki) et des faiblesses (échec en mathématiques malgré un long contexte). L’originalité réside dans la démonstration de l’inférence sur un matériel spécifique (M3 Ultra) et la comparaison des niveaux de raisonnement.
Pour aller plus loin :
- Modèle Step 3.7 Flash sur Hugging Face — référence directe au modèle.
- Apprentissage par renforcement — concept connexe pour comprendre l’entraînement de ces modèles.
- Quantification (traitement du signal) — explique les différentes quantizations (Q9, Q4) mentionnées.
- OpenClaw — harnais d’IA utilisé dans le test (URL non vérifiée, à confirmer).
123 mots
Profil radar
Le profil radar montre une bonne quantité d'informations et un niveau technique élevé, mais la fiabilité globale est modérée en raison de tests ponctuels et de résultats contradictoires. La qualité de l'information est correcte mais non exhaustive.