Community Trust ScoreVérifié
Coinbase a analysé les chiffres. Et les résultats n’étaient pas ceux attendus par l’industrie.
Pourquoi c'est important
Cette étude met en lumière un défi majeur auquel est confrontée l'industrie des crypto-monnaies : l'efficacité des outils d'intelligence artificielle dans la détection de la fraude. À une époque où la sécurité des transactions est primordiale pour instaurer la confiance des utilisateurs, des résultats aussi décevants soulignent la nécessité d'une réévaluation des méthodes de prévention des fraudes. Cela pourrait également inciter les acteurs du marché à explorer des approches alternatives ou complémentaires pour renforcer la protection contre les activités malveillantes.
La plateforme a testé les versions plus récentes de trois grandes familles de modèles d’IA sur un ensemble de données historiques de son service de paiement Onramp — 16 140 transactions, 7 293 utilisateurs, 813 paiements frauduleux confirmés. Même directive fixe. Même politique de classification des risques tout au long. La seule variable était la version du modèle. Et dans chaque comparaison, le modèle plus récent a détecté moins de fraudes que l’ancien.
Pas marginalement moins. Sensiblement moins.
Les chiffres de référence sont difficiles à ignorer
Coinbase a comparé Opus 4.5 avec Opus 5, Sonnet 4.6 avec Sonnet 5, et GPT-5.4 avec GPT-5.6. Chaque paire a montré un rappel plus faible, un score F1 plus bas, et un rappel pondéré en dollars plus faible lorsque la version plus récente était utilisée. Sonnet a subi la plus grosse perte — le rappel a chuté de 22,2 points de pourcentage et le rappel pondéré en dollars a diminué de 22,9 points. Ce n’est pas une erreur d’arrondi. C’est une régression significative dans la capacité du modèle à détecter les mouvements d’argent frauduleux dans le système.
Opus s’en est mieux sorti. Son rappel a seulement diminué de 0,8 point, ce qui est probablement proche du bruit. Mais le résultat de GPT était le plus intéressant et, honnêtement, le plus trompeur en surface. La précision a en fait augmenté — 11,5 points de plus avec GPT-5.6 qu’avec GPT-5.4. Cela semble être une amélioration. Mais le rappel a chuté de 20,7 points, et le rappel pondéré en dollars a diminué de 21,8 points. Ainsi, le modèle plus récent s’est amélioré pour signaler la fraude qu’il a détectée, mais il a signalé beaucoup moins de cas de fraude en général. Plus confiant. Moins complet. C’est un mauvais compromis dans le filtrage des paiements.
Le fossé entre la précision et le rappel est extrêmement important dans la détection de la fraude. Un modèle très précis mais qui manque la plupart des fraudes est pratiquement inutile dans un environnement monétaire réel. Le test de Coinbase a concrétisé cette tension.
Le modèle personnalisé qui les a tous surpassés
C’est là que ça devient intéressant. Coinbase a également testé un modèle Qwen3.5-9B entraîné sur mesure, construit spécifiquement en utilisant des résultats de fraude historiques. Il a surpassé Opus 4.5 — qui avait déjà surpassé le nouvel Opus 5 — sur plusieurs indicateurs clés. Le score F1 s’est amélioré de 9,6 points par rapport à Opus 4.5. Le rappel pondéré en dollars s’est amélioré de 35,4 points. Et ce n’était pas seulement la qualité de la détection. Le modèle Qwen personnalisé a réduit la latence médiane de la demande LLM de bout en bout de 55 % par rapport à Opus 4.5. Plus rapide et plus précis. Cette combinaison est cruciale lorsque vous effectuez des contrôles de paiements en temps réel.
Le modèle a été entraîné sur les propres données historiques de fraude de Coinbase, avec un équilibrage délibéré entre les exemples frauduleux et légitimes. Cette spécificité explique probablement la plupart de l’écart de performance. Un modèle à usage général entraîné sur des données larges d’Internet n’est pas optimisé pour les schémas particuliers de fraude de paiement en crypto-monnaie. Un modèle spécialisé entraîné sur des résultats de fraude réels d’une plateforme spécifique est un outil fondamentalement différent.
Et pourtant, l’hypothèse par défaut de l’industrie reste globalement « modèle plus récent = meilleur modèle ». Les données de Coinbase remettent fortement en question cela.
Par ailleurs, Coinbase avait précédemment testé l’ajout d’une révision sélective LLM en plus des modèles existants — sans les remplacer, juste en ajoutant une révision supplémentaire pour certains cas. Cette expérience a réduit les transactions frauduleuses de 30 % et la valeur de la fraude de 22 %. La répétition récente n’a pas évalué si les versions de modèles plus récentes produiraient des gains similaires, donc cette comparaison ne peut pas être faite directement. Lacune dans les données. Incertain de ce que les versions plus récentes feraient dans cette configuration en couches.
Ce que les fournisseurs de paiement devraient retenir de cela
La recommandation de Coinbase est assez directe : testez les candidats dans votre configuration décisionnelle spécifique avant de les déployer. Évaluez la latence, la fiabilité et le coût en plus de la qualité de détection. Ne supposez pas qu’une mise à jour de version se traduit par un meilleur filtrage de la fraude. Faites la répétition. Vérifiez les chiffres de rappel. Vérifiez le rappel pondéré en dollars, pas seulement le chiffre de précision en gros titre.
Il y a une véritable limitation ici qui mérite d’être nommée. Le jeu de données de Coinbase est propriétaire, donc les chercheurs de SR-Fraud ne peuvent pas reproduire indépendamment les résultats. C’est une contrainte sur la généralisation de ces résultats. Différentes plateformes, différents schémas de fraude, différentes bases d’utilisateurs — les chiffres pourraient être très différents ailleurs. Coinbase ne peut pas vraiment le savoir, et personne d’autre non plus de l’extérieur.
Ce que le test n’a pas non plus capturé : les pertes des clients dues au déploiement réel des nouveaux modèles. La répétition était historique. Elle peut vous dire combien de ces 813 transactions frauduleuses un modèle aurait signalées. Elle ne peut pas vous dire ce qui arrive aux utilisateurs réels lorsqu’une régression comme la baisse de 22,2 points du rappel de Sonnet passe inaperçue avant le déploiement.
C’est la partie qui probablement empêche l’équipe de lutte contre la fraude de dormir la nuit. L’amélioration du rappel pondéré en dollars du modèle Qwen3.5-9B de 35,4 points par rapport à Opus 4.5.
Questions Fréquentes
Que révèle réellement le test de détection de fraude par IA de Coinbase ?
Coinbase a découvert que les versions plus récentes des modèles Opus, Sonnet et GPT ont toutes détecté moins de paiements frauduleux que leurs prédécesseurs lorsqu’elles ont été testées sur 16 140 transactions historiques, y compris 813 cas de fraude confirmés, en utilisant la même politique de décision fixe.
Comment le modèle personnalisé Qwen3.5-9B s’est-il comparé aux autres modèles testés ?
Le modèle personnalisé Qwen3.5-9B a surpassé Opus 4.5 avec une amélioration de 9,6 points du score F1 et une amélioration de 35,4 points du rappel pondéré en dollars, tout en réduisant également la latence médiane de la demande LLM de bout en bout de 55 %.





