La provocation est volontaire. L’IA n’est pas le problème. Un débit de recherche non contrôlé l’est.
Les systèmes génératifs et agentiques peuvent lire davantage d’articles, proposer plus de variables, écrire plus de tests et explorer plus de combinaisons qu’une équipe conventionnelle. C’est utile. Cela multiplie aussi les occasions de confondre bruit et signal.
Générer des hypothèses
La capacité de recherche était limitée par le temps analyste, le codage et la préparation des données.
Rejeter les faux positifs
L’IA réduit le coût d’un test supplémentaire, pas la charge statistique créée par ce test.
Rejet gouverné
Un système durable doit rendre les idées faciles à rejeter et difficiles à promouvoir.
Lorsque le nombre d’hypothèses augmente plus vite que la qualité de validation, le résultat n’est pas nécessairement davantage d’alpha. Il peut s’agir d’une bibliothèque plus vaste de backtests convaincants mais économiquement plus faibles.
Davantage de tests peuvent fabriquer de la confiance – même si chaque candidat n’est que du bruit.
Expérience volontairement simplifiée : aucune stratégie candidate ne possède d’avantage réel. Chacune est testée avec un seuil de faux positif de 5 %, en supposant les tests indépendants. La probabilité d’obtenir au moins un résultat apparemment significatif augmente rapidement avec le nombre d’essais.
Illustration uniquement. Les tests réels sont souvent corrélés. Le graphique n’est pas une estimation de la probabilité de surajustement d’une stratégie précise.
facteurs de rendement publiés
Harvey, Liu & Zhu ont documenté une vaste littérature factorielle et jugé les seuils classiques trop permissifs sous tests multiples.
prédicteurs étudiés
McLean & Pontiff ont examiné un large échantillon de prédicteurs publiés dans, hors et après la période de publication originale.
rendements hors échantillon
Les rendements moyens étaient inférieurs de 26 % hors de l’échantillon original par rapport aux résultats publiés.
rendements après publication
Après publication, les rendements moyens étaient inférieurs de 58 %, cohérents avec biais statistique et apprentissage des investisseurs.
La fausse confiance vient rarement d’une erreur spectaculaire. Elle s’accumule dans de petits choix de recherche.
Multiplication des hypothèses
Variables, transformations, seuils et horizons prolifèrent plus vite que la thèse économique ne devient claire.
Défaillance point-in-time
Données révisées, composition actuelle d’un indice, fondamentaux tardifs ou horodatages mal alignés injectent le futur dans le passé.
Réutilisation du holdout
Une période « hors échantillon » cesse d’être intacte dès qu’elle est consultée puis utilisée pour redessiner le modèle.
Mise en œuvre fictive
Exécutions sans friction, liquidité illimitée, emprunt stable et rolls idéaux créent des rendements impossibles en production.
Récit après résultat
Un récit causal écrit après sélection du meilleur backtest peut transformer la chance de sélection en conviction apparente.
Monoculture de recherche
Modèles et sources communs peuvent produire des signaux différents en apparence mais exposés au même facteur ou régime.
La ressource rare n’est plus une idée supplémentaire. C’est un processus de recherche capable de dire « non ».
Une architecture agentique gouvernée doit séparer génération d’idées et autorité de promotion. Les agents peuvent accélérer collecte, codage et tests adverses ; ils ne doivent ni redéfinir silencieusement l’hypothèse, ni consommer le holdout final, ni mettre un modèle en production.
Enregistrer
Fixer thèse économique, signe attendu, horizon et critères de rejet avant le test.
Reconstruire
Rendre reproductibles données point-in-time, horodatages, univers et lignage des transformations.
Contester
Utiliser placebos, sous-périodes, perturbations, chevauchement factoriel et définitions alternatives.
Valider
Ouvrir une fois un échantillon réellement intact selon une règle de décision pré-engagée.
Implémenter
Modéliser explicitement rotation, slippage, liquidité, emprunt, rolls et capacité.
Approuver
Maintenir promotion, limites, retour arrière et responsabilité auprès de personnes responsables.
Une architecture, pas une affirmation sur l’IA.
Tensor construit son système opérationnel de recherche pour accélérer l’investigation sans permettre aux agents de promouvoir leurs propres conclusions.
Autorités séparées
Découverte, contestation, validation et approbation humaine sont des étapes distinctes avec des droits différents.
Preuves avant promotion
Reconstruction point-in-time, validation intacte, coûts réalistes et tests de chevauchement précèdent l’escalade.
Lignage complet
Versions de données, variantes testées, hypothèses et motifs de rejet sont conservés – pas seulement le gagnant.
Responsabilité humaine
Les humains gardent la responsabilité des limites, du déploiement, des exceptions, du rollback et du suivi du déclin.
Ne demandez pas si un gérant utilise l’IA. Demandez ce que l’IA peut modifier – et quelles preuves subsistent.
- Combien d’hypothèses liées et de variantes de paramètres ont été testées avant la sélection du résultat présenté ?
- Le jeu de données point-in-time et l’univers exacts peuvent-ils être reproduits pour chaque décision historique ?
- Quelle période reste réellement intacte, et qui contrôle son accès ?
- Quelles hypothèses de coûts, liquidité, emprunt et capacité séparent recherche et mise en œuvre ?
- Comment l’information incrémentale est-elle mesurée face aux facteurs conventionnels et expositions existantes ?
- Qui peut approuver, modifier, suspendre ou retirer un modèle – et cette décision est-elle auditable ?
L’IA rendra l’intelligence analytique plus abondante. Le rejet discipliné devient donc plus précieux, pas moins. Le gérant avec le plus d’idées ne gagnera pas nécessairement ; celui qui prouve le mieux pourquoi la plupart ont été rejetées sera peut-être mieux placé pour bâtir une recherche systématique durable.Échanger sur notre architecture de recherche
