Back to strategies

Stratégie DQN d'apprentissage par renforcement

Apprendre des actions de trading via l'état, la récompense et le retour du portefeuille

Stratégie DQN d'apprentissage par renforcement est un modèle de trading en machine learning qui convertit des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions en un signal politique deep Q-network validé, puis applique des contrôles explicites d'exécution, de sortie et de risque du modèle. - Mnih et al. 2015

Cette stratégie est fournie à titre d'exemple éducatif inspiré de concepts d'analyse technique publics courants et de documents de référence. Elle est destinée uniquement à la recherche et à la démonstration de produits et ne constitue pas un conseil en investissement.

⚠️ Adéquation de la stratégie
RISQUE: EXTREME
Idéal pour
  • Les marchés où des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions sont disponibles point-in-time et peuvent être mappés sur des ordres exécutables.
  • Les workflows de recherche capables de valider politique deep Q-network avec des découpages chronologiques plutôt que des mélanges aléatoires.
  • Les portefeuilles où l'action de la politique a une récompense attendue positive après coûts et pénalités de risque est assez fort pour survivre aux coûts, à la rotation et à la décroissance du modèle.
À éviter en
  • Les jeux de données avec biais du survivant, caractéristiques à anticipation, fondamentaux révisés ou labels qui n'étaient pas négociables au moment de la décision.
  • Les marchés où l'avantage prédit est plus petit que les coûts de spread, de slippage, d'emprunt ou de latence.
  • La recherche surapprise où la complexité du modèle augmente plus vite que les preuves hors échantillon.
🕒 Unités de temps
IntradayDailyResearch dependent
🌍 Marchés
FuturesCryptoStocksSimulated portfolios
📢 Les stratégies de machine learning peuvent sembler précises tout en dissimulant des fuites ou un surapprentissage de régime ; la revue du reward-shaping, les contrôles de fuite d'environnement et les stops de drawdown de la politique nécessite une surveillance explicite.
Q: Quelle est l'idée centrale derrière Stratégie DQN d'apprentissage par renforcement ?
La stratégie entraîne politique deep Q-network sur des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions, prédit la valeur d'action optimale pour les décisions de conservation, d'achat, de vente ou de rebalancement et ne trade que lorsque l'action de la politique a une récompense attendue positive après coûts et pénalités de risque.
Q: Quel est le plus grand risque de Stratégie DQN d'apprentissage par renforcement ?
Le plus grand risque est généralement la fuite de données ou le surapprentissage : le backtest peut utiliser des informations qui n'auraient pas existé avant le trade.
Q: Comment Stratégie DQN d'apprentissage par renforcement doit-il être backtesté ?
Utilisez des données point-in-time, une validation walk-forward chronologique, des coûts de transaction réalistes et une période finale hors échantillon intacte avant le déploiement.

Comment fonctionne cette stratégie

Flux de décision en 5 étapes, de la lecture du marché à la gestion du trade

1
Jeu de caractéristiques
Construire des entrées point-in-time
Construire des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions sans fuite d'information future
Aligner chaque caractéristique sur l'horodatage auquel elle aurait été connue
Supprimer les entrées instables, éparses ou impossibles à exécuter avant l'entraînement
BBMACD
2
Conception de la cible
Définir des labels négociables
Entraîner le modèle à prédire la valeur d'action optimale pour les décisions de conservation, d'achat, de vente ou de rebalancement
Séparer chronologiquement les périodes d'entraînement, de validation et de test proches du réel
Rejeter les définitions de cible qui ignorent les coûts, la latence, l'emprunt ou les hypothèses d'exécution
ToucheCroisement imminent
3
Validation
Tester la stabilité du modèle
Valider avec des environnements d'entraînement-test hors ligne avec des épisodes de marché walk-forward
Comparer la capacité de prédiction à une référence simple fondée sur des règles
Inspecter l'importance des caractéristiques, la calibration et la sensibilité au régime avant le déploiement
Signal BBCroisement MACD✓ GO
4
Règle de trading
Convertir le score en ordres
Ne déclencher que lorsque l'action de la politique a une récompense attendue positive après coûts et pénalités de risque
Exécuter avec des ordres conditionnés à l'action avec des contraintes de position et de rotation
Sortir lorsque la politique choisit de réduire ou de sortir, le budget de risque est atteint ou le régime de récompense se dégrade
ACHATPartielVENTEZone de profit
5
Risque du modèle
Contrôler la dérive et le surapprentissage
Appliquer la revue du reward-shaping, les contrôles de fuite d'environnement et les stops de drawdown de la politique avant toute utilisation en réel
Surveiller la décroissance des prédictions, les changements de schéma de données et la dérive de la distribution des caractéristiques
Retirer le modèle lorsque les décisions en réel divergent du comportement validé
EntréeSLTPStop suiveur2%R:R
Référence des composants de stratégie

Stratégie DQN d'apprentissage par renforcement

Apprendre des actions de trading via l'état, la récompense et le retour du portefeuille

DQN
Policy
Trader
SC StratCraft
FJeu de caractéristiques
des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actionsEntrées du modèle
la valeur d'action optimale pour les décisions de conservation, d'achat, de vente ou de rebalancementCible d'entraînement
Alignement point-in-timeContrôle des fuites
MEntraînement du modèle
politique deep Q-networkMoteur de prédiction
des environnements d'entraînement-test hors ligne avec des épisodes de marché walk-forwardTest hors échantillon
Modèle de référenceSeuil de compétence
ERègles d'entrée
l'action de la politique a une récompense attendue positive après coûts et pénalités de risqueDéclencheur de trade
des ordres conditionnés à l'action avec des contraintes de position et de rotationMéthode d'ordre
Calibration du scoreFiltre de confiance
XRègles de sortie
la politique choisit de réduire ou de sortir, le budget de risque est atteint ou le régime de récompense se dégradeDébouclage principal
Rafraîchissement de la prédictionMise à jour du modèle
Expiration du signalSortie sur signal obsolète
RContrôle du risque
la revue du reward-shaping, les contrôles de fuite d'environnement et les stops de drawdown de la politiqueContrôles stricts
Dérive des caractéristiquesSanté des données
Revue de surapprentissageDiscipline de recherche
Stratégie DQN d'apprentissage par renforcement
Stratégie DQN d'apprentissage par renforcement est un modèle de trading en machine learning qui convertit des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions en un signal politique deep Q-network validé, puis applique des contrôles explicites d'exécution, de sortie et de risque du modèle.
Stratégie DQN d'apprentissage par renforcement Market Suitability
The Stratégie DQN d'apprentissage par renforcement strategy works best in Les marchés où des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions sont disponibles point-in-time et peuvent être mappés sur des ordres exécutables.. Les workflows de recherche capables de valider politique deep Q-network avec des découpages chronologiques plutôt que des mélanges aléatoires.. Les portefeuilles où l'action de la politique a une récompense attendue positive après coûts et pénalités de risque est assez fort pour survivre aux coûts, à la rotation et à la décroissance du modèle.. Traders should avoid using this strategy in Les jeux de données avec biais du survivant, caractéristiques à anticipation, fondamentaux révisés ou labels qui n'étaient pas négociables au moment de la décision.. Les marchés où l'avantage prédit est plus petit que les coûts de spread, de slippage, d'emprunt ou de latence.. La recherche surapprise où la complexité du modèle augmente plus vite que les preuves hors échantillon.. The risk level is categorized as EXTREME. Les stratégies de machine learning peuvent sembler précises tout en dissimulant des fuites ou un surapprentissage de régime ; la revue du reward-shaping, les contrôles de fuite d'environnement et les stops de drawdown de la politique nécessite une surveillance explicite.
Quelle est l'idée centrale derrière Stratégie DQN d'apprentissage par renforcement ?
La stratégie entraîne politique deep Q-network sur des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions, prédit la valeur d'action optimale pour les décisions de conservation, d'achat, de vente ou de rebalancement et ne trade que lorsque l'action de la politique a une récompense attendue positive après coûts et pénalités de risque.
Quel est le plus grand risque de Stratégie DQN d'apprentissage par renforcement ?
Le plus grand risque est généralement la fuite de données ou le surapprentissage : le backtest peut utiliser des informations qui n'auraient pas existé avant le trade.
Comment Stratégie DQN d'apprentissage par renforcement doit-il être backtesté ?
Utilisez des données point-in-time, une validation walk-forward chronologique, des coûts de transaction réalistes et une période finale hors échantillon intacte avant le déploiement.
des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions
des caractéristiques d'état du marché, d'état de position, de récompense et d'historique des actions constituent les entrées observables utilisées par le modèle ; chaque valeur doit être disponible avant l'horodatage de décision simulé. Formula: Point-in-time feature matrix
la valeur d'action optimale pour les décisions de conservation, d'achat, de vente ou de rebalancement
la valeur d'action optimale pour les décisions de conservation, d'achat, de vente ou de rebalancement définit ce que le modèle cherche à prédire, elle doit donc inclure un horizon de détention et une hypothèse de coûts de transaction réalistes. Formula: Future return or action label
Alignement point-in-time
L'alignement point-in-time empêche le modèle d'apprendre des informations révisées ou futures qui n'existeraient pas en trading réel. Formula: Feature time <= decision time
politique deep Q-network
politique deep Q-network transforme les caractéristiques de marché conçues en un score, une classe, une prévision ou une action pouvant être testés sur des périodes non vues. Formula: Q(s,a) <- r + gamma max_a Q(s_next,a)
des environnements d'entraînement-test hors ligne avec des épisodes de marché walk-forward
des environnements d'entraînement-test hors ligne avec des épisodes de marché walk-forward vérifie si le modèle entraîné reste utile lorsqu'il est évalué sur des données ultérieures qui n'ont pas servi à l'entraînement. Formula: Walk-forward split
Modèle de référence
Un modèle de référence confirme que la complexité du machine learning apporte une valeur au-delà d'une simple règle de momentum, de retour à la moyenne ou de facteur. Formula: Compare with simple baseline
l'action de la politique a une récompense attendue positive après coûts et pénalités de risque
l'action de la politique a une récompense attendue positive après coûts et pénalités de risque transforme la sortie du modèle en une règle d'entrée stricte au lieu de traiter chaque prédiction comme un trade. Formula: Prediction score clears threshold
des ordres conditionnés à l'action avec des contraintes de position et de rotation
des ordres conditionnés à l'action avec des contraintes de position et de rotation définit le timing des ordres, le dimensionnement et la contrainte de rotation utilisés lorsqu'un signal du modèle devient exécutable. Formula: Signal to order conversion
Calibration du score
La calibration du score mappe la sortie brute du modèle sur des paliers de confiance comparables, afin que le dimensionnement repose sur une fiabilité testée. Formula: Probability or rank bucket
la politique choisit de réduire ou de sortir, le budget de risque est atteint ou le régime de récompense se dégrade
la politique choisit de réduire ou de sortir, le budget de risque est atteint ou le régime de récompense se dégrade empêche le trade du modèle de devenir une position discrétionnaire non gérée après la décroissance de la prévision. Formula: Prediction no longer supports exposure
Rafraîchissement de la prédiction
Les règles de rafraîchissement de la prédiction définissent la fréquence à laquelle la stratégie recalcule les caractéristiques et remplace les décisions obsolètes du modèle. Formula: Re-score on schedule
Expiration du signal
L'expiration du signal ferme les positions lorsque l'horizon de prédiction initial s'est écoulé sans le mouvement attendu. Formula: Close after forecast horizon
la revue du reward-shaping, les contrôles de fuite d'environnement et les stops de drawdown de la politique
la revue du reward-shaping, les contrôles de fuite d'environnement et les stops de drawdown de la politique limite l'exposition des positions, la dérive du modèle et le comportement en réel qui ne correspond plus à l'échantillon de recherche validé. Formula: Model and portfolio limits
Dérive des caractéristiques
La surveillance de la dérive des caractéristiques détecte quand les distributions d'entrée en réel se sont suffisamment éloignées des données d'entraînement pour invalider les hypothèses du modèle. Formula: Live distribution versus train
Revue de surapprentissage
La revue de surapprentissage compare la complexité du modèle, la rotation et le nombre de paramètres à la quantité de preuves hors échantillon durables. Formula: Complexity versus evidence