StratCraftStratCraftPortuguês
Back to strategies

Estratégia DQN de aprendizagem por reforço

Aprender ações de trading através de estado, recompensa e feedback da carteira

Estratégia DQN de aprendizagem por reforço é um modelo de trading de machine learning que converte características de estado de mercado, estado de posição, recompensa e histórico de ações num sinal política deep Q-network validado e depois aplica controlos explícitos de execução, saída e risco do modelo. - Mnih et al. 2015

Esta estratégia é fornecida como um exemplo educacional inspirado em conceitos comuns de análise técnica pública e material de referência. É apenas para pesquisa e demonstração de produtos e não constitui aconselhamento de investimento.

⚠️ Adequação da estratégia
RISCO: EXTREME
Ideal para
  • Mercados onde características de estado de mercado, estado de posição, recompensa e histórico de ações estão disponíveis point-in-time e podem ser mapeadas para ordens executáveis.
  • Fluxos de pesquisa capazes de validar política deep Q-network com divisões cronológicas em vez de baralhamentos aleatórios.
  • Carteiras onde a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco é forte o suficiente para sobreviver a custos, rotação e decaimento do modelo.
Evitar em
  • Conjuntos de dados com viés de sobrevivência, características look-ahead, fundamentais revistos ou rótulos que não eram negociáveis no momento da decisão.
  • Mercados onde a vantagem prevista é menor do que os custos de spread, slippage, empréstimo ou latência.
  • Pesquisa sobreajustada onde a complexidade do modelo cresce mais depressa do que a evidência fora da amostra.
🕒 Períodos de tempo
IntradayDailyResearch dependent
🌍 Mercados
FuturesCryptoStocksSimulated portfolios
📢 As estratégias de machine learning podem parecer precisas enquanto escondem fugas ou sobreajuste de regime; a revisão do reward-shaping, os controlos de fuga do ambiente e os stops de drawdown da política precisa de monitorização explícita.
P: Qual é a ideia central por trás de Estratégia DQN de aprendizagem por reforço?
A estratégia treina política deep Q-network em características de estado de mercado, estado de posição, recompensa e histórico de ações, prevê o valor de ação ótimo para decisões de manter, comprar, vender ou rebalancear e só negoceia quando a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco.
P: Qual é o maior risco em Estratégia DQN de aprendizagem por reforço?
O maior risco costuma ser a fuga de dados ou o sobreajuste: o backtest pode usar informação que não teria existido antes do trade.
P: Como deve Estratégia DQN de aprendizagem por reforço ser backtestado?
Use dados point-in-time, validação walk-forward cronológica, custos de transação realistas e um período final fora da amostra intacto antes da implementação.

Como esta estratégia funciona

Fluxo de decisão de 5 etapas, da leitura de mercado à gestão de trades

1
Conjunto de características
Construir entradas point-in-time
Construir características de estado de mercado, estado de posição, recompensa e histórico de ações sem fuga de informação futura
Alinhar cada característica ao timestamp em que teria sido conhecida
Remover entradas instáveis, esparsas ou impossíveis de executar antes do treino
BBMACD
2
Desenho do alvo
Definir rótulos negociáveis
Treinar o modelo para prever o valor de ação ótimo para decisões de manter, comprar, vender ou rebalancear
Separar cronologicamente os períodos de treino, validação e teste em estilo real
Rejeitar definições de alvo que ignorem custos, latência, empréstimo ou pressupostos de execução
ToqueCruzamento se aproximando
3
Validação
Testar a estabilidade do modelo
Validar com ambientes de treino-teste offline com episódios de mercado walk-forward
Comparar a capacidade de previsão com um benchmark simples baseado em regras
Inspecionar a importância das características, a calibração e a sensibilidade ao regime antes da implementação
Sinal BBCruzamento MACD✓ GO
4
Regra de trading
Converter a pontuação em ordens
Acionar apenas quando a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco
Executar com ordens condicionadas à ação com restrições de posição e rotação
Sair quando a política escolhe reduzir ou ficar plana, o orçamento de risco é atingido ou o regime de recompensa se deteriora
COMPRAParcialVENDAZona de lucro
5
Risco do modelo
Controlar a deriva e o sobreajuste
Aplicar a revisão do reward-shaping, os controlos de fuga do ambiente e os stops de drawdown da política antes do uso em real
Monitorizar o decaimento da previsão, as mudanças de esquema de dados e a deriva da distribuição das características
Retirar o modelo quando as decisões em real divergirem do comportamento validado
EntradaSLTPStop dinâmico2%R:R
Referência de componentes de estratégia

Estratégia DQN de aprendizagem por reforço

Aprender ações de trading através de estado, recompensa e feedback da carteira

DQN
Policy
Trader
SC StratCraft
FConjunto de características
características de estado de mercado, estado de posição, recompensa e histórico de açõesEntradas do modelo
o valor de ação ótimo para decisões de manter, comprar, vender ou rebalancearAlvo de treino
Alinhamento point-in-timeControlo de fugas
MTreino do modelo
política deep Q-networkMotor de previsão
ambientes de treino-teste offline com episódios de mercado walk-forwardTeste fora da amostra
Modelo de referênciaLimiar de competência
ERegras de entrada
a ação da política tem uma recompensa esperada positiva após custos e penalizações de riscoGatilho de trade
ordens condicionadas à ação com restrições de posição e rotaçãoMétodo de ordem
Calibração da pontuaçãoFiltro de confiança
XRegras de saída
a política escolhe reduzir ou ficar plana, o orçamento de risco é atingido ou o regime de recompensa se deterioraFecho principal
Atualização da previsãoAtualização do modelo
Expiração do sinalSaída por sinal obsoleto
RControlo de risco
a revisão do reward-shaping, os controlos de fuga do ambiente e os stops de drawdown da políticaControlos rígidos
Deriva das característicasSaúde dos dados
Revisão de sobreajusteDisciplina de pesquisa
Estratégia DQN de aprendizagem por reforço
Estratégia DQN de aprendizagem por reforço é um modelo de trading de machine learning que converte características de estado de mercado, estado de posição, recompensa e histórico de ações num sinal política deep Q-network validado e depois aplica controlos explícitos de execução, saída e risco do modelo.
Estratégia DQN de aprendizagem por reforço Market Suitability
The Estratégia DQN de aprendizagem por reforço strategy works best in Mercados onde características de estado de mercado, estado de posição, recompensa e histórico de ações estão disponíveis point-in-time e podem ser mapeadas para ordens executáveis.. Fluxos de pesquisa capazes de validar política deep Q-network com divisões cronológicas em vez de baralhamentos aleatórios.. Carteiras onde a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco é forte o suficiente para sobreviver a custos, rotação e decaimento do modelo.. Traders should avoid using this strategy in Conjuntos de dados com viés de sobrevivência, características look-ahead, fundamentais revistos ou rótulos que não eram negociáveis no momento da decisão.. Mercados onde a vantagem prevista é menor do que os custos de spread, slippage, empréstimo ou latência.. Pesquisa sobreajustada onde a complexidade do modelo cresce mais depressa do que a evidência fora da amostra.. The risk level is categorized as EXTREME. As estratégias de machine learning podem parecer precisas enquanto escondem fugas ou sobreajuste de regime; a revisão do reward-shaping, os controlos de fuga do ambiente e os stops de drawdown da política precisa de monitorização explícita.
Qual é a ideia central por trás de Estratégia DQN de aprendizagem por reforço?
A estratégia treina política deep Q-network em características de estado de mercado, estado de posição, recompensa e histórico de ações, prevê o valor de ação ótimo para decisões de manter, comprar, vender ou rebalancear e só negoceia quando a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco.
Qual é o maior risco em Estratégia DQN de aprendizagem por reforço?
O maior risco costuma ser a fuga de dados ou o sobreajuste: o backtest pode usar informação que não teria existido antes do trade.
Como deve Estratégia DQN de aprendizagem por reforço ser backtestado?
Use dados point-in-time, validação walk-forward cronológica, custos de transação realistas e um período final fora da amostra intacto antes da implementação.
características de estado de mercado, estado de posição, recompensa e histórico de ações
características de estado de mercado, estado de posição, recompensa e histórico de ações formam as entradas observáveis usadas pelo modelo; cada valor tem de estar disponível antes do timestamp de decisão simulado. Formula: Point-in-time feature matrix
o valor de ação ótimo para decisões de manter, comprar, vender ou rebalancear
o valor de ação ótimo para decisões de manter, comprar, vender ou rebalancear define o que o modelo tenta prever, pelo que tem de incluir um horizonte de detenção e um pressuposto de custos de transação realistas. Formula: Future return or action label
Alinhamento point-in-time
O alinhamento point-in-time impede que o modelo aprenda informação revista ou futura que não existiria durante o trading em real. Formula: Feature time <= decision time
política deep Q-network
política deep Q-network transforma as características de mercado projetadas numa pontuação, classe, previsão ou ação que pode ser testada em períodos não vistos. Formula: Q(s,a) <- r + gamma max_a Q(s_next,a)
ambientes de treino-teste offline com episódios de mercado walk-forward
ambientes de treino-teste offline com episódios de mercado walk-forward verifica se o modelo treinado continua útil quando avaliado em dados posteriores que não foram usados no treino. Formula: Walk-forward split
Modelo de referência
Um modelo de referência confirma que a complexidade do machine learning acrescenta valor para além de uma simples regra de momentum, reversão à média ou fator. Formula: Compare with simple baseline
a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco
a ação da política tem uma recompensa esperada positiva após custos e penalizações de risco transforma a saída do modelo numa regra de entrada estrita em vez de tratar cada previsão como um trade. Formula: Prediction score clears threshold
ordens condicionadas à ação com restrições de posição e rotação
ordens condicionadas à ação com restrições de posição e rotação define o timing da ordem, o dimensionamento e a restrição de rotação usados quando um sinal do modelo se torna executável. Formula: Signal to order conversion
Calibração da pontuação
A calibração da pontuação mapeia a saída bruta do modelo para faixas de confiança comparáveis, para que o dimensionamento se baseie numa fiabilidade testada. Formula: Probability or rank bucket
a política escolhe reduzir ou ficar plana, o orçamento de risco é atingido ou o regime de recompensa se deteriora
a política escolhe reduzir ou ficar plana, o orçamento de risco é atingido ou o regime de recompensa se deteriora impede que o trade do modelo se torne uma posição discricionária não gerida após o decaimento da previsão. Formula: Prediction no longer supports exposure
Atualização da previsão
As regras de atualização da previsão definem com que frequência a estratégia recalcula as características e substitui decisões obsoletas do modelo. Formula: Re-score on schedule
Expiração do sinal
A expiração do sinal fecha posições quando o horizonte de previsão original decorreu sem o movimento esperado. Formula: Close after forecast horizon
a revisão do reward-shaping, os controlos de fuga do ambiente e os stops de drawdown da política
a revisão do reward-shaping, os controlos de fuga do ambiente e os stops de drawdown da política limita a exposição das posições, a deriva do modelo e o comportamento em real que já não corresponde à amostra de pesquisa validada. Formula: Model and portfolio limits
Deriva das características
A monitorização da deriva das características deteta quando as distribuições de entrada em real se afastaram o suficiente dos dados de treino para invalidar os pressupostos do modelo. Formula: Live distribution versus train
Revisão de sobreajuste
A revisão de sobreajuste compara a complexidade do modelo, a rotação e o número de parâmetros com a quantidade de evidência fora da amostra duradoura. Formula: Complexity versus evidence