Back to strategies

Pekiştirmeli Öğrenme DQN Stratejisi

Durum, ödül ve portföy geri bildirimi aracılığıyla işlem eylemlerini öğren

Pekiştirmeli Öğrenme DQN Stratejisi, piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri özelliklerini doğrulanmış bir deep Q-network politikası sinyaline dönüştüren ve ardından açık uygulama, çıkış ve model riski kontrolleri uygulayan bir makine öğrenimi işlem şablonudur. - Mnih et al. 2015

Bu strateji, yaygın genel teknik analiz kavramlarından ve referans materyallerinden esinlenen eğitici bir örnek olarak sunulmuştur. Yalnızca araştırma ve ürün tanıtımı amaçlıdır ve yatırım tavsiyesi teşkil etmez.

⚠️ Strateji Uygunluğu
RİSK: EXTREME
Şunun için ideal
  • piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri özelliklerinin point-in-time mevcut olduğu ve uygulanabilir emirlere eşlenebildiği piyasalar.
  • deep Q-network politikası modelini rastgele karıştırma yerine kronolojik bölmelerle doğrulayabilen araştırma iş akışları.
  • politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip durumunun maliyetleri, devir hızını ve model bozulmasını atlatacak kadar güçlü olduğu portföyler.
Şuradan kaçının
  • Hayatta kalma yanlılığı, ileriye bakan özellikler, revize edilmiş temeller veya karar anında işlem yapılamaz etiketler içeren veri kümeleri.
  • Tahmin edilen avantajın spread, kayma, ödünç veya gecikme maliyetlerinden küçük olduğu piyasalar.
  • Model karmaşıklığının örneklem dışı kanıttan daha hızlı arttığı aşırı öğrenmiş araştırmalar.
🕒 Zaman Dilimleri
IntradayDailyResearch dependent
🌍 Piyasalar
FuturesCryptoStocksSimulated portfolios
📢 Makine öğrenimi stratejileri hassas görünürken sızıntıyı veya rejim aşırı öğrenmesini gizleyebilir; ödül şekillendirme incelemesi, ortam sızıntısı kontrolleri ve politika düşüş stopları açık bir izleme gerektirir.
S: Pekiştirmeli Öğrenme DQN Stratejisi stratejisinin arkasındaki temel fikir nedir?
Strateji, piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri üzerinde deep Q-network politikası eğitir, tutma, alma, satma veya yeniden dengeleme kararları için en uygun eylem değeri tahmin eder ve yalnızca politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip olduğunda işlem yapar.
S: Pekiştirmeli Öğrenme DQN Stratejisi stratejisindeki en büyük risk nedir?
En büyük risk genellikle veri sızıntısı veya aşırı öğrenmedir: geriye dönük test, işlemden önce var olmayacak bilgileri kullanabilir.
S: Pekiştirmeli Öğrenme DQN Stratejisi nasıl geriye dönük test edilmelidir?
Point-in-time veri, kronolojik walk-forward doğrulama, gerçekçi işlem maliyetleri ve dağıtımdan önce dokunulmamış bir nihai örneklem dışı dönem kullanın.

Bu strateji nasıl çalışır

Piyasa okumasından işlem yönetimine kadar 5 aşamalı karar akışı

1
Özellik seti
Point-in-time girdiler oluştur
Gelecek bilgi sızıntısı olmadan piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri oluştur
Her özelliği, bilinmiş olacağı zaman damgasına hizala
Eğitimden önce kararsız, seyrek veya uygulanamaz girdileri kaldır
BBMACD
2
Hedef tasarımı
İşlem yapılabilir etiketler tanımla
Modeli tutma, alma, satma veya yeniden dengeleme kararları için en uygun eylem değeri tahmin edecek şekilde eğit
Eğitim, doğrulama ve canlıya benzer test dönemlerini kronolojik olarak ayır
Maliyet, gecikme, ödünç veya gerçekleşme varsayımlarını yok sayan hedef tanımlarını reddet
DokunuşYaklaşan kesişim
3
Doğrulama
Model kararlılığını test et
walk-forward piyasa bölümleriyle çevrimdışı eğitim-test ortamları ile doğrula
Tahmin becerisini basit kural tabanlı bir referansla karşılaştır
Dağıtımdan önce özellik önemini, kalibrasyonu ve rejime duyarlılığı incele
BB SinyaliMACD Kesişimi✓ GO
4
İşlem kuralı
Skoru emirlere dönüştür
Yalnızca politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip olduğunda tetikle
pozisyon ve devir hızı kısıtlarıyla eyleme kapılı emirler ile uygula
politika azaltma veya düz kalmayı seçer, risk bütçesine ulaşılır veya ödül rejimi kötüleşir olduğunda çık
ALKısmiSATKâr Bölgesi
5
Model riski
Kaymayı ve aşırı öğrenmeyi kontrol et
Canlı kullanımdan önce ödül şekillendirme incelemesi, ortam sızıntısı kontrolleri ve politika düşüş stopları uygula
Tahmin bozulmasını, veri şeması değişikliklerini ve özellik dağılımı kaymasını izle
Canlı kararlar doğrulanmış davranıştan saptığında modeli kullanımdan kaldır
GirişSLTPTakip Eden Stop2%R:R
Strateji Bileşenleri Referansı

Pekiştirmeli Öğrenme DQN Stratejisi

Durum, ödül ve portföy geri bildirimi aracılığıyla işlem eylemlerini öğren

DQN
Policy
Trader
SC StratCraft
FÖzellik seti
piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleriModel girdileri
tutma, alma, satma veya yeniden dengeleme kararları için en uygun eylem değeriEğitim hedefi
Point-in-time hizalamaSızıntı kontrolü
MModel eğitimi
deep Q-network politikasıTahmin motoru
walk-forward piyasa bölümleriyle çevrimdışı eğitim-test ortamlarıÖrneklem dışı test
Referans modelBeceri eşiği
EGiriş kuralları
politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahipİşlem tetikleyicisi
pozisyon ve devir hızı kısıtlarıyla eyleme kapılı emirlerEmir yöntemi
Skor kalibrasyonuGüven kapısı
XÇıkış kuralları
politika azaltma veya düz kalmayı seçer, risk bütçesine ulaşılır veya ödül rejimi kötüleşirAna kapanış
Tahmin yenilemeModel güncellemesi
Sinyal zaman aşımıBayat sinyal çıkışı
RRisk kontrolü
ödül şekillendirme incelemesi, ortam sızıntısı kontrolleri ve politika düşüş stoplarıKatı kontroller
Özellik kaymasıVeri sağlığı
Aşırı öğrenme incelemesiAraştırma disiplini
Pekiştirmeli Öğrenme DQN Stratejisi
Pekiştirmeli Öğrenme DQN Stratejisi, piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri özelliklerini doğrulanmış bir deep Q-network politikası sinyaline dönüştüren ve ardından açık uygulama, çıkış ve model riski kontrolleri uygulayan bir makine öğrenimi işlem şablonudur.
Pekiştirmeli Öğrenme DQN Stratejisi Market Suitability
The Pekiştirmeli Öğrenme DQN Stratejisi strategy works best in piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri özelliklerinin point-in-time mevcut olduğu ve uygulanabilir emirlere eşlenebildiği piyasalar.. deep Q-network politikası modelini rastgele karıştırma yerine kronolojik bölmelerle doğrulayabilen araştırma iş akışları.. politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip durumunun maliyetleri, devir hızını ve model bozulmasını atlatacak kadar güçlü olduğu portföyler.. Traders should avoid using this strategy in Hayatta kalma yanlılığı, ileriye bakan özellikler, revize edilmiş temeller veya karar anında işlem yapılamaz etiketler içeren veri kümeleri.. Tahmin edilen avantajın spread, kayma, ödünç veya gecikme maliyetlerinden küçük olduğu piyasalar.. Model karmaşıklığının örneklem dışı kanıttan daha hızlı arttığı aşırı öğrenmiş araştırmalar.. The risk level is categorized as EXTREME. Makine öğrenimi stratejileri hassas görünürken sızıntıyı veya rejim aşırı öğrenmesini gizleyebilir; ödül şekillendirme incelemesi, ortam sızıntısı kontrolleri ve politika düşüş stopları açık bir izleme gerektirir.
Pekiştirmeli Öğrenme DQN Stratejisi stratejisinin arkasındaki temel fikir nedir?
Strateji, piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri üzerinde deep Q-network politikası eğitir, tutma, alma, satma veya yeniden dengeleme kararları için en uygun eylem değeri tahmin eder ve yalnızca politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip olduğunda işlem yapar.
Pekiştirmeli Öğrenme DQN Stratejisi stratejisindeki en büyük risk nedir?
En büyük risk genellikle veri sızıntısı veya aşırı öğrenmedir: geriye dönük test, işlemden önce var olmayacak bilgileri kullanabilir.
Pekiştirmeli Öğrenme DQN Stratejisi nasıl geriye dönük test edilmelidir?
Point-in-time veri, kronolojik walk-forward doğrulama, gerçekçi işlem maliyetleri ve dağıtımdan önce dokunulmamış bir nihai örneklem dışı dönem kullanın.
piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri
piyasa durumu, pozisyon durumu, ödül ve eylem geçmişi özellikleri, modelin kullandığı gözlemlenebilir girdileri oluşturur; her değer, simüle edilen karar zaman damgasından önce mevcut olmalıdır. Formula: Point-in-time feature matrix
tutma, alma, satma veya yeniden dengeleme kararları için en uygun eylem değeri
tutma, alma, satma veya yeniden dengeleme kararları için en uygun eylem değeri, modelin neyi tahmin etmeye çalıştığını tanımlar, bu nedenle gerçekçi bir elde tutma ufku ve işlem maliyeti varsayımı içermelidir. Formula: Future return or action label
Point-in-time hizalama
Point-in-time hizalama, modelin canlı işlem sırasında var olmayacak, revize edilmiş veya gelecekteki bilgileri öğrenmesini önler. Formula: Feature time <= decision time
deep Q-network politikası
deep Q-network politikası, tasarlanmış piyasa özelliklerini görülmemiş dönemlerde test edilebilecek bir skora, sınıfa, tahmine veya eyleme dönüştürür. Formula: Q(s,a) <- r + gamma max_a Q(s_next,a)
walk-forward piyasa bölümleriyle çevrimdışı eğitim-test ortamları
walk-forward piyasa bölümleriyle çevrimdışı eğitim-test ortamları, eğitilmiş modelin, eğitimde kullanılmayan sonraki veriler üzerinde değerlendirildiğinde hâlâ yararlı olup olmadığını denetler. Formula: Walk-forward split
Referans model
Bir referans model, makine öğreniminin karmaşıklığının basit bir momentum, ortalamaya dönüş veya faktör kuralının ötesinde değer kattığını doğrular. Formula: Compare with simple baseline
politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip
politika eylemi maliyet ve risk cezalarından sonra pozitif beklenen ödüle sahip, her tahmini bir işlem olarak ele almak yerine model çıktısını katı bir giriş kuralına dönüştürür. Formula: Prediction score clears threshold
pozisyon ve devir hızı kısıtlarıyla eyleme kapılı emirler
pozisyon ve devir hızı kısıtlarıyla eyleme kapılı emirler, bir model sinyali uygulanabilir hâle geldiğinde kullanılan emir zamanlamasını, boyutlandırmayı ve devir hızı kısıtını tanımlar. Formula: Signal to order conversion
Skor kalibrasyonu
Skor kalibrasyonu, ham model çıktısını karşılaştırılabilir güven kovalarına eşler; böylece boyutlandırma test edilmiş güvenilirliğe dayanır. Formula: Probability or rank bucket
politika azaltma veya düz kalmayı seçer, risk bütçesine ulaşılır veya ödül rejimi kötüleşir
politika azaltma veya düz kalmayı seçer, risk bütçesine ulaşılır veya ödül rejimi kötüleşir, tahmin bozulduktan sonra model işleminin yönetilmeyen bir ihtiyari pozisyona dönüşmesini önler. Formula: Prediction no longer supports exposure
Tahmin yenileme
Tahmin yenileme kuralları, stratejinin özellikleri ne sıklıkla yeniden hesapladığını ve bayat model kararlarını ne sıklıkla değiştirdiğini tanımlar. Formula: Re-score on schedule
Sinyal zaman aşımı
Sinyal zaman aşımı, orijinal tahmin ufku beklenen hareket olmadan geçtiğinde pozisyonları kapatır. Formula: Close after forecast horizon
ödül şekillendirme incelemesi, ortam sızıntısı kontrolleri ve politika düşüş stopları
ödül şekillendirme incelemesi, ortam sızıntısı kontrolleri ve politika düşüş stopları, pozisyon maruziyetini, model kaymasını ve doğrulanmış araştırma örneğiyle artık örtüşmeyen canlı davranışı sınırlar. Formula: Model and portfolio limits
Özellik kayması
Özellik kayması izleme, canlı girdi dağılımlarının eğitim verisinden model varsayımlarını geçersiz kılacak kadar uzaklaştığı anı tespit eder. Formula: Live distribution versus train
Aşırı öğrenme incelemesi
Aşırı öğrenme incelemesi, model karmaşıklığını, devir hızını ve parametre sayısını kalıcı örneklem dışı kanıt miktarıyla karşılaştırır. Formula: Complexity versus evidence