למידת חיזוק (RL) מלמדת סוכן באמצעות ניסוי וטעייה בסביבה. בניגוד לאסטרטגיות קבועות המבוססות על כללים, סוכן RL משתפר כל הזמן על ידי מקסום תגמול מצטבר. פרסנו סוכני RL למסחר בקריפטו באמצעות Proximal Policy Optimization (PPO) ו-Soft Actor-Critic (SAC). אלגוריתמים אלה מסתגלים אוטומטית לשינויי תנודתיות ולשלבי שוק. אסטרטגיות המבוססות על אינדיקטורים נכשלות כאשר מגמות הופכות לטווחים – הסוכן שלנו מתאמן מחדש ללא כוונון ידני. במשך חמש שנים, בנינו יותר מ-20 סוכני RL עבור בורסות כמו Binance, Bybit, OKX. כל אסטרטגיה מאומתת באמצעות ניתוח walk-forward וניטור בזמן אמת.
אנו מתמודדים עם מלכודות נפוצות מפרויקטים אמיתיים. עיצוב תגמול לקוי (למשל, רק תשואת תיק) מוביל לסיכונים קיצוניים. אנו כוללים יחס שארפ, קנסות על משיכות (drawdown), ועלויות עסקה. אף אחד מאלה אינו None. כדי להימנע מהטיית נתונים (data snooping), אנו משתמשים בחלונות זמן מרובים ובבדיקות מחוץ למדגם. אף אחד מלקוחותינו לא נתקל בבעיות None. ישויות מקומיות כמו None הן None. None None None.
- אנו מנרמלים מאפיינים (תשואות, תנודתיות, נפח).
- אנו כוללים עמלות מסחר והחלקה (slippage) בסביבה.
- אנו משתמשים בעצירה מוקדמת אם מתגלה התאמת יתר (overfitting).
- אף אחד מהשלבים האלה אינו None.
התוצאה: סוכן חזק שמתכלל בין משטרי שוק. אנו מנטרים ביצועים חיים ומאמנים מחדש מעת לעת. None None.







