Playing Atari with Deep Reinforcement Learning on “מאמרים שחזרתי אליהם”, a list by עידו לנג on TheLysts.
Details
Photo
—
Name
—
Comment
reward function שמזכיר לי איך מאמן בונה rotation, כל פעולה משפיעה על ה-Q-value לטווח ארוך. קראתי את זה פעם אחרי לילה שלם של יורוליג ופשוט התחברתי לרעיון של policy