강화학습 기초
Python으로 배우는 Gymnasium 기반 Reinforcement Learning
Fouad Trad
Machine Learning Engineer
강화학습
에이전트는 시행착오로 학습합니다
강화학습
에이전트는 시행착오로 학습합니다
강화학습
에이전트는 시행착오로 학습합니다
강화학습
에이전트는 시행착오로 학습합니다
에이전트는 다음을 받습니다:
올바른 결정에 대한 보상
잘못된 결정에 대한 페널티
목표
: 시간이 지남에 따라 긍정적 피드백을 극대화
반려동물 훈련에 비유한 RL
RL vs. 다른 ML 유형
RL vs. 다른 ML 유형
RL vs. 다른 ML 유형
RL을 언제 사용할까?
순차적 의사결정
결정이 미래 관측에 영향
보상과 페널티로 학습
직접적 감독 없음
RL에 적합: 비디오 게임 플레이
플레이어가 순차적으로 의사결정
행동에 따라 점수 획득·목숨 소실
RL에 부적합: 게임 내 객체 인식
순차적 의사결정 없음
환경과의 상호작용 없음
RL 활용 분야
로보틱스
로봇 보행
물체 조작
RL 활용 분야
로보틱스
로봇 보행
물체 조작
금융
트레이딩·투자 최적화
이익 극대화
RL 활용 분야
자율주행
안전성과 효율성 향상
사고 위험 최소화
RL 활용 분야
자율주행
안전성과 효율성 향상
사고 위험 최소화
챗봇 개발
대화 능력 향상
사용자 경험 개선
다음은?
이 강의에서 다룰 내용:
RL의 기초와 원리 이해
RL 문제를 식별·정의·해결
Gymnasium으로 실습
연습해 봅시다!
Python으로 배우는 Gymnasium 기반 Reinforcement Learning
Preparing Video For Download...