λ°˜μ‘ν˜•

Agentic AI μ‹œμŠ€ν…œμ—μ„œ 각 Unit-Agent의 μ‹€ν–‰ μ „λž΅(예: RAG 검색 깊이, λͺ¨λΈ 선택, ν”„λ‘¬ν”„νŠΈ νŒ¨ν„΄)을
Reinforcement Learning (RL) κΈ°λ°˜μœΌλ‘œ 슀슀둜 μ΅œμ ν™”ν•˜λ„λ‘ μ„€κ³„ν•˜λ € ν•œλ‹€.

μ œμ‘°κ³΅μ • λ³΄κ³ μ„œ μžλ™ν™” μ‹œλ‚˜λ¦¬μ˜€λ₯Ό κΈ°μ€€μœΌλ‘œ,
μƒνƒœ(State), 행동(Action), 보상(Reward)을 μ •μ˜ν•˜κ³ ,
κ°•ν™”ν•™μŠ΅μ΄ Agent μ˜μ‚¬κ²°μ • κ°œμ„ μ— μ–΄λ–»κ²Œ κΈ°μ—¬ν•˜λŠ”μ§€ μ„œμˆ ν•˜μ‹œμ˜€.

 

 

β‘  κ°œμš”

  • κΈ°μ‘΄ Agentic AIλŠ” μ •ν•΄μ§„ ν”„λ‘¬ν”„νŠΈ 체인에 따라 μ‹€ν–‰ν•˜μ§€λ§Œ,
    μ‹€μ œ λ³΄κ³ μ„œ ν’ˆμ§ˆμ€ ν™˜κ²½(λ°μ΄ν„°λŸ‰, 곡정쑰건, LLM응닡 ν’ˆμ§ˆ) μ— 따라 달라진닀.
  • λ”°λΌμ„œ 각 μ‹€ν–‰ λ£¨ν”„μ—μ„œμ˜ μ„ νƒ(action) μ„ κ°•ν™”ν•™μŠ΅μœΌλ‘œ μ‘°μ •ν•˜μ—¬
    슀슀둜 졜적의 μ „λž΅μ„ ν•™μŠ΅ν•˜λ„λ‘ λ§Œλ“ λ‹€.

β‘‘ κ°•ν™”ν•™μŠ΅ κ΅¬μ„±μš”μ†Œ μ •μ˜

κ΅¬μ„±μš”μ†Œλ‚΄μš©μ œμ‘°κ³΅μ • μ˜ˆμ‹œ
State (S) ν˜„μž¬ μ‹œμŠ€ν…œμ˜ λ‚΄λΆ€ μƒνƒœ (μž…λ ₯ 길이, 신뒰도, RAG κ²°κ³Ό 수, 이전 점수) {context_len=1800, conf=0.85, retries=1}
Action (A) Agentκ°€ 선택 κ°€λŠ₯ν•œ μ‹€ν–‰ μ˜΅μ…˜ {RAG depth=2, Model=TGI-v3, Prompt=‘formal’}
Reward (R) 평가 μ§€ν‘œ 기반 보상 ν•¨μˆ˜ R = 0.4·Groundedness + 0.4·Citation + 0.2·TaskSuccess

β‘’ RL 루프 λ™μž‘ ꡬ쑰

ν™˜κ²½(Environment)
↑    β”‚
β”‚    ↓
Agent(Planner)
→ 선택(Action): λͺ¨λΈ·κ²€μƒ‰μ „λž΅·μ²΄μΈκ²½λ‘œ
→ μ‹€ν–‰ ν›„ 평가(Self-Eval Harness)
→ 보상 계산(R)
→ Policy μ—…λ°μ΄νŠΈ(θ ← θ + α·∇θ)
  • Algorithm: PPO (Proximal Policy Optimization) λ˜λŠ” DQN 기반
  • Training Signal: Self-Eval Harnessκ°€ μ œκ³΅ν•˜λŠ” G, C, T 점수 → Reward

β‘£ μ˜ˆμ‹œ μ‹œλ‚˜λ¦¬μ˜€

Episodeμ„ νƒλœ μ „λž΅G/C/T보상(R)
#1 RAG depth=1, model=vLLM7B 0.72/0.69/0.9 0.70
#2 RAG depth=3, model=Exaone13B 0.93/0.95/1.0 0.94
#3 RAG depth=4, model=Exaone13B 0.94/0.91/1.0 0.92

→ 졜적 μ •μ±…: “RAG depth=3, model=Exaone13B, style=formal” 선택 ν™•λ₯  ↑


β‘€ Reward Engineering

  • 단일 μ§€ν‘œκ°€ μ•„λ‹Œ μ‘°ν•©ν˜• 보상 μ‚¬μš©:
     
     
  • λ³΄λ„ˆμŠ€/νŒ¨λ„ν‹°:
    • +0.1 → if response < 3s
    • −0.2 → if hallucination_detected=True
R = 0.4 * groundedness + 0.4 * citation + 0.2 * task_success

β‘₯ 싀무적 효과

ν•­λͺ©κΈ°μ‘΄RL 기반
μ‹€ν–‰μ „λž΅ μˆ˜λ™ μ„€μ • μžλ™ 적응
ν’ˆμ§ˆ 변동 큼 μ•ˆμ •ν™”
λΉ„μš© 효율 일정 μ„±λŠ₯ λŒ€λΉ„ μ΅œμ ν™”
Self-Learning μ—†μŒ 쑴재

⑦ 평가 포인트

  • μƒνƒœ·ν–‰λ™·λ³΄μƒ μ •μ˜λ₯Ό μ •ν™•νžˆ κΈ°μˆ ν–ˆλŠ”κ°€
  • 보상식에 Groundedness·Citation을 μ—°κ²°ν–ˆλŠ”κ°€
  • RL이 Agent μ„±λŠ₯을 κ°œμ„ ν•˜λŠ” 논리λ₯Ό μ œμ‹œν–ˆλŠ”κ°€
λ°˜μ‘ν˜•

+ Recent posts