๋ฐ์ํ
์ ์กฐ๊ณต์ ๋ฐ์ดํฐ์๋ ์ด๋ฏธ์ง, ์์ฑ, ํ ์คํธ, ์ผ์ ๋ฑ ๋ค์ํ ํ์์ด ์กด์ฌํ๋ค.
๋ฉํฐ๋ชจ๋ฌ Agentic AI ์์คํ ์ ์ค๊ณํ์ฌ,
๋น์ ·ํ ์คํธ·์๊ณ์ด ๋ฐ์ดํฐ๋ฅผ ๋์์ ๋ถ์ํ๊ณ ๋ณด๊ณ ์๋ฅผ ์์ฑํ๋ ๊ตฌ์กฐ๋ฅผ ์ ์ํ์์ค.
โ ๊ฐ๋
- ๋ฉํฐ๋ชจ๋ฌ Agentic AI๋ LLM์ด ํ
์คํธ ์ธ์๋
์ด๋ฏธ์ง(๋น์ ), ์๊ณ์ด(์ผ์), ์์ฑ(ํ์ฅ๋ณด๊ณ ) ๋ฑ ๋ค์ํ ํํ์ ๋ฐ์ดํฐ๋ฅผ ์ดํด·ํตํฉ·์ถ๋ก ํ๋ ์ฒด๊ณ๋ค. - ์ ์กฐ๊ณต์ ์์๋ ์๊ฐ์ ๊ฒฐํจ, ์จ๋·์๋ ฅ ๋ก๊ทธ, ์์ ์ ์ฝ๋ฉํธ๋ฅผ ๊ฒฐํฉํด ์ข ํฉ ์์ธ·์กฐ์น ๋ณด๊ณ ์๋ฅผ ์์ฑํ๋ ๋ฐ ํ์ฉ๋๋ค.
โก ์์คํ ๊ตฌ์กฐ
[Vision Encoder] โโ
[Sensor Encoder] โโผ→ [Fusion Layer] → [Reasoning LLM] → [RAG + Report-Agent]
[Text Encoder] โโโโ
- Vision: ViT, SAM, CLIP
- Sensor: Temporal Convolutional Network (TCN), Transformer Encoder
- Text: LLM (LLama3, Exaone, GPT)
- Fusion: Perceiver IO, BLIP-2, OpenCLIP
- RAG: SOP/WI ๋ฌธ์ ์ฐ๊ฒฐ
โข LangGraph ์ํฌํ๋ก ์์
nodes:
- vision_agent (image encoder)
- signal_agent (sensor pattern extractor)
- text_agent (log summarizer)
- fusion_agent (multimodal reasoning)
- rag_agent
- report_agent
edges:
- vision_agent, signal_agent, text_agent -> fusion_agent
- fusion_agent -> rag_agent
- rag_agent -> report_agent
โฃ ๋์ ๋จ๊ณ
- Vision-Agent: ๊ณ ํด์๋ ์ด๋ฏธ์ง ์ ๋ ฅ → CLIP ๊ธฐ๋ฐ “LPGํต” ํ์ง.
- Signal-Agent: TimescaleDB์์ ์จ๋์๊ณ์ด ๋ถ์์ ํจํด ๊ฒ์ถ(±8โ ํธ์ฐจ).
- Text-Agent: ํ์ฅ ์์ ์ ๋ก๊ทธ ์์ฝ (“์ค๋ธ ์๋ 1.1m/s”).
- Fusion-Agent: ์ธ ์ ๋ ฅ์ ํตํฉํ์ฌ “์จ๋ + ์๋ ๊ด๋ จ ์ด์” ์ถ๋ก .
- RAG-Agent: SOP-HT-221 §3.2 ๊ฒ์ → ํ์ฉ๋ฒ์ ±5โ ์ธ์ฉ.
- Report-Agent: ์๊ฐ+์์น+๋ฌธํ ๊ทผ๊ฑฐ ํฌํจํ ๋ฆฌํฌํธ ์์ฑ.
โค ์ถ๋ ฅ ์์
์์ฝ: ๋ผ์ธ2์์ LPGํต์ด ํฌํจ๋ ์คํฌ๋ฉ ํธ๋ญ ์ ์ฌ, ์ค๋ธ ์จ๋ ±8โ ํธ์ฐจ๋ก ํ์ง ์ ํ ๋ฐ์.
๊ทผ๊ฑฐ: SOP-HT-221 §3.2(ํ์ฉ ±5โ), Sensor ๋ก๊ทธ(±8โ), Vision ๋ถ์(LPGํต ๊ฐ์ง).
์กฐ์น: ์ค๋ธ ์จ๋ PID ์ฌํ๋, ์๋ 1.00m/s ์ฌ์ค์ .
โฅ ๊ธฐ์ ์ ๊ตฌ์ฑ ํฌ์ธํธ
๊ณ์ธต๊ธฐ์ ์ค๋ช
| ์ ๋ ฅ ์ธ์ฝ๋ฉ | CLIP, TCN, LLM | ๊ฐ ๋ฐ์ดํฐ ํ์ ์ ๋ฒกํฐ๋ก ๋ณํ |
| ์ตํฉ(Fusion) | Perceiver IO | Modal ๊ฐ ์๋ฏธ ์ ๋ ฌ |
| ์ถ๋ก (LLM) | LangGraph Node | ์ถ๋ก + ์์ฐ์ด ์์ฑ |
| RAG | OpenSearch + pgvector | ๋ฌธ์ ๊ทผ๊ฑฐ ๊ฒฐํฉ |
| ๋ฆฌํฌํธ | DOCX Template | ์๋ ์์ฑ ๋ฐ ์๋ช ์น์ธ |
โฆ ์ค๋ฌด ํจ๊ณผ
ํญ๋ชฉ๊ธฐ์กด ๋ถ์๋ฉํฐ๋ชจ๋ฌ Agentic AI
| ๋ฐ์ดํฐ ์ข ๋ฅ | ์ผ์/๋ฌธ์๋ง | ์ด๋ฏธ์ง·์ผ์·ํ ์คํธ ํตํฉ |
| ์์ธ ๋ถ์ ์ ํ๋ | 75~80% | 95% ์ด์ |
| ๋ณด๊ณ ์ ์์ฑ์๊ฐ | 6์๊ฐ ์๋ | 10๋ถ ์๋ |
| ์ค๋ช ๊ฐ๋ฅ์ฑ | ๋ฎ์ | ์ด๋ฏธ์ง+์์น+๋ฌธ์ ๊ทผ๊ฑฐ ์ ์ |
โง ํ๊ณ ๋ฐ ํฅํ ๊ณผ์
- ๋์ฉ๋ ๋ฉํฐ๋ชจ๋ฌ ๋ฐ์ดํฐ ์ฒ๋ฆฌ ์ GPU ๋น์ฉ ์ฆ๊ฐ.
- Fusion Layer์ Alignment Drift → ์ ๊ธฐ ์ฌํ์ต ํ์.
- ์ด๋ฏธ์ง/์ผ์ ๋ฐ์ดํฐ์ ๋ณด์ ๊ด๋ฆฌ(Edge ์ ์ฒ๋ฆฌ, ์ต๋ช ํ) ์ค์.
โจ ํ๊ฐ ํฌ์ธํธ
- ๋ฉํฐ๋ชจ๋ฌ ์ ๋ ฅ(๋น์ ·์๊ณ์ด·ํ ์คํธ)์ ๋ชจ๋ ๊ตฌ์กฐ์ ์ผ๋ก ๋ค๋ค๋๊ฐ
- Fusion Layer์ ์ญํ ์ ๊ตฌ์ฒด์ ์ผ๋ก ์ค๋ช ํ๋๊ฐ
- RAG ๋ฐ Report-Agent ์ฐ๊ฒฐ๊น์ง ๋ช ์ํ๋๊ฐ
โ ์์ฝ ํค์๋ ํ๋์ ๋ณด๊ธฐ
Multi-Agent ํ์
→ Routing, Confidence ๊ธฐ๋ฐ ๋ถ๊ธฐ
Self-Eval Harness → ์๋ Groundedness/Citation ํ๊ฐ
Multimodal Fusion → Vision+Sensor+Text ์ตํฉ ๋ณด๊ณ ์ ์์ฑ
๋ฐ์ํ