๐ค "AI๊ฐ ๊ธด ์๊ฐ ๋์ ํ ์ ์๋ ๋ฌธ์ ๋ฅผ ํ๊ฐํ๋ ๊ฒ ์ง์ง๋ก ๊ฐ๋ฅํ ๊น?"
Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading
๐๏ธ ์์: Tencent Hunyuan (๋น ํ ํฌ)
๐ท๏ธ ํต์ฌ ํค์๋: long-horizon, terminal benchmark, dense reward, agent evaluation, iterative debugging
๐ญ ์ด๋ฐ ์ง๋ฌธ์ ํด๋ณธ ์ ์๋์?
- โAI๊ฐ 10๋ถ ์์ ๋๋ด๋ ๋ฌธ์ ๋ง ํ๊ฐํ๋ฉด, ์ง์ง ์ค๋ ฅ์ ์ด๋ป๊ฒ ์ธก์ ํด?โ
- โ์คํ์ ๋ฐ๋ณตํ๊ฑฐ๋ ์ฝ๋๋ฅผ ์์ ํ๋ ๊ณผ์ ๋ ํ๊ฐ์ ํฌํจ๋ผ์ผ ํ๋๋ฐ, ์ ์ง๊ธ์ ์ ๋์ง?โ
- โAI๊ฐ โ๊ฒฐ๊ณผ๋ง ๋ง์๋ OKโ์ธ ํ๊ฐ์์ ์ผ๋ง๋ ์ง์ง ์ค๋ ฅ์ ๋ณด์ฌ์ค ์ ์์๊น?โ
[ํต์ฌ ์ค๋ช : ๊ธฐ์กด์๋ ๋จ์๊ฐ ์๋ฃํ ํ ์คํฌ๋ง ํ๊ฐํ๊ณ , ์ค๊ฐ ๊ณผ์ ์ ๋ฌด์๋๋๋ฐ, ์ด ๋ ผ๋ฌธ์ 46๊ฐ์ ์ฅ์๊ฐ ํ ์คํฌ๋ฅผ ์ ๊ตํ๊ฒ ๋ถํดํด ์ค๊ฐ ์ฑ๊ณผ๊น์ง ํ๊ฐํ๋ ๋ฐฉ์์ผ๋ก ๋ค์ง์์ต๋๋ค.]
ํนํ ์ฃผ๋ชฉํ ์ :
- 15๊ฐ์ ์ต์ AI ๋ชจ๋ธ ํ๊ฐ์์ ํ๊ท 9.9M ํ ํฐ์ ์๋ชจํ๊ณ , 231 ์ํผ์๋์ 85.3๋ถ์ ์คํ ์๊ฐ์ด ํ์ํจ
- ๊ฐ์ฅ ๊ฐ๋ ฅํ ๋ชจ๋ธ๋ 0.95์ ๋ถ๋ถ ๋ณด์ ์๊ณ๊ฐ์์ 15.2%์ pass@1 ์ฑ๊ณผ๋ฅผ ๋ฌ์ฑํ์ผ๋ฉฐ, ์์ ๋ณด์ ์๊ณ๊ฐ(1.0)์์๋ 10.9%๋ก, ํ๊ท ๋ชจ๋ธ์ ๊ฐ๊ฐ 4.3%์ 1.7%์ ๋ถ๊ณผํจ
๐ฏ ์ ์ด๊ฒ์ด ๊ฒ์ ์ฒด์ธ์ ์ธ๊ฐ? :
โ๊ฒฐ๊ณผ๋ง ๋ง์ผ๋ฉด ์ฑ๊ณตโ โ โ์ค๊ฐ ๊ณผ์ ๊น์ง ํ๊ฐํ๊ณ , ๋ฐ๋ณตยท๋ณด์ ยท์กฐ์ ์ ๋ชจ๋ ์ธ์ ํ๋ ์ง์ง ์ฅ๊ธฐ ์์ ํ๊ฐโ