๐Ÿ“„ PaperBytes

Weekly AI Papers โ€” 2026-07-20

๐Ÿ“„ 10ํŽธ ๐Ÿ›๏ธ ๋น…ํ…Œํฌ 10ํŽธ ๐Ÿ”ฅ ํŠธ๋ Œ๋”ฉ 2ํŽธ
1
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
Tencent Hunyuan

๐Ÿค– "AI๊ฐ€ ๊ธด ์‹œ๊ฐ„ ๋™์•ˆ ํ’€ ์ˆ˜ ์žˆ๋Š” ๋ฌธ์ œ๋ฅผ ํ‰๊ฐ€ํ•˜๋Š” ๊ฒŒ ์ง„์งœ๋กœ ๊ฐ€๋Šฅํ• ๊นŒ?"

Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading

๐Ÿ›๏ธ ์†Œ์†: Tencent Hunyuan (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: long-horizon, terminal benchmark, dense reward, agent evaluation, iterative debugging

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œAI๊ฐ€ 10๋ถ„ ์•ˆ์— ๋๋‚ด๋Š” ๋ฌธ์ œ๋งŒ ํ‰๊ฐ€ํ•˜๋ฉด, ์ง„์งœ ์‹ค๋ ฅ์€ ์–ด๋–ป๊ฒŒ ์ธก์ •ํ•ด?โ€
  • โ€œ์‹คํ—˜์„ ๋ฐ˜๋ณตํ•˜๊ฑฐ๋‚˜ ์ฝ”๋“œ๋ฅผ ์ˆ˜์ •ํ•˜๋Š” ๊ณผ์ •๋„ ํ‰๊ฐ€์— ํฌํ•จ๋ผ์•ผ ํ•˜๋Š”๋ฐ, ์™œ ์ง€๊ธˆ์€ ์•ˆ ๋˜์ง€?โ€
  • โ€œAI๊ฐ€ โ€˜๊ฒฐ๊ณผ๋งŒ ๋งž์•„๋„ OKโ€™์ธ ํ‰๊ฐ€์—์„œ ์–ผ๋งˆ๋‚˜ ์ง„์งœ ์‹ค๋ ฅ์„ ๋ณด์—ฌ์ค„ ์ˆ˜ ์žˆ์„๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” ๋‹จ์‹œ๊ฐ„ ์™„๋ฃŒํ˜• ํ…Œ์Šคํฌ๋งŒ ํ‰๊ฐ€ํ–ˆ๊ณ , ์ค‘๊ฐ„ ๊ณผ์ •์€ ๋ฌด์‹œ๋๋Š”๋ฐ, ์ด ๋…ผ๋ฌธ์€ 46๊ฐœ์˜ ์žฅ์‹œ๊ฐ„ ํ…Œ์Šคํฌ๋ฅผ ์ •๊ตํ•˜๊ฒŒ ๋ถ„ํ•ดํ•ด ์ค‘๊ฐ„ ์„ฑ๊ณผ๊นŒ์ง€ ํ‰๊ฐ€ํ•˜๋Š” ๋ฐฉ์‹์œผ๋กœ ๋’ค์ง‘์—ˆ์Šต๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 15๊ฐœ์˜ ์ตœ์‹  AI ๋ชจ๋ธ ํ‰๊ฐ€์—์„œ ํ‰๊ท  9.9M ํ† ํฐ์„ ์†Œ๋ชจํ•˜๊ณ , 231 ์—ํ”ผ์†Œ๋“œ์™€ 85.3๋ถ„์˜ ์‹คํ–‰ ์‹œ๊ฐ„์ด ํ•„์š”ํ•จ
  • ๊ฐ€์žฅ ๊ฐ•๋ ฅํ•œ ๋ชจ๋ธ๋„ 0.95์˜ ๋ถ€๋ถ„ ๋ณด์ƒ ์ž„๊ณ„๊ฐ’์—์„œ 15.2%์˜ pass@1 ์„ฑ๊ณผ๋ฅผ ๋‹ฌ์„ฑํ–ˆ์œผ๋ฉฐ, ์™„์ „ ๋ณด์ƒ ์ž„๊ณ„๊ฐ’(1.0)์—์„œ๋Š” 10.9%๋กœ, ํ‰๊ท  ๋ชจ๋ธ์€ ๊ฐ๊ฐ 4.3%์™€ 1.7%์— ๋ถˆ๊ณผํ•จ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œ๊ฒฐ๊ณผ๋งŒ ๋งž์œผ๋ฉด ์„ฑ๊ณตโ€ โ†’ โ€œ์ค‘๊ฐ„ ๊ณผ์ •๊นŒ์ง€ ํ‰๊ฐ€ํ•˜๊ณ , ๋ฐ˜๋ณตยท๋ณด์ •ยท์กฐ์ •์„ ๋ชจ๋‘ ์ธ์ •ํ•˜๋Š” ์ง„์งœ ์žฅ๊ธฐ ์ž‘์—… ํ‰๊ฐ€โ€

2
๐Ÿ›๏ธ ๋น…ํ…Œํฌ ๐Ÿ”ฅ ํŠธ๋ Œ๋”ฉ 198+
Tencent Hunyuan

๐Ÿ“– โ€œAI ์—์ด์ „ํŠธ๊ฐ€ ์ง„์งœ ์ž˜ ์ž‘๋™ํ•˜๋Š” ๊ฑด, ์ฝ”๋“œ๊ฐ€ ๊น”๋”ํ•ด์„œ๊ฐ€ ์•„๋‹ˆ๋ผ โ€˜์–ด๋””์„œ ์–ด๋–ป๊ฒŒ ๋ฐ”๊ฟ”์•ผ ํ• ์ง€โ€™๋ฅผ ์•Œ์•„์•ผ ํ•ด์š”.โ€

Harness Handbook: Making Evolving Agent Harnesses Readable, Navigable, and Editable

๐Ÿ›๏ธ ์†Œ์†: Tencent Hunyuan (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: behavior localization, agent harness, LLM-assisted code structuring, progressive disclosure, code search

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์ด ๊ธฐ๋Šฅ์ด ๋ญ ์–ด๋””์— ์žˆ๋Š”์ง€ ์ฐพ๊ธฐ ํž˜๋“ค์–ดโ€ฆ ์ฝ”๋“œ ์ „์ฒด ๋’ค์ ธ์•ผ ํ• ๊นŒ?โ€
  • โ€œ์ˆ˜์ • ์š”์ฒญ์ด ์™”๋Š”๋ฐ, ์–ด๋””์— ์ ์šฉํ•ด์•ผ ํ• ์ง€ ๋ชจ๋ฅด๊ฒ ์–ด. ์–ด๋””์„œ ๋ญ˜ ๋ฐ”๊ฟ”์•ผ ํ•˜๋Š”์ง€โ€ฆ ๋ญ์•ผ ์ด๊ฑฐ?โ€
  • โ€œ์ฝ”๋“œ๊ฐ€ ์—‰์ผœ์žˆ๊ณ , ๊ธฐ๋Šฅ์ด ํฉ์–ด์ ธ ์žˆ์œผ๋ฉด, ์ˆ˜์ •์ด ๋์—†์ด ๋ฐ˜๋ณต๋˜๋Š” ๊ฑฐ ์•„๋ƒ?โ€

ํ•ต์‹ฌ ์„ค๋ช…:

๊ธฐ์กด์—๋Š” AI ์—์ด์ „ํŠธ์˜ ์ˆ˜์ •์ด โ€˜์ฝ”๋“œ ์ „์ฒด๋ฅผ ๋’ค์ ธ์•ผ ํ•˜๋Š” ์ˆ˜์ž‘์—…โ€™์ด์—ˆ๋Š”๋ฐ, ์ด ๋…ผ๋ฌธ์€ โ€˜ํ–‰๋™ ์ค‘์‹ฌ์˜ ์ž๋™ ๊ตฌ์กฐํ™”โ€™์™€ โ€˜์ง„ํ–‰์  ์ •๋ณด ์ œ๊ณตโ€™์„ ํ†ตํ•ด ์ˆ˜์ • ์œ„์น˜๋ฅผ ์ •ํ™•ํžˆ ์ฐพ์•„์ฃผ๋Š” ์‹œ์Šคํ…œ์„ ์ œ์•ˆํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • **ํ–‰๋™ ๊ธฐ๋ฐ˜ ์ฝ”๋“œ ๋งคํ•‘**์œผ๋กœ, ์ˆ˜์ • ์š”์ฒญ์— ๋งž์ถฐ ํ–‰๋™์„ ์ฐพ๋Š” ์ •ํ™•๋„๊ฐ€ **42% ํ–ฅ์ƒ** (๋น„๊ต ๋Œ€์ƒ: ์ˆ˜์ž‘์—… ๊ธฐ๋ฐ˜ ๋งคํ•‘)
  • **์Šคํ”„๋ ˆ๋“œ๋œ ์ฝ”๋“œ ์œ„์น˜, ๋“œ๋ฌผ๊ฒŒ ์‹คํ–‰๋˜๋Š” ๊ฒฝ๋กœ, ๋ชจ๋“ˆ ๊ฐ„ ์ƒํ˜ธ์ž‘์šฉ**์—์„œ์˜ ํ–ฅ์ƒ์ด ๊ฐ€์žฅ ํฌ๋ฉฐ, **์ตœ๋Œ€ 2.3๋ฐฐ์˜ ํ† ํฐ ์ ˆ๊ฐ** ํšจ๊ณผ๋„ ์‹คํ˜„

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

**์ˆ˜์ •์„ ์œ„ํ•œ ์ฝ”๋“œ ํƒ์ƒ‰ โ†’ ํ–‰๋™ ์ค‘์‹ฌ ์ž๋™ ๋งคํ•‘ + ์ ์ง„์  ์ •๋ณด ์ œ๊ณต**

(๊ธฐ์กด: โ€œ์–ด๋””์— ์žˆ๋Š”์ง€ ์ฐพ์•„์•ผ ํ•ดโ€ โ†’ ์ƒˆ ๋ฐฉ์‹: โ€œ์–ด๋””์— ์žˆ์–ด์•ผ ํ• ์ง€ ์•Œ๊ณ  ์•Œ๋ ค์ค˜โ€)

๋…ผ๋ฌธ ๋ณด๊ธฐ โ†’ Ruhan Wang, Yucheng Shi, Zongxia Li ์™ธ 7๋ช…
3
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
ByteDance

๐Ÿง  โ€œ์‹œ๊ฐ ๋ฐ์ดํ„ฐ๋งŒ์œผ๋กœ๋„ ๋ณต์žกํ•œ ์ถ”๋ก ๊ณผ ๋ฌผ๋ฆฌ ๋ฒ•์น™, ์žฅ๊ธฐ ๊ณ„ํš์„ ๋™์‹œ์— ํ•™์Šตํ•  ์ˆ˜ ์žˆ๋‹ค? ์ด๊ฒŒ ์ง„์งœ ๊ฐ€๋Šฅํ•œ ๊ฑฐ์•ผ?โ€

UniVR: Thinking in Visual Space for Unified Visual Reasoning

๐Ÿ›๏ธ ์†Œ์†: ByteDance (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: visual reasoning, reinforcement learning, physical dynamics, long-term planning, visual demonstrations

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์‹œ๊ฐ ์ •๋ณด๋งŒ์œผ๋กœ๋„ ๋ฌผ๋ฆฌ ๋ฒ•์น™์„ ์ดํ•ดํ•  ์ˆ˜ ์žˆ์„๊นŒ?โ€
  • โ€œ์žฅ๊ธฐ ๊ณ„ํš์„ ์‹œ๊ฐ ๋ฐ์ดํ„ฐ๋กœ ํ•™์Šตํ•˜๋Š” ๊ฒŒ ๊ฐ€๋Šฅํ• ๊นŒ?โ€
  • โ€œํ…์ŠคํŠธ๋‚˜ ํžŒํŠธ ์—†์ด๋„ ๋กœ์ง์„ ๋งž์ถฐ์•ผ ํ•  ๋•Œ, AI๋Š” ์–ด๋–ป๊ฒŒ ํ• ๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” ์‹œ๊ฐ ๋ฐ์ดํ„ฐ์—์„œ ์ถ”๋ก ์„ ํ•˜๋ ค๋ฉด ํ…์ŠคํŠธ-์ด๋ฏธ์ง€ ์Œ์ด๋‚˜ ํŠน์ • ํ—ˆ๋ธŒ๊ฐ€ ํ•„์š”ํ–ˆ์ง€๋งŒ, ์ด ๋…ผ๋ฌธ์€ ์ˆœ์ˆ˜ ์‹œ๊ฐ ๋ฐ์ดํ„ฐ๋งŒ์œผ๋กœ๋„ ๋ณต์žกํ•œ ์ถ”๋ก , ๋ฌผ๋ฆฌ์  ๋™์—ญํ•™, ์žฅ๊ธฐ ๊ณ„ํš์„ ๋™์‹œ์— ํ•™์Šตํ•˜๊ฒŒ ๋ฉ๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • VR-X ๋ฒค์น˜๋งˆํฌ์—์„œ **์ตœ๋Œ€ 25% ์„ฑ๋Šฅ ํ–ฅ์ƒ**์„ ๊ธฐ๋กํ•œ ์ฒซ ๋ฒˆ์งธ ์‹œ๊ฐ ์ค‘์‹ฌ ์ถ”๋ก  ๋ชจ๋ธ
  • ์‹œ๊ฐ ์ถ”๋ก  ์„ฑ๋Šฅ ํ–ฅ์ƒ์œผ๋กœ **๋‹ค์–‘ํ•œ ๋ฉ€ํ‹ฐ๋ชจ๋‹ฌ ์ดํ•ด ๋ฒค์น˜๋งˆํฌ์—์„œ๋„ ์„ฑ๋Šฅ ์ƒ์Šน**

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œํ…์ŠคํŠธ-์ด๋ฏธ์ง€ ์Œ์ด๋‚˜ ํƒœ์Šคํฌ๋ณ„ ํ—ˆ๋ธŒ๋ฅผ ์š”๊ตฌํ•˜๋Š” ๋ฐฉ์‹โ€ โ†’ โ€œ์ˆœ์ˆ˜ ์‹œ๊ฐ ๋ฐ์ดํ„ฐ + VR-GRPO ๊ฐ•ํ™” ํ•™์Šต์œผ๋กœ ๋กœ์ง๊ณผ ๋ฌผ๋ฆฌ์„ฑ ๋™์‹œ ํ•™์Šตโ€

4
๐Ÿ›๏ธ ๋น…ํ…Œํฌ ๐Ÿ”ฅ ํŠธ๋ Œ๋”ฉ 100+
Alibaba AMAP CV Lab

๐Ÿค– โ€œ๋น„์ „+์–ธ์–ด+์ด๋™โ€์„ ํ•˜๋‚˜๋กœ ๋ฌถ๋Š” ๊ฒŒ ์‰ฌ์šด๊ฐ€์š”? ์•„๋‹ˆ๋ฉดโ€ฆ ์˜คํžˆ๋ ค ๋ณต์žกํ•ด์ง€๋Š”๊ฐ€์š”?

ABot-N1: Toward a General Visual Language Navigation Foundation Model

๐Ÿ›๏ธ ์†Œ์†: Alibaba AMAP CV Lab (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Visual-Language Navigation, Chain-of-Thought Reasoning, Pixel Goal, Embodied AI, Slow-Fast Architecture

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์–ด๋””๋กœ ๊ฐ€์•ผ ํ• ์ง€โ€ ๋งํ•˜๋Š” ํ…์ŠคํŠธ์™€ โ€œ์–ด๋””๋กœ ๊ฐ€์•ผ ํ• ์ง€โ€ ํŒ๋‹จํ•˜๋Š” ์ด๋ฏธ์ง€๊ฐ€ ์„œ๋กœ ๋งž์ง€ ์•Š์„ ๋•Œ, ์–ด๋–ป๊ฒŒ ํ•ด๊ฒฐํ•  ์ˆ˜ ์žˆ์„๊นŒ์š”?
  • โ€œ์‹ค์ œ ๋„์‹œโ€์—์„œ โ€œ์‚ฌ๋žŒ ๋”ฐ๋ผ๊ฐ€๊ธฐโ€๋‚˜ โ€œPOI ๋„์ฐฉ๋ฅ โ€์ด ๋–จ์–ด์ง€๋Š” ์ด์œ ๋Š” ๋ฌด์—‡์ผ๊นŒ์š”?
  • โ€œ๋ชจ๋“  ์ž„๋ฌด์— ์ ์šฉ ๊ฐ€๋Šฅํ•œโ€ ํ•˜๋‚˜์˜ ๋ชจ๋ธ์ด ์ •๋ง ๊ฐ€๋Šฅํ• ๊นŒ์š”?

๊ธฐ์กด์—๋Š” ๋‹จ์ผ ์ •์ฑ…์ด ๋น„์ „๊ณผ ์–ธ์–ด๋ฅผ ์ง์ ‘ ๋งคํ•‘ํ•ด ํ–‰๋™์„ ์ƒ์„ฑํ–ˆ์ง€๋งŒ, ์ด๋Š” ์ขŒํ‘œ ํ๋ฆ„ ๋ฌธ์ œ์™€ ๊ธด ๊ผฌ๋ฆฌ ์„ธ๋ฏธํ‹ฑ์Šค๋ฅผ ์ฒ˜๋ฆฌํ•˜์ง€ ๋ชปํ–ˆ๊ณ , ํˆฌ๋ช…์„ฑ์ด ์—†์–ด ์ผ๋ฐ˜ํ™”์™€ ๊ฒฌ๊ณ ์„ฑ ์‚ฌ์ด์—์„œ ๊ท ํ˜•์„ ์žƒ์—ˆ์Šต๋‹ˆ๋‹ค.

์ด ๋…ผ๋ฌธ์€ โ€œ์ง€์‹ ์ถ”๋ก โ€๊ณผ โ€œํ–‰๋™ ์ œ์–ดโ€๋ฅผ ๋ถ„๋ฆฌํ•œ ๋А๋ฆฌ๊ณ  ๋น ๋ฅธ ์•„ํ‚คํ…์ฒ˜๋กœ, ์‹œ๊ฐ-์–ธ์–ด ์‹ ํ˜ธ๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ๋ช…ํ™•ํ•œ Chain-of-Thought ์ถ”๋ก ์„ ์ˆ˜ํ–‰ํ•˜๊ณ , ์ด๋ฅผ ํ†ตํ•ด ํ”ฝ์…€ ๊ธฐ๋ฐ˜ ๋ชฉํ‘œ๋ฅผ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค. ์ด ๋ชฉํ‘œ๋Š” ๋‹ค์–‘ํ•œ ์ž„๋ฌด(ํฌ์ธํŠธ/POI/์ธ์ŠคํŠธ๋Ÿญ์…˜/์‚ฌ๋žŒ ๋”ฐ๋ผ๊ฐ€๊ธฐ ๋“ฑ)์— ํ†ตํ•ฉ๋œ ์ธํ„ฐํŽ˜์ด์Šค ์—ญํ• ์„ ํ•˜๋ฉฐ, ๋น ๋ฅธ ์•ก์…˜ ์ „๋ฌธ๊ฐ€๊ฐ€ ์ด๋ฅผ ํ…์ŠคํŠธ์™€ ๊ฒฐํ•ฉํ•ด ์‹ค์‹œ๊ฐ„ ์ œ์–ด ์ฃผํŒŒ์ˆ˜๋กœ ์›จ์ดํฌ์ธํŠธ๋ฅผ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค.

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ๋„์‹œ ๊ทœ๋ชจ ๋„ค๋น„๊ฒŒ์ด์…˜์—์„œ POI ๋„์ฐฉ๋ฅ ์„ 35.0% ์ฆ๊ฐ€์‹œ์ผœ 77.3%๋กœ ํ–ฅ์ƒ
  • ๋ณต์žกํ•œ ์‹ค๋‚ด/์‹ค์™ธ ํ™˜๊ฒฝ์—์„œ 95.4% / 92.9%์˜ ์„ฑ๊ณต๋ฅ (SR) ๋‹ฌ์„ฑ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œ๋‹จ์ผ ์ •์ฑ…์ด ๋ชจ๋“  ์ž„๋ฌด๋ฅผ ์ง์ ‘ ๋งคํ•‘ํ•˜๋Š” ๋ฐฉ์‹โ€ โ†’ โ€œ๋А๋ฆฐ ์ถ”๋ก  + ๋น ๋ฅธ ์ œ์–ด ์•„ํ‚คํ…์ฒ˜๋กœ ์‹œ๊ฐ-์–ธ์–ด ๊ธฐ๋ฐ˜ ํ”ฝ์…€ ๋ชฉํ‘œ๋ฅผ ์ค‘๊ฐ„ ์ธํ„ฐํŽ˜์ด์Šค๋กœ ํ™œ์šฉโ€

๋…ผ๋ฌธ ๋ณด๊ธฐ โ†’ Ruiyan Gong, Yingnan Guo, Junjun Hu ์™ธ 43๋ช…
5
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
Alibaba AMAP CV Lab

๐Ÿค– โ€œ๋กœ๋ด‡์ด ๊ธฐ์–ต์„ ๊ฐ€์ง„ ๊ฒŒ ์ง„์งœ๋กœ ๊ฐ€๋Šฅํ•˜๋‹ค? ๊ทธ๊ฒŒ ์•„๋‹ˆ๋ผ๋ฉดโ€ฆ ์ด ๋…ผ๋ฌธ์€ ๋กœ๋ด‡์—๊ฒŒ โ€˜๋‡Œโ€™๋ฅผ ์คฌ๋‹ค!โ€

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

๐Ÿ›๏ธ ์†Œ์†: Alibaba AMAP CV Lab (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: robotic agent OS, lifelong memory, multi-modal graph, self-evolution, embodied benchmark

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • ๋กœ๋ด‡์ด ๊ธด ์‹œ๊ฐ„ ๋™์•ˆ ์ผ๊ด€๋œ ๊ธฐ์–ต์„ ์œ ์ง€ํ•  ์ˆ˜ ์žˆ์„๊นŒ?
  • ๋กœ๋ด‡์ด ์‹คํŒจ๋ฅผ ํ†ตํ•ด ์Šค์Šค๋กœ ์ง„ํ™”ํ•˜๋Š” ๊ฑด ํ˜„์‹ค์ธ๊ฐ€?
  • โ€˜์žฅ๊ธฐ ์‹คํ–‰โ€™์ด ๊ฐ€๋Šฅํ•œ ๋กœ๋ด‡ OS๋Š” ์•„์ง ์—†๋Š”๋ฐ, ์ด๊ฑด ์ง„์งœ๋กœ ๊ฐ€๋Šฅํ• ๊นŒ?

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” ๋กœ๋ด‡์€ ๋‹จ์ผ ์ปจํŠธ๋กค๋Ÿฌ๋กœ ์‹คํ–‰๋˜๊ณ , ์žฅ๊ธฐ์  ๊ธฐ์–ต์ด๋‚˜ ์ž๊ธฐ ์ง„ํ™” ๊ธฐ๋Šฅ์ด ์—†์—ˆ๋Š”๋ฐ, ์ด ๋…ผ๋ฌธ์€ โ€œAgent OSโ€๋ผ๋Š” ์ƒˆ๋กœ์šด ๋ ˆ์ด์–ด๋ฅผ ๋„์ž…ํ•ด ์žฅ๊ธฐ ์‹คํ–‰, ๋‹ค์ค‘ ๋ชจ๋‹ฌ ๋ฉ”๋ชจ๋ฆฌ, ์‹คํŒจ ๊ธฐ๋ฐ˜ ์ž๊ฐ€ ์ง„ํ™”๋ฅผ ๋™์‹œ์— ์ง€์›ํ•ฉ๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ABot-AgentOS Static์€ LoCoMo์—์„œ 87.5, OpenEQA EM-EQA์—์„œ 59.9, Mem-Gallery์—์„œ 88.6, NExT-QA์—์„œ 76.5 Acc@All์„ ๋‹ฌ์„ฑ
  • ์ž๊ฐ€ ์ง„ํ™” ๊ธฐ๋Šฅ์„ ์ ์šฉํ•œ ํ›„ LoCoMo 88.7, OpenEQA 60.4, Mem-Gallery 89.0์œผ๋กœ ์„ฑ๋Šฅ ํ–ฅ์ƒ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œ๋‹จ์ผ ์ปจํŠธ๋กค๋Ÿฌ + ์ผํšŒ์„ฑ ์‹คํ–‰โ€ โ†’ โ€œAgent OS + ๋‹ค์ค‘ ๋ชจ๋‹ฌ ๊ธฐ์–ต + ์‹คํŒจ ๊ธฐ๋ฐ˜ ์ž๊ฐ€ ์ง„ํ™”โ€

๋…ผ๋ฌธ ๋ณด๊ธฐ โ†’ Jiayi Tian, Shiao Liu, Yuting Xu ์™ธ 30๋ช…
6
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
GoogleDeepMind

๐ŸŽฌ โ€œ์˜์ƒ ์ƒ์„ฑ ๋ชจ๋ธ์ด ๋น„์ „์˜ โ€˜์ผ๋ฐ˜ ๋ชฉ์ โ€™ ํ•™์Šต์ž๋ผ๋Š” ๊ฑธ, ๋ˆ„๊ฐ€ ์ฒ˜์Œ ๋งํ–ˆ์„๊นŒ?โ€

Video Generation Models are General-Purpose Vision Learners

๐Ÿ›๏ธ ์†Œ์†: GoogleDeepMind (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: video generation, vision-language alignment, general-purpose vision, diffusion model, pre-training

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์˜์ƒ ์ƒ์„ฑ ๋ชจ๋ธ์ด ๋น„์ „ ์ž„๋ฌด์— ์“ฐ์ผ ์ˆ˜ ์žˆ์„๊นŒ?โ€
  • โ€œํ…์ŠคํŠธ๋กœ ์ง€์‹œํ•˜๋Š” ๋น„์ „ ๋ชจ๋ธ์ด, ์ „๋ฌธ ๋ชจ๋ธ์„ ๋„˜์–ด์„œ๋Š” ์„ฑ๋Šฅ์„ ๋‚ผ ์ˆ˜ ์žˆ์„๊นŒ?โ€
  • โ€œ์˜์ƒ ์ƒ์„ฑ์ด ๋‹จ์ˆœํ•œ ํ•ฉ์„ฑ ๋„๊ตฌ์ผ ๋ฟ์ธ๊ฐ€, ์•„๋‹ˆ๋ฉด ๋น„์ „์˜ ๊ธฐ์ดˆ๊ฐ€ ๋  ์ˆ˜ ์žˆ์„๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” ์˜์ƒ ๋ถ„์„์€ ์ „๋ฌธ ๋ชจ๋ธ์ด ํ•„์š”ํ–ˆ๊ณ , ํ…์ŠคํŠธ-์˜์ƒ ์ƒ์„ฑ์€ ํ•ฉ์„ฑ ๋„๊ตฌ๋กœ ์—ฌ๊ฒจ์กŒ์ง€๋งŒ, ์ด ๋…ผ๋ฌธ์€ ์˜์ƒ ์ƒ์„ฑ ๋ชจ๋ธ์ด โ€˜์ผ๋ฐ˜ ๋ชฉ์  ๋น„์ „ ํ•™์Šต์žโ€™๋กœ ์ง„ํ™”ํ•  ์ˆ˜ ์žˆ์Œ์„ ์ž…์ฆํ–ˆ์Šต๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • ์˜์ƒ ์ƒ์„ฑ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ GenCeption์€ 7~500๋ฐฐ ์ ์€ ํ•™์Šต ๋ฐ์ดํ„ฐ๋กœ D4RT, VGGT-Omega ๋“ฑ ์ „๋ฌธ ๋ชจ๋ธ๊ณผ ๋™๋“ฑํ•˜๊ฑฐ๋‚˜ ๋” ๋›ฐ์–ด๋‚œ ์„ฑ๋Šฅ์„ ๋‹ฌ์„ฑ
  • 3D ํ‚คํฌ์ธํŠธ ์˜ˆ์ธก, ํ‘œ๋ฉด ์ •์ƒ, ์นด๋ฉ”๋ผ ํฌ์ฆˆ ์ถ”์ •, ํ‘œํ˜„ ์ฐธ์กฐ ์„ธ๊ทธ๋ฉ˜ํ…Œ์ด์…˜ ๋“ฑ 6๊ฐ€์ง€ ์ž„๋ฌด์—์„œ ์ „๋ฌธ ๋ชจ๋ธ(์˜ˆ: DepthAnything3, SAM3 ๋“ฑ)๊ณผ ๋น„๊ตํ•ด 1.2~2.3๋ฐฐ ๋†’์€ ์„ฑ๋Šฅ ๊ฐœ์„ 

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œ์˜์ƒ ์ƒ์„ฑ์„ ํ•ฉ์„ฑ ๋„๊ตฌ๋กœ๋งŒ ๋ดค๋˜ ์‹œ๋Œ€โ€ โ†’ โ€œ์˜์ƒ ์ƒ์„ฑ์ด ๋น„์ „์˜ ๊ธฐ์ดˆ ํ•™์Šต ๊ฒฝ๋กœ๊ฐ€ ๋˜๋Š” ์‹œ๋Œ€โ€

๋…ผ๋ฌธ ๋ณด๊ธฐ โ†’ Letian Wang, Chuhan Zhang, Rishabh Kabra ์™ธ 9๋ช…
7
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
ByteDance Seed

๐Ÿ“š โ€œ์ด๋ฏธ์ง€๊ฐ€ โ€˜๋ฌธ์žฅโ€™์„ ๋˜์ฐพ์•„์•ผ ํ• ๊นŒ? MLLM์ด ์ง์ ‘ ํ‰๊ฐ€ํ•˜๋Š” ์‹œ๋Œ€๊ฐ€ ์™”๋‹ค!โ€

Read It Back: Pretrained MLLMs Are Zero-Shot Reward Models for Text-to-Image Generation

๐Ÿ›๏ธ ์†Œ์†: ByteDance Seed (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: SpectraReward, zero-shot, reward modeling, image-text alignment, reinforcement learning

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์ด๋ฏธ์ง€ ์ƒ์„ฑ ๋ชจ๋ธ์˜ ํ’ˆ์งˆ์€ ์–ด๋–ป๊ฒŒ ์ธก์ •ํ•ด์•ผ ํ•˜๋‚˜?โ€
  • โ€œ๋ณดํ†ต reward model์„ ๋”ฐ๋กœ ํ›ˆ๋ จํ•ด์•ผ ํ•˜๋Š”๋ฐ, ์™œ ์•ˆ ๋˜๋Š” ๊ฑธ๊นŒ?โ€
  • โ€œ๋Œ€๊ทœ๋ชจ MLLM์ด ์ด๋ฏธ์ง€ ์ƒ์„ฑ์— ์“ฐ์ด๋ฉด, ๊ทธ ์ž์ฒด๋กœ reward ๋ชจ๋ธ์ด ๋  ์ˆ˜ ์žˆ์„๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” ์ƒ์„ฑ๋œ ์ด๋ฏธ์ง€๋ฅผ ํŒ๋‹จํ•˜๊ฑฐ๋‚˜ ๋ถ„ํ•ด๋œ ์งˆ๋ฌธ์— ๋‹ตํ•˜๊ฒŒ ํ–ˆ๋Š”๋ฐ, ์ด ๋…ผ๋ฌธ์€ โ€œ์›๋ณธ ํ”„๋กฌํ”„ํŠธ๋ฅผ ์ด๋ฏธ์ง€์—์„œ ๋ณต์›ํ•˜๋Š” ์ •๋„โ€๋กœ ๋ณด์ƒํ•จ์œผ๋กœ์จ, ํ›ˆ๋ จ ์—†์ด MLLM์„ ๋ฐ”๋กœ reward model๋กœ ์žฌ์‚ฌ์šฉํ•ฉ๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 9๊ฐœ์˜ MLLM ๋ฐฑ๋ณธ(4B~235B ํŒŒ๋ผ๋ฏธํ„ฐ)์„ ์‚ฌ์šฉํ•ด ์‹คํ—˜ํ•œ ๊ฒฐ๊ณผ, SpectraReward๋Š” ํ‰๊ท ์ ์œผ๋กœ **1.8๋ฐฐ** ๋” ๋‚˜์€ ์ƒ์„ฑ ํ’ˆ์งˆ์„ ๋‹ฌ์„ฑํ•จ.
  • Self-SpectraReward๋Š” **235B ํŒŒ๋ผ๋ฏธํ„ฐ ๋ชจ๋ธ๋ณด๋‹ค๋„ 1.3๋ฐฐ** ๋†’์€ ์„ฑ๊ณผ๋ฅผ ๋ณด์ด๋ฉฐ, ์™ธ๋ถ€ reward ๋ชจ๋ธ ์—†์ด๋„ ํšจ๊ณผ์ ์ธ ํด๋กœ์ฆˆ๋“œ ๋ฃจํ”„ ํ•™์Šต์ด ๊ฐ€๋Šฅํ•จ.

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œ์™ธ๋ถ€ reward ๋ชจ๋ธ์„ ๋”ฐ๋กœ ํ›ˆ๋ จํ•˜๊ณ  ์ •๊ตํ•˜๊ฒŒ ์กฐ์ •ํ•ด์•ผ ํ–ˆ๋‹คโ€ โ†’ โ€œMLLM์ด ์ด๋ฏธ์ง€ ์ƒ์„ฑ์„ ํ•  ๋•Œ ๊ทธ ์ž์ฒด๋กœ reward๋ฅผ ๊ณ„์‚ฐํ•ด์ฃผ๋Š” ๋‹จ์ผ ํŒŒ์ดํ”„๋ผ์ธ์œผ๋กœ ๋’ค์ง‘์Œโ€

๋…ผ๋ฌธ ๋ณด๊ธฐ โ†’ Runhui Huang, Qihui Zhang, Zhe Liu ์™ธ 3๋ช…
8
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
Tencent Hunyuan

๐Ÿš€ โ€œ๋ช‡ ๋‹จ๊ณ„๋งŒ์œผ๋กœ๋„ ์ตœ๊ณ  ์ˆ˜์ค€์˜ ๊ฒฐ๊ณผ? ์ด๊ฑด AI ์ƒ์„ฑ ๋ชจ๋ธ์˜ โ€˜์Šคํ”ผ๋“œ์™€ ํ’ˆ์งˆโ€™์„ ๋™์‹œ์— ๋’ค์ง‘๋Š”๋‹ค!โ€

MeanFlowNFT: Bringing Forward-Process RL to Average-Velocity Generators

๐Ÿ›๏ธ ์†Œ์†: Tencent Hunyuan (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: MeanFlow, Forward-Process RL, DiffusionNFT, Velocity Prediction, Few-Step Sampling

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ๋ช‡ ์Šคํ…์œผ๋กœ๋„ ๋›ฐ์–ด๋‚œ ์ด๋ฏธ์ง€/๋น„๋””์˜ค๋ฅผ ๋งŒ๋“ค ์ˆ˜ ์žˆ์„๊นŒ?โ€
  • โ€œRL ํŠœ๋‹์ด ํ‰๊ท  ์†๋„ ๊ธฐ๋ฐ˜ ๋ชจ๋ธ์— ์ ์šฉ๋  ์ˆ˜ ์žˆ์„๊นŒ?โ€
  • โ€œ50๋‹จ๊ณ„๊ฐ€ ์•„๋‹ˆ๋ผ 4๋‹จ๊ณ„๋กœ๋„ SOTA๋ฅผ ๋„˜์„ ์ˆ˜ ์žˆ์„๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” โ€œ์ˆœ์ฐจ์  ์—ญ๋ฐฉํ–ฅ ์ƒ˜ํ”Œ๋ง + ์ธ์Šคํ„ด์Šค ์†๋„ ์ตœ์ ํ™”โ€๊ฐ€ RL๊ณผ ๊ฒฐํ•ฉ๋๋Š”๋ฐ, ์ด ๋…ผ๋ฌธ์€ โ€œํ‰๊ท  ์†๋„ ๊ธฐ๋ฐ˜ MeanFlowโ€์— ์ „๋ฐฉ ํ”„๋กœ์„ธ์Šค RL์„ ์ ์šฉํ•ด ์ƒ˜ํ”Œ๋ง ์†๋„์™€ ํ’ˆ์งˆ์„ ๋™์‹œ์— ๋†’์˜€์Šต๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • Wan 2.1 ๋ฐ์ดํ„ฐ์…‹์—์„œ 4๋‹จ๊ณ„ ์ƒ˜ํ”Œ๋ง์œผ๋กœ VBench ์ ์ˆ˜ 84.33 ๋‹ฌ์„ฑ, 50๋‹จ๊ณ„ LongCat-Video RL(82.57)์„ ๊ทผ์†Œํ•˜๊ฒŒ ์ œ์น˜๊ณ  ํ’ˆ์งˆ ์šฐ์œ„ ํ™•๋ณด
  • SD3.5-M ๊ธฐ์ค€ 8๊ฐœ ๋ฉ”ํŠธ๋ฆญ ์ค‘ 6๊ฐœ์—์„œ ๊ธฐ์กด ์ตœ๊ณ  ๊ธฐ๋ก์„ ์ƒํšŒํ•˜๋ฉฐ, RL ํŠœ๋‹๋œ ์ ์€ ๋ช‡ ๋‹จ๊ณ„ ๋ชจ๋ธ ์ค‘ ๊ฐ€์žฅ ์šฐ์ˆ˜ํ•œ ์„ฑ๋Šฅ

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œ์—ญ๋ฐฉํ–ฅ ์ƒ˜ํ”Œ๋ง + ์ธ์Šคํ„ด์Šค ์†๋„ ์ตœ์ ํ™”โ€ โ†’ โ€œ์ „๋ฐฉ ํ”„๋กœ์„ธ์Šค RL + ํ‰๊ท  ์†๋„ ๊ธฐ๋ฐ˜ ์ƒ˜ํ”Œ๋งโ€

์ด์ œ ๋ช‡ ๋‹จ๊ณ„๋กœ๋„ SOTA๋ฅผ ๋„˜์„ ์ˆ˜ ์žˆ๋Š” โ€˜๋น ๋ฅด๊ณ  ์ •๊ตํ•œโ€™ ์ƒ์„ฑ์ด ๊ฐ€๋Šฅํ•ด์กŒ์Šต๋‹ˆ๋‹ค.

9
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
Google

๐Ÿง  โ€œ์ด๋ฏธ์ง€ ์ดํ•ด์™€ ์ƒ์„ฑ์ด ๋™์‹œ์— ์ผ์–ด๋‚˜์•ผ ํ•œ๋‹ค๋Š” ๊ฑด, ์ธ๊ฐ„์˜ ๋‡Œ๊ฐ€ ์ด๋ฏธ ๊ทธ๋ ‡๊ฒŒ ์ž‘๋™ํ•œ๋‹ค๋Š” ๊ฑฐ์•ผ!โ€

Concurrent Image Understanding and Generation: Self-Correcting Coupled Markov Jump Processes

๐Ÿ›๏ธ ์†Œ์†: Google (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: Masked Diffusion Models, Cross-modal Attention, Self-Correcting, Joint Multimodal Generation, Coupled Markov Jump Processes

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์ด๋ฏธ์ง€์— ๋Œ€ํ•œ ์„ค๋ช…์„ ์ƒ์„ฑํ•  ๋•Œ, ์ดํ•ด๊ฐ€ ๋’ค๋”ฐ๋ฅด๋Š” ๊ฒŒ ์•„๋‹ˆ๋ผ ๋™์‹œ์— ์ผ์–ด๋‚˜์•ผ ํ•˜๋Š” ๊ฑด๊ฐ€?โ€
  • โ€œAI๊ฐ€ ์ด๋ฏธ์ง€์™€ ํ…์ŠคํŠธ๋ฅผ ๋ฒˆ๊ฐˆ์•„ ์ƒ์„ฑํ•˜๋Š” ๊ฒŒ ์•„๋‹ˆ๋ผ, ์„œ๋กœ ์˜ํ–ฅ์„ ์ฃผ๋ฉฐ ๋™์‹œ์— ์ง„ํ™”ํ•˜๋Š” ๊ฒŒ ๋” ์ž์—ฐ์Šค๋Ÿฌ์šด ๊ฑด๊ฐ€?โ€
  • โ€œAI๊ฐ€ ์Šค์Šค๋กœ โ€˜์ด๊ฑด ํ‹€๋ ธ์–ดโ€™ ํ•˜๊ณ  ์ˆ˜์ •ํ•  ์ˆ˜ ์žˆ๋‹ค๋ฉด, ์ธ๊ฐ„์ฒ˜๋Ÿผ ํ๋ฆ„์„ ์กฐ์ •ํ•˜๋Š” ๊ฑด ๊ฐ€๋Šฅํ• ๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” ์ด๋ฏธ์ง€์™€ ํ…์ŠคํŠธ๋ฅผ ๋ณ„๊ฐœ๋กœ ์—…๋ฐ์ดํŠธํ•˜๊ฑฐ๋‚˜ ๋ฒˆ๊ฐˆ์•„ ์ƒ์„ฑํ•˜๋˜ ๋ฐฉ์‹์ด์—ˆ๋Š”๋ฐ, ์ด ๋…ผ๋ฌธ์€ ๋‘ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๊ฐ€ ์„œ๋กœ์˜ ์‹ ๋ขฐ๋„๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ์‹ค์‹œ๊ฐ„์œผ๋กœ ์กฐ์ •ํ•˜๊ณ , ๋ชจ์ˆœ์ด ์ƒ๊ธฐ๋ฉด ์ฆ‰์‹œ ์ˆ˜์ •ํ•˜๋Š” โ€˜์ž๊ธฐ ์ˆ˜์ •ํ˜• ๊ฒฐํ•ฉ ๋งˆ๋ฅด์ฝ”ํ”„ ์ ํ”„ ํ”„๋กœ์„ธ์Šคโ€™๋ฅผ ๋„์ž…ํ–ˆ์Šต๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • JEdit-1M ๋ฐ์ดํ„ฐ์…‹์—์„œ ์ด๋ฏธ์ง€ ํŽธ์ง‘ ์ž‘์—…์—์„œ **์ตœ๊ณ ์˜ ๊ฒฐํ•ฉ ์„ฑ๋Šฅ**์„ ๋‹ฌ์„ฑํ•ด ๊ธฐ์กด ๋ฐฉ๋ฒ•๋ณด๋‹ค **3.2๋ฐฐ ๋” ์ •ํ™•ํ•œ ๊ฒฐ๊ณผ**๋ฅผ ๋‚ด์—ˆ์Œ.
  • JMaze-200K์™€ JNono-200K์—์„œ **๋น„์ฃผ์–ผ ์ถ”๋ก  ์„ฑ๋Šฅ์ด 28.7% ํ–ฅ์ƒ**๋˜์—ˆ์œผ๋ฉฐ, ์ด๋Š” ๋‹จ์ผ ์Šคํ…์—์„œ์˜ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ ๊ฐ„ ์ƒํ˜ธ์ž‘์šฉ ๋•๋ถ„์— ๋‹ฌ์„ฑ๋จ.

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

โ€œํ…์ŠคํŠธ์™€ ์ด๋ฏธ์ง€๋ฅผ ๋ฒˆ๊ฐˆ์•„ ์ƒ์„ฑํ•˜๊ฑฐ๋‚˜ ๋ณ„๊ฐœ๋กœ ์—…๋ฐ์ดํŠธํ•˜๋Š” ์ „ํ†ต์  ๋ฐฉ์‹โ€ โ†’ โ€œ๋‘ ๋ชจ๋‹ฌ๋ฆฌํ‹ฐ๊ฐ€ ์„œ๋กœ์˜ ์‹ ๋ขฐ๋„๋ฅผ ๊ธฐ๋ฐ˜์œผ๋กœ ์‹ค์‹œ๊ฐ„์œผ๋กœ ์กฐ์ •ํ•˜๊ณ , ๋ชจ์ˆœ์ด ์ƒ๊ธฐ๋ฉด ์ฆ‰์‹œ ์ˆ˜์ •ํ•˜๋Š” ์ž๊ธฐ ์ˆ˜์ •ํ˜• ๊ฒฐํ•ฉ ๋งˆ๋ฅด์ฝ”ํ”„ ์ ํ”„ ํ”„๋กœ์„ธ์Šคโ€

๋…ผ๋ฌธ ๋ณด๊ธฐ โ†’ Minh-Quan Le, Armand Comas, Alexandros Lattas ์™ธ 7๋ช…
10
๐Ÿ›๏ธ ๋น…ํ…Œํฌ
Adobe Research

๐ŸŽฏ "[SPEAR๋กœ ์ธ๊ณต์ง€๋Šฅ์ด ํ˜„์‹ค์„ ํ‰๋‚ด๋‚ด๋Š” ์†๋„๊ฐ€ 10๋ฐฐ ๋นจ๋ผ์กŒ๋‹ค๊ณ ? ์ •๋ง์ด์•ผ?]"

SPEAR: A Simulator for Photorealistic Embodied AI Research

๐Ÿ›๏ธ ์†Œ์†: Adobe Research (๋น…ํ…Œํฌ)

๐Ÿท๏ธ ํ•ต์‹ฌ ํ‚ค์›Œ๋“œ: photorealistic simulation, Unreal Engine, embodied AI, programmable rendering, high-level graph execution

๐Ÿ’ญ ์ด๋Ÿฐ ์งˆ๋ฌธ์„ ํ•ด๋ณธ ์  ์žˆ๋‚˜์š”?

  • โ€œ์™œ ๋‚ด ๋ชจ๋ธ์ด Unreal Engine์—์„œ ๋น ๋ฅด๊ฒŒ ๋ Œ๋”๋ง๋˜์ง€ ์•Š๋Š” ๊ฑธ๊นŒ?โ€
  • โ€œUE ๊ธฐ๋ฐ˜ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ๊ฐ€ ์™œ 14,000๊ฐœ ์ด์ƒ์˜ ํ•จ์ˆ˜๋ฅผ ์ง€์›ํ•˜์ง€ ๋ชปํ•˜๋Š” ๊ฑธ๊นŒ?โ€
  • โ€œ์‹ค์ œ ํ™˜๊ฒฝ์ฒ˜๋Ÿผ ๋ณด์ด๋Š” ์ด๋ฏธ์ง€๋ฅผ 73fps๋กœ ๋น ๋ฅด๊ฒŒ ์ƒ์„ฑํ•˜๋Š” ๊ฒŒ ๊ฐ€๋Šฅํ• ๊นŒ?โ€

[ํ•ต์‹ฌ ์„ค๋ช…: ๊ธฐ์กด์—๋Š” UE ๊ธฐ๋ฐ˜ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ๊ฐ€ ์ œํ•œ๋œ ๊ธฐ๋Šฅ๊ณผ ๋А๋ฆฐ ๋ Œ๋”๋ง ์†๋„๋กœ, ํ”„๋กœ๊ทธ๋ž˜๋ฐ ํ™•์žฅ์„ฑ๊ณผ ์‹ค์‹œ๊ฐ„ ์„ฑ๋Šฅ์„ ๋™์‹œ์— ์ œ๊ณตํ•˜์ง€ ๋ชปํ–ˆ์ง€๋งŒ, ์ด ๋…ผ๋ฌธ์€ Python ๊ธฐ๋ฐ˜์˜ SPEAR๋ฅผ ํ†ตํ•ด UE์™€์˜ ๋ชจ๋“ˆ๋Ÿฌ ํ”Œ๋Ÿฌ๊ทธ์ธ ๊ตฌ์กฐ๋กœ 14,000+ ํ•จ์ˆ˜๋ฅผ ๋…ธ์ถœํ•˜๊ณ , 73fps๋กœ 1920x1080 ํ•ด์ƒ๋„์˜ ๋น›๋‚˜๋Š” ์ด๋ฏธ์ง€๋ฅผ ์‹ค์‹œ๊ฐ„์œผ๋กœ ์ƒ์„ฑํ•ฉ๋‹ˆ๋‹ค.]

ํŠนํžˆ ์ฃผ๋ชฉํ•  ์ :

  • 14,000๊ฐœ ์ด์ƒ์˜ Unreal Engine ํ•จ์ˆ˜๋ฅผ Python์œผ๋กœ ์ง์ ‘ ์กฐ์ž‘ ๊ฐ€๋Šฅ โ†’ ๊ธฐ์กด UE ํ”Œ๋Ÿฌ๊ทธ์ธ๋ณด๋‹ค 10๋ฐฐ ์ด์ƒ ํ™•์žฅ์„ฑ ํ–ฅ์ƒ
  • 1920x1080 ํ•ด์ƒ๋„์˜ ์‚ฌ์ง„์„ 73ํ”„๋ ˆ์ž„/์ดˆ๋กœ NumPy ๋ฐฐ์—ด์— ์ง์ ‘ ๋ Œ๋”๋ง โ†’ ๊ธฐ์กด UE ํ”Œ๋Ÿฌ๊ทธ์ธ๋ณด๋‹ค 10๋ฐฐ ๋น ๋ฅธ ๋ Œ๋”๋ง ์†๋„

๐ŸŽฏ ์™œ ์ด๊ฒƒ์ด ๊ฒŒ์ž„ ์ฒด์ธ์ €์ธ๊ฐ€? :

๊ธฐ์กด UE ๊ธฐ๋ฐ˜ ์‹œ๋ฎฌ๋ ˆ์ดํ„ฐ๋Š” ์ œํ•œ๋œ ํ•จ์ˆ˜์™€ ๋А๋ฆฐ ๋ Œ๋”๋ง ์†๋„๋กœ ํ”„๋กœ๊ทธ๋ž˜๋ฐ ํ™•์žฅ์„ฑ์ด ๋‚ฎ์•˜์Œ โ†’ SPEAR๋Š” 14,000+ ํ•จ์ˆ˜ ๋…ธ์ถœ + 73fps ๋น ๋ฅธ ๋ Œ๋”๋ง + ๊ณ ํ•ด์ƒ๋„ ๋ฌผ๋ฆฌ์  ์ƒ‰์ƒ ๋ถ„ํ•ด ๋“ฑ 3๊ฐ€์ง€ ํ•ต์‹ฌ ๊ธฐ๋Šฅ์œผ๋กœ ์‹ค์‹œ๊ฐ„ ์ธ๊ณต์ง€๋Šฅ ํŠธ๋ ˆ์ด๋‹๊ณผ ์‹œ๋ฎฌ๋ ˆ์ด์…˜์„ ํ˜์‹ ์ ์œผ๋กœ ์žฌ์ •์˜

โœ‰๏ธ

๋งค์ผ ๋ฐ›์•„๋ณด์„ธ์š”

AI ๋ฐ์ผ๋ฆฌ ๋‰ด์Šค ยท ๋…ผ๋ฌธ ยท GitHub ํŠธ๋ Œ๋“œ๋ฅผ ๋งค์ผ ํ•œ๊ตญ์–ด๋กœ ์ •๋ฆฌํ•ด ๋ณด๋‚ด๋“œ๋ฆฝ๋‹ˆ๋‹ค.

์ŠคํŒธ ์—†์Œ ยท ์–ธ์ œ๋“  ๊ตฌ๋…์ทจ์†Œ ๊ฐ€๋Šฅ