오늘 업데이트 · 09.24.04:36

오늘 꼭 알아야 할
AI·테크 소식

카카오톡으로 받아보기

오늘의 AI 트렌드는 스스로 판단하고 실행하는 자율형 AI 에이전트의 진화와 이를 뒷받침하는 기술적 안전장치 마련에 집중되었습니다. 연구 분야에서는 에이전트의 전략적 의사결정 능력을 측정하는 새로운 방법론이 주목받았으며, 제품 측면에서는 복잡한 업무를 완수하는 자동화 도구들이 등장했습니다. 또한, 모델 성능 고도화와 더불어 AI의 사회적 책임을 위한 거버넌스 구축 논의가 활발히 이루어졌습니다.

매일 09:00 전체 요약 · 12:00 커뮤니티 반응 · 17:30 논문과 제품/서비스

오늘 올라온 소식

뉴스부터 논문과 새 도구까지 한 번에 이어서 볼 수 있습니다.

논문

The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

LLM 에이전트가 복잡한 장기 과제를 수행할 때, 중간 단계의 의사결정 품질이 최종 성패를 결정하는 핵심 요소가 되고 있습니다. 기존 벤치마크는 최종 성공 여부만 측정할 뿐, 과정 중의 판단력(Taste)을 측정하지 못하는 한계가 있습니다. 이를 해결하기 위해 에이전트의 작업 궤적에서 의사결정 분기점을 자동 추출하여 판단력을 평가하는 'Taste-Bench'를 구축했습니다. 실험 결과, 최신 모델들도 의사결정 분기점에서 높은 정답률을 보이지 못했으며, 결과가 나중에 나타나는 분기점일수록 난이도가 높았습니다. 최종적으로 결과(Outcome)를 알고 있는 교사 모델의 판단을 학생 모델에 증류(Distillation)함으로써, 에이전트의 판단력과 최종 작업 성공률을 모두 향상시킬 수 있음을 입증했습니다.

2026.09.24

The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks

논문

RULER: Instance-aware Rubric Rewards for SVG Generation

자연어 지시를 통한 SVG 생성은 절대적인 시각적 정답이 없어 평가와 정책 최적화가 어렵습니다. 기존의 CLIP이나 미적 점수 같은 스칼라 지표는 벡터 그래픽 특성을 반영하지 못해 보상 해킹(Reward Hacking) 문제를 야기합니다. 본 논문은 다축 루브릭을 활용한 VLM 판사(Judge)가 인간의 판단과 더 높은 상관관계를 가짐을 입증하고, 이를 기반으로 RULER 프레임워크를 제안합니다. RULER는 각 지시사항을 6가지 의미적/시각적/스타일적 항목의 루브릭으로 변환하고, GRPO를 통해 세밀한 보상을 최적화합니다. 실험 결과, RULER는 별도의 정답 쌍 없이도 기존 전문 모델을 능가하며 대규모 모델 수준의 성능을 달성했습니다.

2026.09.24

RULER: Instance-aware Rubric Rewards for SVG Generation

논문

GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

기존의 시각적 생성 모델은 실사 이미지는 잘 만들지만, 3D 장면의 일관성을 유지하는 데 어려움을 겪습니다. 이는 생성 모델이 외형 중심의 잠재 공간을 사용하는 반면, 인지 모델은 기하학적 구조를 포함하는 공간을 사용하기 때문입니다. 본 논문은 기하학적 기초 모델의 특징을 생성용 잠재 공간으로 재매개변수화하는 GAE(Geometry-Native Autoencoder)를 제안합니다. GAE의 잠재 공간은 외형, 깊이, 카메라, 포인트 맵을 동시에 디코딩할 수 있는 구조를 가집니다. 실험 결과, 기존 방식 대비 시각적 품질(FVD)과 카메라 궤적 오차를 크게 개선하며 3D 일관성을 확보했습니다. 결과적으로 기하학적 잠재 공간이 인지와 생성 사이의 공통 인터페이스가 될 수 있음을 입증했습니다.

2026.09.24

GAE: Learning a Geometry-Native Latent Space for 3D-Consistent World Generation

논문

All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts

기존의 다국어 텍스트 인식 방식은 언어별로 모델을 따로 배포하여 비용이 높거나, 거대 시각-언어 모델(VLM)을 사용하여 비용 대비 정확도가 떨어지는 문제가 있었습니다. 본 논문에서는 이를 해결하기 위해 대규모 합성 데이터셋인 TextMuSS-10M을 구축하여 데이터 부족 문제를 해결했습니다. 또한, 단일 인코더와 스크립트별 전문가를 활용하는 ScriptMoE 아키텍처를 제안했습니다. 이 방식은 이미지 수준의 라우터가 적절한 전문가를 선택하고 공유 전문가가 언어 간 지식을 통합합니다. 실험 결과, 제안 모델은 기존 SOTA 모델과 VLM보다 높은 정확도를 달성하면서도 훨씬 적은 파라미터로 효율적인 성능을 보여주었습니다.

2026.09.24

All-in-One Multilingual Scene Text Recognition with Script-aware Mixture-of-Experts

뉴스 · California State Portal | CA.gov

Governor Newsom announces world-leading experts to deliver on his AI executive order, including advancing creation of a “kill switch” - California State Portal | CA.gov

캘리포니아 주지사 개빈 뉴섬이 AI 안전 규제 강화를 위해 독자적인 감시 체계와 '킬 스위치(Kill Switch)' 개발을 위한 전문가 그룹을 발표했습니다. 이는 프런티어 모델(Frontier Model)의 위험성을 제어하기 위해 기업 내부로 독립적인 검증 기관을 투입하고, 비상시 모델 가동을 즉각 중단할 수 있는 기술적·제도적 장치를 마련하는 것을 골자로 합니다.

2026.09.24