오늘 업데이트 · 10.05.04:58

오늘 꼭 알아야 할
AI·테크 소식

카카오톡으로 받아보기

트럼프 행정부의 AI 거버넌스 구축 움직임과 함께, 복잡한 추론과 전문 업무에 최적화된 Gemini 4 Argon 등 차세대 프론티어 모델들이 주목받았습니다. 기술적으로는 에이전트의 장기 과업 수행을 위한 메모리 관리와 실시간 스트리밍 비디오를 위한 통합 프레임워크 등 에이전트 성능 최적화 연구가 활발히 논의되었습니다. 또한, MCP(Model Context Protocol)를 활용한 자동화 도구와 개발 워크플로우 혁신이 실질적인 생산성 도구로 부상하고 있습니다.

매일 09:00 전체 요약 · 12:00 커뮤니티 반응 · 17:30 논문과 제품/서비스

오늘 올라온 소식

뉴스부터 논문과 새 도구까지 한 번에 이어서 볼 수 있습니다.

논문

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

기존에는 On-policy 학습이 파라미터 업데이트의 희소성을 높이고 일반화 성능을 개선한다고 알려져 왔으나, 기존 연구들은 여러 변수가 혼재되어 있어 Rollout policy의 순수 효과를 분리하기 어려웠습니다. 본 연구는 강력한 교사 모델에서 약한 학생 모델로의 증류(Distillation) 환경에서 Rollout policy, KL 방향, 학습률을 독립적으로 변화시키며 그 영향을 분석했습니다. 실험 결과, Rollout policy 자체보다는 토큰 수준의 KL 방향이 성능과 출력 범위를 결정하며, 학습률이 망각과 업데이트 희소성을 조절하는 핵심 요소임을 발견했습니다. 특히 Forward KL는 Rollout policy 변화에 강건한 반면, Reverse KL은 학생 모델의 생성 데이터(On-policy)에 더 민감하게 반응했습니다. 결론적으로 On-policy 학습의 이점은 목적 함수와 하이퍼파라미터 설정에 따라 달라질 수 있음을 보여줍니다.

2026.10.05

On-Policy or Off-Policy Learning? A Systematic Study of Distillation Dynamics

논문

OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction

스트리밍 비디오 LLM은 미래 작업의 관련성이 결정되기 전에도 증거를 보존해야 하며, 충분한 정보가 모였을 때 적시에 응답해야 하는 과제를 안고 있습니다. 기존 방식은 실시간 인지 성능을 유지하면서 재사용 가능한 사실적 메모리를 형성하는 데 어려움이 있었습니다. 본 논문은 쿼리 독립적인 증거 기록과 작업 응답을 하나의 공유된 능동적 생성 프로세스로 통합한 OneStreamer를 제안합니다. PHCM(Proactive Hierarchical Caption Memory)을 통해 시간 기반의 상세 캡션과 요약을 생성하여 과거 비디오 특징을 다시 읽지 않고도 재사용 가능한 문맥을 제공합니다. 또한 PSTL(Proactive State Transition Learning)을 도입하여 대기 상태의 지배력을 줄이고 상태 변화를 효과적으로 학습합니다. 실험 결과, OneStreamer-1M 데이터셋으로 학습된 4B 모델은 8개 벤치마크에서 최고 성능을 달성하며 실시간 인지와 메모리 유지 사이의 균형을 입증했습니다.

2026.10.05

OneStreamer: Unifying Perception, Memory, and Proactive Response in Streaming Video Interaction

논문

GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis

에이전트 학습을 위해서는 실제 파일과 검증 가능한 결과가 포함된 작업 데이터가 필요하지만, 기존 방식은 현실성이 부족하거나 검증이 어렵다는 문제가 있었습니다. 이를 해결하기 위해 GraphForge는 직업 기반 시드에서 시작하여 실제 파일들로 구성된 워크스페이스와 그 관계를 나타내는 증거 그래프를 구축합니다. 이 그래프를 바탕으로 작업 요구사항과 검증 루브릭을 파일에 직접 연결(anchoring)하여 데이터의 정합성을 확보합니다. 생성된 작업은 초기 실행 테스트와 수정 에이전트를 거쳐 정교하게 다듬어진 후 학습 데이터로 사용됩니다. 실험 결과, GraphForge로 학습된 모델은 OpenHands 및 Claude Code 환경의 주요 벤치마크에서 성능 향상을 입증했습니다.

2026.10.05

GraphForge: Training Working Agents with Graph-Anchored Workspace Synthesis

논문

Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL

멀티 보상 기반 강화학습은 오디오-비디오 생성 모델의 품질, 정렬, 동기화를 개선하는 유망한 방법이지만, 학습 중 변화하는 보상 위치와 가중치 조절이 어렵다는 문제가 있습니다. 기존 방식은 고정된 라우팅과 가중치를 사용하여 진화하는 모델 함수를 추적하지 못합니다. 이를 해결하기 위해 본 논문은 'Adaptive Reward Routing'을 제안하여 업데이트 위치와 보상 조합을 동시에 적응시킵니다. 구체적으로 교차 주의 집중(Cross-attention) 응답을 활용해 업데이트 위치를 동적으로 조정하고, 사전 정의된 가중치를 유지하면서 잔차 보정 방식으로 보상 간 충돌을 해결합니다. 실험 결과, 기존 RL 베이스라인 대비 모달리티 품질, 의미적 일관성, 오디오-비디오 동기화 성능이 모두 향상되었습니다.

2026.10.05

Adaptive Reward Routing: Dynamic Multi-Reward Optimization for Joint Audio-Video Diffusion via Forward-Process RL

뉴스 · cbsnews.com

Trump announces formation of AI "Super Intelligence Force" - cbsnews.com

트럼프 대통령이 미국 내 AI 리더십 확보와 안전 규제 강화를 위해 'Super Intelligence Force(SIF)'를 창설하고, 주요 빅테크 기업들과 'White House Accord on Super Intelligence'를 체결했습니다. 이번 조치는 AI를 넘어선 초지능(Super Intelligence) 시대를 대비하여 정부와 민간이 협력하는 거버넌스 체계를 구축하는 것을 골자로 합니다.

2026.10.04