Hugging Face 기준

논문

오늘 읽을 만한 AI 연구와 실무에서 참고할 점을 함께 정리했습니다.

AI 연구

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

기존의 정형 데이터 모델들은 주로 주어진 컨텍스트에서 타겟 값을 예측하는 데 집중하여 데이터 간의 근본적인 구조를 학습하는 데 한계가 있었습니다. 이를 해결하기 위해 LimiX-2는 새로운 CMN(Contextual Mechanism Networks) 패러다임을 도입했습니다. 이 방식은 타겟 중심의 예측이 아닌, 컨텍스트에 따른 데이터 생성 메커니즘 자체를 모델링하는 p(x, y | D_context)를 목표로 합니다. SCM(구조적 인과 모델) 기반의 합성 데이터를 활용한 CCMM 사전 학습을 통해 다양한 그래프 구조와 함수적 메커니즘을 학습했습니다. 실험 결과, LimiX-2는 기존의 데이터셋 특화 모델 및 정형 데이터 파운데이션 모델들을 상회하는 성능을 보였습니다. 또한, 학습된 어텐션 메커니즘이 인과 관계를 인코딩하여 정확한 인과 스켈레톤 복구 능력까지 갖추었음을 입증했습니다.

2026.09.18

LimiX-2: A Contextual Mechanism Network Towards General Structured-Data Intelligence

AI 연구

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments

과학적 코드 저장소는 방대한 지식을 담고 있지만, 파편화된 툴체인과 도메인 특화 규칙으로 인해 에이전트 학습에 활용하기 어렵다는 문제가 있습니다. 이를 해결하기 위해 연구진은 과학적 코드를 프로그래밍 가능한 환경으로 변환하는 ScienceIDE 인프라를 제안합니다. 이 시스템은 전문가가 정의한 사례와 검증 기준을 바탕으로 저장소를 실행 가능한 환경으로 변환하여 작업 생성, 실행 및 과학적 검증을 지원합니다. 이렇게 구축된 환경을 통해 PhAI-IDE 모델 시리즈를 학습시켰으며, 그 결과 과학적 코드 수정 능력과 일반적인 코딩/추론 성능이 모두 향상되었습니다. 결과적으로 ScienceIDE는 과학적 소프트웨어를 지능 개발을 위한 공유 기질로 만드는 토대를 마련합니다.

2026.09.18

ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments

AI 연구

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

LLM 강화학습에서 PPO는 분산 감소를 위해 크리틱(Critic)을 사용하지만, 실제로는 예측값이 평탄해지는 'Value Flattening' 현상이 발생합니다. 연구진은 이 현상이 상태 공간이 커질수록 심화되며, 크리틱 손실의 암시적 분산 페널티와 중복된 업데이트가 원인임을 밝혀냈습니다. 이를 해결하기 위해 각 응답에서 분리된 소수의 상태에만 가치 손실을 적용하는 SP^3O 알고리즘을 도입했습니다. 실험 결과, 응답당 단 3개의 상태만 감독해도 가치 평탄화를 완화하고 정책 성능을 일관되게 향상시켰습니다. 결과적으로 이 연구는 PPO의 잠재적 실패 모드를 식별하고 간단한 희소 감독 전략의 효용성을 입증했습니다.

2026.09.18

Rethinking Critic Learning in PPO: Understanding and Mitigating Value Flattening

AI 연구

Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

LLM의 신뢰할 수 있는 배포를 위해 정확한 신뢰도 추정은 필수적이지만, 기존 방식은 현재의 추론 과정에만 의존한다는 한계가 있습니다. 본 논문은 현재의 추론을 넘어 모델의 축적된 경험을 활용하는 XConf(eXperiential Confidence)를 제안합니다. XConf는 과거의 작업, 성찰, 결과, 교훈이 담긴 에피소드를 저장하고, 새로운 작업 시 유사한 과거 사례를 검색하여 성공률을 바탕으로 신뢰도를 재산정합니다. 실험 결과, XConf는 다양한 벤치마크에서 기존의 Self-consistency 방식보다 낮은 비용으로 더 높은 성능을 보였습니다. 특히 에이전트 작업에서 신뢰도가 낮은 작업을 제외함으로써 성공률을 크게 향상시켰습니다.

2026.09.18

Confidence Comes from Experience: Experiential Confidence Estimation from Reasoning to Agents

AI 연구

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

기존 코딩 에이전트 평가는 주로 텍sal 텍스트 기반의 이슈나 지시사항에 의존하여 실제 웹 개발 환경의 복잡성을 반영하기 어려웠습니다. 본 논문은 동작하는 소프트웨어에서 기능을 추론하고 이를 불완전한 애플리케이션에 구현하는 능력을 평가하기 위해 ProgramDistill을 제안합니다. 연구진은 애플리케이션을 다양한 입도(granularity)의 기능 단위로 분해하고, 골드 패치를 통해 재현 가능한 동작을 연결하는 'mine-craft-patch' 파이프라인을 구축했습니다. 이를 통해 인간의 개입 없이 26개 앱에서 4,063개의 태스크를 생성했습니다. 실험 결과, 에이전트의 복원 깊이가 깊어질수록 성공률이 하락하는 양상을 보였으며, 이는 에이전트의 성능 진단과 커리큘럼 학습을 위한 확장 가능한 벤치마크로서의 가치를 입증합니다.

2026.09.18

ProgramDistill: From Interactive Web Apps to Verifiable Reference-Guided SWE Tasks

AI 연구

ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

기존의 VLA 모델은 MSE와 같은 점별 재구성 지표를 사용하여 액션 토크나이저를 평가해 왔습니다. 그러나 이러한 방식은 데이터 압축 과정에서 액션 간의 상대적 거리나 물리적 관계가 왜곡되는 문제를 해결하지 못합니다. 본 논문은 물리적 순위 일관성(PRC)이라는 새로운 지표를 제안하여 재구성 후에도 물리적 거리 순위가 유지되는지 측정합니다. 이를 바탕으로 제안된 ActionPiece는 표현 학습과 양자화 과정에서 물리적 관계를 보존하도록 공동 학습을 수행합니다. 실험 결과, ActionPiece는 LIBERO 및 SimplerEnv 등 다양한 벤치마크에서 기존 방식보다 높은 성공률을 달성하며 물리적 관계 보존의 중요성을 입증했습니다.

2026.09.18

ActionPiece: Rethinking Action Tokenization for Autoregressive Vision-Language-Action Models

AI 연구

Agora: Git as Shared Memory for Collective AutoResearch

자율 연구 에이전트(AutoResearch)가 늘어날수록 각 세션이 독립적으로 시작되어 탐색의 중복이 발생하는 문제가 있습니다. 이를 해결하기 위해 연구 과정을 Git 기반의 불변 DAG(Directed Acyclic Graph)로 기록하는 'Agora' 시스템을 제안합니다. 모든 가설과 검증 결과는 커밋으로 저장되어 누구나 재현 가능하며, 시스템은 탐색의 다양성을 유지하도록 설계되었습니다. 13개의 에이전트가 중앙 통제 없이 12일간 협업한 실험 결과, 1,703개의 기여를 통해 복잡한 모델 초기화 문제를 성공적으로 해결했습니다. 이 과정에서 145개의 커밋이 연결된 계보를 형성하며 집단 지성의 효율성을 입증했습니다.

2026.09.18

Agora: Git as Shared Memory for Collective AutoResearch

AI 연구

VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

Diffusion Transformer 기반 비디오 생성 모델은 긴 시공간 시퀀스로 인해 어텐션 연산 비용이 매우 높습니다. 기존의 저정밀도 양자화는 아웃라이어 값으로 인해 정확도가 저하되고, Softmax의 고정밀 지수 연산이 하드웨어 가속의 병목이 되는 문제가 있었습니다. 이를 해결하기 위해 제안된 VC-Attention은 클러스터링 기반의 Value Smoothing(V-Smooth)과 Softmax 연산을 직접 매핑하는 ExpCast-FP8 기법을 결합합니다. V-Smooth는 값들을 재정렬하여 양자화 효율을 높이고, ExpCast-FP8은 FP32 지수 연산 없이 확률 코드로 직접 변환하여 속도를 높입니다. 실험 결과, 최신 GPU 환경에서 기존 BF16 대비 최대 3.6배의 속도 향상과 향상된 생성 품질을 달성했습니다.

2026.09.18

VC-Attention: Value Smoothing and Softmax Casting for Low-bit Attention

AI 연구

EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

기존 LLM 트레이딩 에이전트는 배포 전 작성된 정적인 도구 사용 정책에 의존하여 시장 변화에 유연하게 대응하기 어렵다는 문제가 있습니다. 이를 해결하기 위해 본 논문은 시스템 프롬프트를 텍스트 매개변수화된 정책으로 취급하는 EvolveTrade 프레임워크를 제안합니다. EvolveTrade는 백본 LLM은 고정한 채, Policy Agent가 누적된 의사결정 흔적과 포트폴리오 피드백을 분석하여 프롬프트를 주기적으로 수정합니다. 실험 결과, 다양한 시장 환경에서 고정 정책 기반의 베이스라인보다 샤프 지수(Sharpe Ratio)와 누적 수익률(Cumulative Return)이 향상됨을 확인했습니다. 또한, 진화된 정책이 코드 기반 분석을 활성화하고 시장 상황에 적합한 계산을 수행함을 입증했습니다.

2026.09.18

EvolveTrade: Experience-Driven Policy Refinement for Self-Evolving LLM Trading Agents

AI 연구

Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

기존의 생성형 월드 모델은 실시간 상호작용과 일관된 이벤트 제어를 동시에 달성하는 데 어려움이 있었습니다. 본 논문은 사용자가 탐험과 이벤트 발생을 동시에 제어할 수 있는 5B 규모의 자기회귀 월드 모델인 Zing-0.5를 제안합니다. 핵심 방법론으로 키보드 입력과 텍스트 지시를 통합한 조건부 학습, 세그먼트 단위 교사를 활용한 증류 기반의 점진적 생성 방식, 그리고 저비용 실시간 추론 기술을 결합했습니다. 실험 결과, WBench 내비게이션 작업에서 높은 일관성을 보였으며 생성 재시작 없이 텍스트로 이벤트를 변경하는 데 성공했습니다. 최종적으로 모델 가중치와 추론 코드를 공개하여 실시간 플레이 가능한 생성형 월드의 발전을 도모합니다.

2026.09.18

Zing-0.5: Toward Playable Worlds with Real-Time Joint Action and Text Control

AI 연구

HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses

과학적 가설 발견을 위해 에이전트 간의 협업 방식이 가설의 품질에 미치는 영향은 여전히 미지의 영역입니다. 기존 시스템은 에이전트의 역량과 협업 효과를 분리하여 검증하기 어려웠습니다. 본 논문은 유전 알고리즘을 도입하여 가설 집단을 세대별로 업데이트하는 HypoEvolve 프레임워크를 제안합니다. 이 방식은 전문화된 LLM 에이전트들이 가설을 수정, 결합, 유지하는 과정을 명시적으로 제어하여 협업 효과를 테스트 가능하게 만듭니다. 약물 재창출(Drug repurposing) 과제를 통해 검증한 결과, HypoEvolve는 기존 베이스라인 대비 높은 성능을 기록하며 가설의 질을 높였습니다.

2026.09.18

HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses

AI 연구

SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization

최근 긴 컨텍스트 모델링을 위해 소프트맥스 어텐션을 대체하는 선형 어텐션 레이어가 주목받고 있습니다. 그러나 기존의 컨텍스트 확장 방식은 레이어 구조를 수정하지 않고 사전 학습만 진행하여, 선형 어텐리 상태 역학의 스펙트럼 특성을 간과하는 문제가 있었습니다. 본 논문은 Gated DeltaNet(GDN)의 전이 행렬 관점에서 장거리 정보 검색을 결정하는 두 가지 핵심 요인(느린 스펙트럼 대역 확보 및 빠른 감쇠 모드 유지)을 식별했습니다. 이를 바탕으로 제안된 SpectralShift는 알파 프로젝션 초기화와 학습률 스케일링을 통해 스펙트럼을 재구성하는 재매개변수화 기법입니다. 실험 결과, SpectralShift는 효율적인 방식으로 GDN의 장거리 컨텍스트 능력을 일관되게 향상시켰습니다.

2026.09.18

SpectralShift: Effective Context Window Extension of Gated DeltaNet via Spectral Reparameterization

AI 연구

A Zeroth-Order Paradigm for LLM Preference Alignment

LLM의 선호도 정렬을 위해 직접 선호도 최적화(DPO 등) 방식이 널리 쓰이지만, 확률 차이가 작은 데이터에서 발생하는 likelihood displacement 문제가 발생합니다. 본 논문은 비교 오라클을 기반으로 방향성 정보를 추출하는 ComPO(Comparison-based Preference Optimization)를 제안합니다. ComPO는 미분 가능한 손실 함수를 직접 최적화하는 대신 비교 결과로부터 정보를 추출하는 제로차 방식을 취합니다. 오프라인 및 온라인 스킴에 대한 수렴성 및 성능 보장을 이론적으로 입증하였으며, 실험을 통해 기존 방식보다 우수한 성능을 확인했습니다. 특히 모델의 길이 편향을 제어하면서도 높은 승률을 달성하는 데 성공했습니다.

2026.09.18

A Zeroth-Order Paradigm for LLM Preference Alignment

AI 연구

Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX

비대칭 정보를 가진 협업 작업에서 참여자들은 상호작용을 통해 서로의 이해도를 조정합니다. 본 연구는 시선 데이터가 이러한 상호 이해(Groundization)의 증거가 될 수 있는지 두 가지 태스크(MapTask, MUNDEX)를 통해 검증합니다. 연구진은 두 코퍼스를 공통된 어휘로 매핑하고 대화 단위별 시선 특징을 추출했습니다. 분석 결과, 참조 해석이 일치하거나 이해가 확인된 시점에서는 과업 지향적 시선이 증가하고 파트너 지향적 시선은 감소하며, 시선 엔트로피와 전환 빈도가 낮아지는 경향을 보였습니다. 이러한 효과는 과업을 주도하는 참여자에게서 가장 뚜렷하게 나타났습니다. 결론적으로 시선은 과업 및 대화 맥락과 함께 상호 이해를 판단하는 중요한 보조 지표로 활용될 수 있습니다.

2026.09.18

Gaze as Evidence for Common Grounding: A Cross-Corpus Analysis of MapTask and MUNDEX

AI 연구

EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset

기존 카메라 기반 3D 손 재구성은 저조도나 움직임이 심한 환경에서 성능이 저하되는 한계가 있습니다. 이벤트 카메라는 높은 동적 범위와 시간 해상도를 제공하지만, 1인칭 시점에서는 배경 노이즈로 인해 손 신호가 가려지는 문제가 발생합니다. 기존 방식은 좌우 손을 구분하지 못해 인스턴스별 정보가 부족하고 상호작용 예측이 부정확했습니다. 본 논문에서는 인스턴스 수준의 바운딩 박스와 마스크를 추정하는 Hand Detector와 손 간의 관계를 학습하는 Adaptive Attention을 결합한 EventEgoHands++를 제안합니다. 또한, 대규모 실세계 데이터셋인 EEH-R을 구축하여 성능을 검증했습니다. 실험 결과, 제안 방법은 합성 및 실세계 데이터셋 모두에서 기존 모델을 상회하는 성능을 보였습니다.

2026.09.18

EventEgoHands++: Event-based Egocentric 3D Hand Mesh Reconstruction with Real Dataset

AI 연구

In-Context Robot Learning with VLM Agents

로봇이 낯선 환경에 적응하기 위해서는 미지의 상황에서도 학습할 수 있는 In-Context Learning(ICL) 능력이 필수적입니다. 그러나 기존 로봇 정책은 데모나 피드백을 즉각적인 동작으로 변환하는 데 한계가 있었습니다. 본 논문은 VLM의 에이전트 역량을 활용한 일반화 프레임워크인 GPT-Policy를 제안합니다. 이 시스템은 작업 관련 시각적 변화를 보존하는 컨텍스트 컴파일러, 동작을 제안하는 VLM, 그리고 동작을 검증 및 실행하는 제어기를 통합합니다. 실험 결과, 인간의 비디오 데모만으로도 작업 성공률이 향상되었으며, 이는 파라미터 수정 없이도 로봇이 새로운 작업을 수행할 수 있는 가능성을 보여주었습니다.

2026.09.18

In-Context Robot Learning with VLM Agents

AI 연구

Flattening Every Memory Peak in Long-Context Mixture-of-Experts Training

MoE 모델을 긴 컨텍스트나 큰 배치 사이즈로 학습할 때, 평균 메모리 사용량이 아닌 특정 시점의 피크 메모리 초과로 인해 학습이 실패하는 문제가 발생합니다. 연구진은 전문가 분산(Expert Dispatch), 어휘 투영(Vocabulary Projection), 그래디언트 체크포인트, 옵티마이저 상태라는 네 가지 주요 메모리 병목을 식별했습니다. 이를 해결하기 위해 PipelinedLLEP, Ring-DTP, SCO, OffloadStreamAdamW라는 네 가지 스케줄링 기법을 제안하여 GPU 워킹 셋을 고정했습니다. 이 방법들은 계산 순서와 데이터 이동의 입도(granularity)만 변경하므로 손실 함수와 그래디언트의 정확도를 유지합니다. 실험 결과, 120B~667B 규모의 MoE 모델에서 기존 FSDP2 대비 최대 1M 컨텍스트 길이를 지원하며 훨씬 높은 처리량을 달성했습니다.

2026.09.18

Flattening Every Memory Peak in Long-Context Mixture-of-Experts Training

AI 연구

The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction

소비자용 하드웨어에서 35B급 MoE 모델을 구동할 때, 모델 크기로 인한 메모리 부족과 연산량 대비 높은 데이터 전송량(Memory Wall)이 병목 현상을 일으킵니다. 기존의 SSD 오프로딩 방식은 다음 레이어의 전문가(Expert)를 미리 알 수 없어 연산과 데이터 로딩을 중첩시키기 어렵다는 문제가 있습니다. 이를 해결하기 위해 Edge0는 다음 레이어의 라우팅을 미리 예측하는 '프리라우터(prerouter)' 기술을 도입하여 데이터 로딩과 연산을 동시에 수행합니다. 또한, 양자화 및 예측 오차로 인한 품질 저하를 방식을 보완하기 위해 학습된 LoRA 어댑터를 사용합니다. 그 결과, 24GB 메모리 환경에서 35B MoE 모델을 20tok/s의 속도로 구동하며 높은 성능을 유지합니다.

2026.09.18

The Other Half of the Memory Wall: Serving 35B MoEs from SSD with Trained Routing Prediction

AI 연구

CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents

기존의 Mixture-of-Agents(MoA) 방식은 쿼리 라우팅과 에이전트 미세 조정이 분리되어 있어, 에이전트의 능력이 변할 때 라우팅 전략이 이를 따라가지 못하는 문제가 있었습니다. 이를 해결하기 위해 에이전트 정책과 동적 라우터가 서로 상호작용하며 발전하는 CERA-MoA 프레임워크를 제안합니다. 중간 레이어의 은닉 상태를 활용한 '예측 친숙도 추정기'를 통해 전체 추론 과정 없이도 에이전트의 역량을 평가합니다. 또한 누적 임계값 기반의 적응형 라우팅을 통해 최소한의 에이전트만 활성화하여 효율성을 확보합니다. 실험 결과, CERA-MoA는 기존의 정적 라우팅 및 고정 워크플로우 방식보다 뛰어난 성능과 효율성을 입증했습니다.

2026.09.18

CERA-MoA: Co-Evolving Routing Mechanisms with Continually Learning LLM Agents

AI 연구

Assessing nnU-Net Generalization across Brain Tumor Populations in BraTS-GoAT 2026

BraTS-GoAT 챌린지는 이질적인 환자군 사이의 종양 분할 일반화 성능을 평가합니다. 연구진은 1,351개의 라벨링된 케이스를 사용하여 3D nnU-Net을 학습시켰습니다. 검증 결과, ET, TC, WT 영역에서 각각 0.7805, 0.8288, 0.8854의 DSC를 기록했습니다. 학습 데이터와 다른 분포의 검증 데이터 적용 시 성능 저하가 관찰되었습니다. 분석 결과, 작은 ET(Enhancing Tumor) 볼륨과 분절된 종양 형태가 낮은 Dice 점수의 주요 원인으로 나타났습니다.

2026.09.18

Assessing nnU-Net Generalization across Brain Tumor Populations in BraTS-GoAT 2026

AI 연구

Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand

기존 로봇은 이동과 조작을 위한 메커니즘이 분리되어 있어 부피와 복잡성 문제가 존재합니다. 본 연구는 손가락을 다리처럼 사용하여 이동과 상호작용을 동시에 수행하는 인간형 손 로봇을 제안합니다. 하드웨어 측정값을 기반으로 캘리브레이션된 시뮬레이션 환경에서 강화학습을 통해 비대칭적인 손가락 구조를 고려한 정책을 학습시켰습니다. 실험 결과, 제안된 보상 체계는 기존 4족 보행용 보상보다 빠른 이동을 가능하게 했습니다. 하드웨어 실증을 통해 자립형 크롤링, 조향, 낙하 회복 및 물체 조작 능력을 입증했습니다. 이를 통해 별도의 이동 장치 없이도 이동과 조작이 가능한 컴팩트한 모바일 매니퓰레이터의 가능성을 보여주었습니다.

2026.09.18

Fingers as Legs: Learning Self-Supported Locomotion and Manipulation with an Anthropomorphic Hand

AI 연구

Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches

에이전트 세션이 길어지고 다수의 세션이 동시에 실행되면, 호스트 메모리에 저장된 KV 캐시를 스캔하는 과정이 디코딩 성능의 병목이 됩니다. 기존 방식은 모든 키를 전체 비트로 읽어야 하므로 데이터 전송량이 과도하게 발생합니다. Fathom은 각 쿼리가 채널별 중요도에 따라 읽을 비트 수를 결정하는 가변적 스캔 방식을 제안합니다. 4비트 K 캐시를 비트 평면(bit planes) 형태로 저장하여, 쿼리가 필요한 만큼의 상위 비트만 읽어 연산량을 조절합니다. 실험 결과, 기존 Sparse Decoding 방식보다 훨씬 적은 데이터 전송량으로도 높은 정확도와 빠른 디코딩 속도를 달성했습니다.

2026.09.18

Fathom: Per-Query Read Depth for Sparse Decoding over Offloaded KV Caches