PyoSignal Logo
PyoSignal

Hugging Face 기준

오늘의 논문

오늘 읽을 만한 AI 연구를 실무 관점까지 함께 정리했습니다.

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

AI Research

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

최근 수학이나 코딩처럼 정답이 명확한 영역에서는 RLVR이 효과적이지만, 주관적인 판단이 필요한 오픈 엔드 작업에서는 보상 모델의 편향과 비용 문제가 발생합니다. 이를 해결하기 위해 본 논문은 자기주도 학습 원리를 활용하여 오픈 엔드 태스크를 검증 가능한 프록시 환경으로 변형하는 RLSVR 방식을 제안합니다. 구체적인 사례로 'SpyRL'이라는 멀티 에이전트 게임 환경을 구축하여, 투표 결과와 같은 명확한 규칙을 통해 보상을 생성하도록 설계했습니다. 실험 결과, 제안된 방식은 요약, 창의적 글쓰기 등 비검증 태스크에서 기존 방식을 앞질렀으며 수학적 추론에서도 성능 향상을 보였습니다. 결과적으로 태스크 변환을 통해 RLVR의 확장성을 주관적 영역까지 넓힐 수 있음을 입증했습니다.

#Reinforcement Learning#LLM Self-Improvement
더 보기
Mental World Modeling

AI Research

Mental World Modeling

기존의 월드 모델은 물리적 물리 법칙과 상태 변화에만 집중하여 인간의 복잡한 의사결정을 예측하는 데 한계가 있었습니다. 본 논문은 에이전트의 심리적 상태를 모델의 핵심 구성 요소로 포함하는 'Mental World Modeling(MWM)' 프레임워크를 제안합니다. MWM은 물리적 상태와 정신적 상태가 결합된 상태를 유지하며, 특정 목표에 따른 부분 관측과 행동에 따른 상태 업데이트를 시뮬레이션합니다. 이를 검증하기 위해 훈련이 필요 없는 inspectable한 베이스라인인 MENTIS를 구현했습니다. 실험 결과, 최신 LLM 기반 월드 모델들이 인간의 결정을 예측할 때 명시적인 정신 상태 모델링이 필수적임을 입증했습니다.

#Agent#World Models
더 보기
N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

AI Research

N_0-VTLA: Scaling Vision-Tactile-Language-Action Model with Latent Tactile Tokens

기존의 시각 중심 로봇 모델은 정밀한 접촉이 필요한 조작 작업에서 한계를 보였습니다. 이를 해결하기 위해 시각, 촉각, 언어, 행동을 통합한 N_0-VTLA 모델을 제안합니다. 대규모 촉각 데이터셋인 NeoData를 활용한 사전 학습과, 학습된 접촉 패턴을 미세 동작으로 전이하는 예측적 촉각 경로(predictive tactile pathway)를 도입했습니다. 또한, 고정된 배포 데이터에서 이득(advantage)을 계산하여 정책을 개선하는 ALTER 알고리즘을 적용했습니다. 실험 결과, 실로봇 환경의 다양한 작업에서 기존 베이스라인을 크게 앞서며 정밀 조작 능력을 입증했습니다.

#Robot-Control#Multimodal
더 보기
Meshy T2: Fast Native Mesh Generation with Flow Matching

AI Research

Meshy T2: Fast Native Mesh Generation with Flow Matching

기존의 자기회귀(Autoregressive) 방식은 메시 생성 속도가 느리고 오류 누적 문제로 인해 실시간 작업에 부적합했습니다. 본 논문은 Flow Matching 기술을 활용한 Meshy T2 프레임워크를 제안합니다. 핵심은 정점(Vertex)별로 연속적인 잠재 토큰을 인코딩하는 VAE와, 거친 형태에서 세부 형태로 발전하는 2단계 Flow-matching 캐스케이드 구조입니다. 이를 통해 정점 양자화 없이도 고정밀 기하 구조와 아티스트 스타일의 토폴로지를 유지하며 생성할 수 있습니다. 결과적으로 기존 방식보다 10배 이상 빠른 6초 내외의 속도로 최첨단 수준의 이미지-투-메시 생성을 달성했습니다.

#3D Generation#Flow Matching
더 보기
AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

AI Research

AISPA: User-Centric System Prompt Auditing for Large Language Model Applications

상용 AI 제품의 시스템 프롬프트는 모델 동작을 제어하지만, 공개되지 않아 신뢰와 책임성 문제가 발생하고 있습니다. 본 논문은 사용자 관점에서 시스템 프롬프트를 체계적으로 검토하는 AISPA 프레임워크를 제안합니다. 연구진은 88개 상용 AI 제품의 3,249개 지침을 8가지 차원에서 분석했습니다. 분석 결과, 제품 간 설계 편차가 매우 크며 보호적 지침이 증가하는 추세임에도 불구하고 사용자 이익에 반하는 문제가 여전히 공존함을 확인했습니다. 결과적으로 시스템 프롬프트의 투명성, 표준화 및 독립적 감사의 필요성을 강조합니다.

#LLM#Prompt Engineering
더 보기
N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

AI Research

N_0-TWAM: Scaling Tactile-Native World-Action Model for Contact-Rich Manipulation

기존의 로봇 조작 모델은 복잡한 접촉이 발생하는 환경에서 정밀한 제어와 장기적인 작업 수행에 어려움을 겪었습니다. 본 논문은 시각과 촉각을 동시에 예측하는 대규모 촉각 네이티브 월드-액션 모델인 N_0-TWAM을 제안합니다. 6종의 로봇과 450개 태스크를 포함한 대규모 데이터셋을 활용하여 시각-촉각 공동 학습을 수행하였으며, 물리적 근거를 가진 NeoForce 표현법을 도입했습니다. 또한, 작업 단계 구분을 위한 촉각 이벤트 개념과 실시간 효율성을 위한 비대칭 Mixture-of-Transformers 구조를 적용했습니다. 실험 결과, N_0-TWAM은 다양한 접촉 중심 작업에서 뛰어난 성능을 보이며 데이터 스케일링의 이점을 입증했습니다.

#Robotics#Tactile-Sensing
더 보기
Scaling Properties of Text Conditioning in Visual Generation

AI Research

Scaling Properties of Text Conditioning in Visual Generation

기존의 텍스트 조건부 시각 생성 모델에서는 확산 손실(diffusion loss)이 프롬프트 토큰 수와 비례하지 않아 스케일링 법칙을 측정하기 어려웠습니다. 본 연구는 프롬프트 내 '구조적 언어(structured language)'가 확산 손실과 밀접한 관계가 있음을 발견했습니다. 이를 정량화하기 위해 화이트박스 방식(GPG)과 블랙박스 방식(ED)의 지표를 도입하여 스케일링 법칙을 입증했습니다. 이러한 법칙을 바탕으로 이미지의 의미적/기하학적 주석을 포함한 구조적 프롬프트를 구성하여 생성 능력을 개선했습니다. 또한, 정교한 프롬프터 학습을 통해 오픈 웨이트 모델임에도 불구하고 최상위 폐쇄형 모델에 필적하는 성능을 달성했습니다.

#Diffusion#Prompt Engineering
더 보기
SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

AI Research

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

RLVR은 응답 단위의 보상을 제공하고, OPD는 토큰 단위의 밀집된 보상을 제공하여 서로 보완적인 관계에 있습니다. 그러나 두 방식을 고정 계수로 결합할 경우, 어드밴티지 크기 차이와 시간적 불일치로 인해 엔트로피 붕괴(Exploration 저하)가 발생하는 문제가 있습니다. 이를 해결하기 위해 제안된 SAF 프레임워크는 OPD 어드밴티지에 대해 '희소화 후 압축(Sparsify-then-compress)'과 '웜업 후 어닐링(Warm-up-then-anneal)'이라는 4단계 파이프라인을 적용합니다. 실험 결과, SAF는 기존 GRPO+OPD 방식보다 안정적인 학습을 유지하며 수학 및 코드 생성 벤치마크에서 성능 향상을 달성했습니다.

#Reinforcement Learning#Knowledge Distillation
더 보기
QQWorld: Quantile-Quantile Matching for World Model Regularization

AI Research

QQWorld: Quantile-Quantile Matching for World Model Regularization

잠재 월드 모델은 효율적인 계획을 위해 미래 상태를 압축된 공간에서 예측하지만, 학습된 잠재 분포의 품질에 성능이 좌우됩니다. 기존의 Epps-Pulley(EP) 방식은 고립된 꼬리 샘플에 대해 교정 그래디언트가 빠르게 소실되어 헤비 테일(heavy-tailed) 편차를 제어하지 못하는 문제가 있습니다. 이를 해결하기 위해 제안된 QQWorld는 투영된 잠젤 샘플을 순위가 매칭된 가우시안 분위수(quantile)에 직접 정렬하는 QQ 매칭 목적 함수를 사용합니다. 또한 이전 배치의 샘플을 활용하는 cross-batch QQ를 통해 랭킹 풀을 확장하고 편향-분산 트레이드오프를 최적화했습니다. 실험 결과, QQWorld는 기존 LeWM의 계획 성공률을 높이면서도 더 얇은 잠재 꼬리 분포를 형성하는 데 성공했습니다.

#World Model#Reinforcement Learning
더 보기
Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

AI Research

Fewer Clarifications, Better Code: Benchmarking Cross-Session Personalized Ambiguity Adaptation in Coding Assistants

AI 코딩 어시스턴트는 사용자의 모호한 의도를 코드로 변환하지만, 기존 방식은 세션별로 개별적인 질문을 던지는 데 그쳐 반복되는 개인적 모호성을 해결하지 못합니다. 본 논문은 과거 세션의 해결 기록을 메모리로 활용하여 새로운 세션의 모호성을 해결하는 '개인화된 모호성 적응(Personalized Ambiguity Adaptation)' 과제를 제안합니다. 이를 위해 6가지 메커니즘을 포함한 벤치마크 데이터셋인 CAPA를 구축하여 12종의 최신 LLM을 평가했습니다. 실험 결과, 과거 이력을 활용하는 것이 코드 실행 성공률과 질문 횟수를 줄이는 데 효과적임을 확인했습니다. 최종적으로는 효율적인 추론을 위한 '동일 사용자 이력 게이팅(same-user history gating)' 기법을 제안합니다.

#LLM#Personalization
더 보기
Enhancing Rubric-based RL via Self-Distillation

AI Research

Enhancing Rubric-based RL via Self-Distillation

최근 LLM의 오픈 엔드 작업 성능 향상을 위해 루브릭 기반 RL이 주목받고 있으나, 미충족 기준(UC)에 대한 탐색 부족과 보상 집계 과정에서 유효한 신호가 사라지는 억제된 기준(SC) 문제가 존재합니다. 기존 방식은 외부 가이드를 사용하여 학습-추론 간 불일치를 유발하거나, 특정 기준이 충족되었음에도 스칼라 보상에 의해 학습 신호가 소실되는 문제를 해결하지 못했습니다. 이를 해결하기 위해 제안된 CriPO는 온폴리시 자기 증류(Self-distillation) 방식을 사용합니다. UC 문제를 위해 크리테리온 주입 교사 모델을 구축하고 국소적 KL 손실을 적용하며, SC 문제를 위해 반사실적 교사 모델로 토큰 단위 이득을 조정합니다. 실험 결과, CriPO는 기존 방식보다 훨씬 적은 최적화 단계만으로도 더 높은 성능을 달성했습니다.

#LLM#Reinforcement Learning
더 보기
ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

AI Research

ExtractBench: A Benchmark for Schema-Guided Enterprise Document Extraction

기업 워크플로우에서 스키마 기반 문서 추출 에이전트의 중요성이 커지고 있으나, 이를 종합적으로 평가할 기준이 부족했습니다. 본 논문은 값의 정확도, 레코드 완전성, 근거 제시 능력, 비용을 동시에 측정하는 ExtractBench를 제안합니다. 370개의 기업 문서와 4,869개 페이지를 포함한 대규모 데이터셋을 구축하여 다양한 비즈니스 도메인을 반영했습니다. 실험 결과, 상용 VLM은 긴 문서에서 데이터 누락 문제가 발생했으나, LlamaExtract Agentic Plus는 높은 정확도와 비용 효율성을 동시에 달며 우수한 성능을 보였습니다. 이 벤치마크는 스키마 기반 추출 에이전트의 성능을 검증하는 표준을 제공합니다.

#Agent#Document-Extraction
더 보기
Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

AI Research

Evaluation-Verification Reward for Consistent Multi-Reference Image Editing

최근 이미지 편집 모델의 발전에도 불구하고, 여러 참조 이미지를 유지하며 시각적 일관성을 확보하는 다중 참조 편집은 여전히 어려운 과제입니다. 기존의 MLLM 기반 평가 방식은 환각 현상과 논리적 추론 능력 사이의 불균형으로 인해 신뢰할 수 있는 보상 신호를 생성하기 어려웠습니다. 본 논문은 평가(Evaluation)와 검증(Verification)을 분리한 EVR(Evaluation-Verification Reward) 프레임워크를 제안합니다. EVR은 MLLM이 가설을 생성하면 Verifier가 시각적 근거를 바탕 이를 검증하여 정교한 보상 신호를 생성합니다. 이 방식을 통해 기존 모델의 구조 변경 없이 RL 미세 조정을 수행할 수 있는 확장 가능한 데이터 파이프라인을 구축했습니다. 실험 결과, 제안 방법은 기존 Qwen-Image-Edit 대비 일관성과 조화 측면에서 성능을 크게 향상시켰습니다.

#Image Editing#Reinforcement Learning
더 보기
ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

AI Research

ODEWorld: A Continuous Predictive Architecture via Physical-Time Flow

기존의 월드 모델링 방식은 이산적 시간 단위의 예측에 국한되어 물리 세계의 연속적인 역학을 포착하는 데 한계가 있었습니다. 이를 해결하기 위해 물리적 시간 내용을 따르는 연속적인 잠재 속도장을 학습하는 PT-Flow 방식을 제안합니다. 제안된 ODEWorld는 ODE 솔버를 통해 압축된 잠재 공간 내에서 미래를 예측하며, 표현 공간과 속도장에 ODE 속성을 부여하여 표현 붕괴 문제를 해결합니다. 그 결과, 장기 예측 후에도 고품질 이미지 재구성이 가능하며 임의의 시간 해상도 및 역방향 예측이 가능해졌습니다. 실험을 통해 ODEWorld가 비디오 생성과 로봇 제어 모두에서 뛰어난 성능을 보임을 입증했습니다.

#World Model#ODE
더 보기
EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

AI Research

EMBL AI Librarian: Life-Sciences Knowledge Layer for AI Agents

최근 AI 에이전트의 웹 접근이 증가하고 있으나, 기존 생명과학 문헌 데이터베이스는 키워드 중심의 복잡한 구문과 전체 논문 반환 방식으로 인해 에이전트가 활용하기에 비효율적입니다. 이를 해결하기 위해 연구진은 EMBL AI Librarian을 제안합니다. 이 시스템은 단일 LLM이 자연어 질의를 계획하고, Europe PMC 엔진을 통해 하위 쿼리를 실행하며, 관련 논문에서 핵심 증거를 직접 추출하는 오케스트레이션 과정을 수행합니다. 실험 결과, 문헌 합성 및 클레임 검증 등 다양한 벤치마크에서 기존 베이스라인 대비 성능 향상을 입증했습니다. 특히 ScholarQABench와 LitQA2 등에서 높은 성능을 보이며 생명과학 에이전트의 성능을 크게 개선했습니다.

#AI Agent#RAG
더 보기
RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

AI Research

RL^2-VLA: Adaptive RL Latent Compositional Steering with Test-Time Scaling for Vision-Language-Action Models

최근 VLA 모델은 뛰어난 성능을 보이지만, 학습 데이터 범위를 벗어난 환경에서는 성능이 급격히 저하되는 문제가 있습니다. 기존의 테스트 타임 스티어링 방식은 행동 샘플이 특정 모드에 집중되어 실패 모드를 답습하거나, 성공 가능성이 높은 상황에서도 불필요한 개입을 하는 한계가 있었습니다. 이를 해결하기 위해 본 논문은 VLA의 잠재 공간(Latent)에서 오프라인 RL을 수행하는 RL^2 프레임워크를 제안합니다. RL^2는 VLA의 행동 우선순위와 RL의 다양성을 결합한 구성적 제어 전략을 사용하며, 실패가 예측될 때만 개입하여 정확도를 유지합니다. 실험 결과, SIMPLER 및 PolaRiS 벤치마크에서 OOD 환경 성능을 크게 향상시켰으며 실세계 로봇 실험에서도 성공적으로 전이됨을 입증했습니다.

#VLA#Reinforcement Learning
더 보기
One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA

AI Research

One Future, Every Robot: Label-Efficient Collective-State Prediction with Decentralized JEPA

로봇 스웜 환경에서 각 로봇이 국소적 관측과 제한된 대역폭만으로 어떻게 동일한 미래 상태를 예측할 수 있는지에 대한 문제를 다룹니다. 이를 해결하기 위해 모든 로봇이 공통된 미래 토큰 필드를 생성하는 순환형 공동 임베딩 예측 아키텍처인 CS-JEPA를 도입합니다. 학습 시에는 전역 레이블 없이 사전 학습을 진행하며, 배포 시에는 매우 적은 양의 메시지와 국소적 이력만을 사용합니다. 실험 결과, CS-JEPA는 기존 재구성 방식보다 적은 파라미터로도 높은 예측 정확도와 로봇 간 일치도를 보여주었습니다. 또한, 계획 수립(Planning) 작업에서도 기존 방식 대비 MSE를 크게 낮추고 상관계수를 높이는 등 우수한 성능을 입증했습니다.

#Multi-Agent#Swarm Robotics
더 보기
Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

AI Research

Toward Robust and 3D-Aware RGB-NIR Imaging in the Dark

저조도 환경에서의 강건한 이미지 복원은 여전히 어려운 과제입니다. 기존의 RGB-NIR 융합 방식은 정제된 학습 데이터 쌍에 의존하여 다양한 시나리오에서의 범용성이 부족했습니다. 본 논문은 3D 인지 신경 모델링을 도입하여 새로운 관점의 RGB-NIR 저조도 이미징을 제안합니다. 깨끗한 RGB 데이터에 대한 직접적인 지도 학습 없이도, 3D 공간에서 노이즈가 심한 RGB와 NIR 단서를 암시적으로 융합하여 깨끗한 이미지를 복원합니다. 제안된 모델은 깨끗한 RGB 데이터 수집의 필요성을 제거하며 다양한 노이즈 수준에서도 일반화 성능을 보여줍니다. 합성 및 실제 데이터에 대한 광범위한 평가를 통해 우수한 성능을 입증했습니다.

#Computer Vision#Low-light Imaging
더 보기
SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift

AI Research

SULAND v2: A Refined RGB Dataset and Deep Learning Object Detection Benchmark for UAV/UGV-Based SUrface LANDmine Detection Under Domain Shift

UAV/UGV를 활용한 지뢰 탐지에서 RGB 이미지는 저비용 솔루션이지만, 데이터 부족과 도메인 변화에 따른 일반화 성능 검증이 부족한 실정입니다. 기존 SULAND 데이터셋은 주석 오류, 위치 불일치, OOD(Out-of-Distribution) 클래스 ID 역전 등의 심각한 결함을 포함하고 있었습니다. 본 연구는 기존 이미지와 분할 방식을 유지하면서 주석을 수동으로 정제한 SULAND_v2를 제안합니다. 35개 탐지기 구성을 벤치마킹한 결과, 정제된 데이터는 YOLOv8의 IID 성능을 크게 향상시켰으며 클래스 ID 수정은 OOD 성능을 대폭 개선했습니다. 최종적으로 높은 IID 성능이 반드시 실전 운영 준비도를 보장하지 않음을 입증하며 신뢰할 수 있는 벤치마크를 제공합니다.

#Object Detection#Domain Shift
더 보기
Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm

AI Research

Beyond Feeling Better: Capability-Sustaining Emotional Dialogue as a Longitudinal Research Paradigm

기존의 감정 대화 연구는 공감이나 즉각적인 정서적 지원에만 집중하는 경향이 있었습니다. 그러나 이러한 단기적 목표는 사용자의 장기적인 감정 조절 및 자립 능력을 저해할 위험이 있습니다. 본 논문은 사용자의 역량 유지를 목표로 하는 '역량 유지형 감정 대화(CSED)'라는 새로운 종단적 연구 패러다임을 제안합니다. 문헌 및 코퍼스 분석 결과, 기존 연구들은 대부분 일시적 완화에 치중되어 있으며 장기적 역량이나 의존성 문제를 간과하고 있음을 확인했습니다. 이를 해결하기 위해 데이터, 모델 설계, 평가 및 거버넌스를 아우르는 새로운 프로세스 모델과 연구 의제를 제시합니다.

#LLM#HCI
더 보기
Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

AI Research

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

최근 LLM의 긴 추론(long-CoT) 성능 향상을 위해 GRPO와 같은 보상 기반 강화학습이 널리 사용되고 있습니다. 그러나 기존 방식은 응답 단위의 보상을 모든 토큰에 동일하게 배분하여, 정답에 결정적인 기여를 하는 토큰과 단순 표면적 토큰을 구분하지 못하는 문제가 있습니다. 본 논문은 특정 토큰이 정답 여부에 따라 과도하게 민감하게 반응하는 현상을 분석하여, 이러한 '반사실적 민감도'가 실제 추론 능력 향상과는 무관할 수 있음을 밝힙습니다. 이를 해결하기 위해 제안된 CSCR은 민감도가 높은 토큰의 크레딧을 줄이고 보상을 재정규화하여 최적화 신호의 신뢰도를 높입니다. 실험 결과, CSCR은 동일한 업데이트 횟수에서 GRPO보다 우수한 수학적 추론 성능을 보였습니다.

#LLM#Reinforcement Learning
더 보기
Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

AI Research

Safeguards Based on Copyable Context Cannot Provide Reliable Safety for LLMs

LLM의 안전 장치는 답변이 어떻게 사용될지 모르는 상태에서 답변 여부를 결정하는 구조적 문제를 안고 있습니다. 특히 동일한 답변이 전문가와 공격자 모두에게 유용할 수 있는 이중 용도(dual-use) 상황에서, 공격자가 선의의 요청을 모방할 경우 기존 방식은 무력해집니다. 본 논문은 모델의 능력과 하류 사용(downstream use)에 대한 증거를 분리하여 분석합니다. 분석 결과, 복제 가능한 증거를 기반으로 한 안전 장치는 유용성, 신뢰성, 개방성이라는 '안전 트릴레마'에 직면함을 증명했습니다. 이를 해결하기 위해 복제가 어려운 신뢰할 수 있는 자격 증명을 도입하여 실제 사용처를 예측하는 방안을 제시합니다.

#LLM Security#AI Safety
더 보기
In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

AI Research

In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

자율주행 시스템(ADS)의 실세계 배포가 증가함에 따라 안전성 확보를 위한 효과적인 테스트 수요가 급증하고 있습니다. 그러나 시나리오 선정, 성능 평가, 수락 기준 등에 대한 표준화된 기준이 부족하여 테스트 복잡성이 높은 상황입니다. 본 연구는 6개국 9개 기업의 ADS 개발 및 테스트 전문가들을 대상으로 인터뷰를 진행하여 산업계의 실무 관행과 과제를 분석했습니다. 연구 결과, 현재는 시나리오 기반 및 X-in-the-loop 방식이 주를 이루며 시나리오 현실성, 커버리지, 시뮬레이션 충실도 등이 주요 과제로 나타났습니다. 이를 해결하기 위해 AI, 월드 모델, 엔드투엔드 접근법을 포함한 증거 중심의 폐쇄 루프(evidence-centered closed-loop) 테스트 프레임워크를 제안합니다.

#Autonomous Driving#Software Testing
더 보기
Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

AI Research

Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

최신 LLM은 입력된 명시적 조건에 과도하게 집중하는 경향이 있어, 일상적인 상식 추론 시 불필란한 정보에 휘둘리는 'Salience Bias' 문제가 발생합니다. 연구진은 이 현상이 지식의 부재가 아닌, 잘못된 프레이밍에 의한 지식 억제 현상인지 확인하기 위해 SaliTrap 벤치마크를 구축했습니다. 12종의 최신 모델을 평가한 결과, 모든 모델이 심각한 Salience Bias를 보였으며 이는 지식의 부재보다는 정보의 돌출성에 의한 실패임을 확인했습니다. 프레임이 제거된 상태에서는 모델의 성능이 회복되는 것을 통해, 문제가 모델의 역량 부족이 아닌 인출(elicitation)의 문제임을 증명했습니다. 최종적으로 별도의 재학습 없이 가벼운 추론 시점 프롬프팅만으로 이 격차를 크게 줄일 수 있음을 보여주었습니다.

#LLM#Reasoning
더 보기
SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

AI Research

SGTP: Sampling-based Game-Theoretic Planning for Real-Time Multi-Vehicle Autonomous Racing

자율주행 다중 차량 레이싱에서는 경쟁적인 상호작용 속에서 전략적 다양성과 계산 효율성을 동시에 확보하는 것이 어렵습니다. 기존 플래너들은 복잡한 상호작용 상황에서 실시간 계획 수립에 한계를 보였습니다. 이를 해결하기 위해 본 논문은 GPU 가속 샘플링과 게임 이론적 추론을 결합한 SGTP 프레임워크를 제안합니다. 제안된 방식은 샘플링된 궤적에 게임 인지 비용을 적용하여 경쟁적 행동을 생성하며, 제약 조건 기반의 선택 과정을 통해 안전성을 확보합니다. 실험 결과, 높은 승률과 작업 완료율을 기록하며 최대 10대의 에이전트가 참여하는 대규모 시나리오에서도 실시간성을 유지함을 입증했습니다.

#Multi-Agent#Game Theory
더 보기