지난 소식

2026.08.31

이날 수집한 AI·테크 소식을 분야별로 다시 볼 수 있습니다. 제목을 누르면 원문으로 이동합니다.

23건

뉴스

주요 기사와 기업의 공식 발표

Mashable

OpenAI cuts off Cursor's AI models, deepening feud with Musk - Mashable

OpenAI가 SpaceX의 Anysphere(Cursor 개발사) 인수에 대응하여 Cursor에 대한 모델 공급 중단을 결정하며 일론 머스크와의 갈등이 심화되었습니다. 이번 조치는 계약상 허용된 최대 기간인 2026년 11월 12일을 종료 시점으로 설정했으며, 머스크 측의 계약 위반 가능성을 근거로 한 신뢰 문제 해결을 목적으로 합니다.

The New York Times

Help Wanted: ‘Forward-Deployed’ Humans for the A.I. Era - The New York Times

AI 기술이 고도화됨에 따라 모델의 성능을 넘어, 실제 비즈니스 현장에 기술을 이식하고 최적화하는 'Forward-Deployed' 인력의 역할이 중요해지고 있습니다. 이는 단순한 소프트웨어 엔지니어를 넘어, 복잡한 기업 워크플로우와 AI 모델 사이의 간극을 메우는 새로운 직무적 가치를 의미합니다.

Sierra Club

The Hidden AI Carbon Emissions That Aren’t Being Counted - Sierra Club

AI 모델의 학습과 추론 과정에서 발생하는 탄소 배출량이 현재의 측정 방식으로는 과소평가되고 있다는 경고를 담고 있습니다. 데이터 센터의 직접적인 전력 소비 외에 공급망 전반의 숨겨진 배출량이 환경에 미치는 영향을 분석합니다.

나머지 18건 펼쳐보기

NPR

We tested how AI chatbots would handle foreign propaganda. They did surprisingly well - NPR

NPR의 실험 결과, 최신 LLM(Large Language Model) 기반 챗봇들이 외국 선전(Propaganda) 및 허위 정보에 대해 높은 식별 및 방어 능력을 보여주었습니다. 모델들은 단순히 정보를 전달하는 것을 넘어, 정보의 출처와 논리적 오류를 분석하여 선전 기법을 효과적으로 가려내는 능력을 입증했습니다.

MedCity News

Hospitals Are All In on AI, but Testing and Oversight Haven’t Caught Up - MedCity News

전 세계 의료 시스템의 90% 이상이 AI 도구를 도입했으나, 이를 검증할 인프라와 거버넌스는 도입 속도를 따라잡지 못하고 있는 실정입니다. 기술적 검증 체계 없이 이루어지는 성급한 도입은 모델 드리프트(Model Drift)와 편향성 문제를 야기하며, 임상 현장의 신뢰도를 저하시키는 리스크로 작용하고 있습니다.

Jacobin

AI Isn’t Coming for Our Jobs. It’s Coming for Our Wages. - Jacobin

AI 기술의 발전이 대규모 실업을 야기한다는 공포와 달리, 실제 위협은 노동의 숙련도를 낮추고 임금을 억제하는 '탈숙련화(de-skilling)'와 노동 가치 하락에 있다. 자본이 기술을 통해 노동 통제력을 강화하려는 역사적 소식 속에서, AI는 일자리를 없애기보다 노동 과정을 파편화하고 임금 구조를 재편하는 도구로 작용할 위험이 크다.

CNN

‘It feels like early COVID’: The messy scramble to regulate AI - CNN

미국 정부 내 부처 간 주도권 싸움과 규제 가이드라인의 부재 속에서, 급격히 진화하는 AI Agent 및 보안 위협에 대응하기 위한 규제 체계 구축이 혼란을 겪고 있습니다. 기술적 통제와 국가 안보 경쟁 사이의 균형을 맞추려는 시도가 이어지는 가운데, 정부 기관 간의 역할 중복과 정책 일관성 결여가 AI 안전성 확보의 걸림돌로 작용하고 있습니다.

TechCrunch

Caterpillar is bringing to AI deployment what it learned from automating mining - TechCrunch

Caterpillar는 광산 자동화 분야에서 축적한 물리적 자율 주행 경험을 바탕으로, AI를 건설 현장 및 엔터프라이즈 운영 전반에 통합하는 전략을 추진하고 있습니다. 16PB 규모의 독점 데이터와 160만 대의 연결된 자산을 활용하여 현장 워크플로우와 AI를 결합하는 데 집중하고 있습니다.

Google DeepMind

Intelligent transcription with Gemini 3.5 Transcribe

Google DeepMind가 더욱 지능적인 음성-텍스트 변환을 지원하는 Gemini 3.5 Transcribe를 출시했습니다. 이를 통해 사용자들은 더욱 정교한 STT(Speech-to-Text) 기능을 경험할 수 있습니다.

Google DeepMind

Gemini Omni 1.1 Flash lets you build with more control

Google DeepMind가 개발자들에게 더 정교한 제어 기능을 제공하는 Gemini Omni 1.1 Flash를 출시했습니다. 이 모델은 새로운 크리에이티브 컨트롤 기능과 생성형 비디오 기능을 갖추고 있습니다.

Google DeepMind

Piloting the world's first double-blind AI evaluations

Google DeepMind가 암호학적으로 안전한 환경을 활용하여 독점 모델 벤치마크의 신뢰도를 높이는 세계 최초의 double-blind AI 평가 방식을 시범 운영합니다. 이를 통해 모델 성능 측정의 투명성과 신뢰성을 확보하고자 합니다.

OpenAI News

Supporting Thailand’s next generation of AI startups

OpenAI와 태국 MHESI가 협력하여 태국의 차세대 AI 스타트업을 지원하기 위한 8주간의 액셀러레이터 프로그램을 시작합니다. 이 프로그램은 헬스, 웰니스, 교육 분야의 10개 스타트업이 AI 프로토타입을 신뢰할 수 있는 제품으로 발전시킬 수 있도록 돕는 것을 목표로 합니다.

Anthropic News

Previewing the Model Hardware Standard Announcements Aug 27, 2026 We’re opening a research preview of the Model Hardware Standard (MHS), a shared specification for AI agents to safely operate physical devices, to a first group of scientific research labs and advanced manufacturers.

Anthropic이 AI 에이전트가 물리적 장치를 안전하게 제어할 수 있도록 하는 모델 하드웨어 표준(Model Hardware Standard, MHS)의 리서치 프리뷰를 공개했습니다. 이번 프리뷰는 일부 과학 연구소와 첨단 제조 기업들을 대상으로 진행됩니다.

OpenAI News

Learning never stops: How AI makes learning continuous

OpenAI의 새로운 보고서는 학생과 교육자가 ChatGPT를 활용하여 학습을 지속하는 방식에 대해 탐구합니다. 이 보고서는 교실 밖에서도 이어지는 지속적인 학습 지원 방안을 다룹니다.

Google Cloud AI

Now introducing Gemini Enterprise for Legal

Google Cloud가 특정 산업 분야를 위해 설계된 새로운 솔루션 제품군의 일환으로 Gemini Enterprise for Legal을 출시했습니다. 이 솔루션은 법률 분야에 특화된 기능을 제공하기 위해 개발되었습니다.

Google Cloud AI

Now introducing Gemini Enterprise for Financial Services

Google Cloud가 자본 시장 및 기업 금융 워크플로우에 최적화된 Gemini Enterprise for Financial Services를 출시했습니다. 이번 솔루션은 Google의 에이전틱 AI 기술을 금융 서비스 분야에 직접 통합하는 것을 목표로 합니다.

24건

커뮤니티

Hacker News, GeekNews, Reddit 반응

Hacker News

Nvidia agrees to acquire Hugging Face for $13B

Nvidia가 오픈소스 AI 생태계의 핵심 플랫폼인 Hugging Face를 130억 달러 규모로 인수하기 위한 협상을 진행 중입니다. 이번 인수가 성사될 경우 Nvidia는 하드웨어를 넘어 소프트웨어 플랫폼 장악력을 대폭 강화할 전망입니다.

Hacker News

Apple introduces M6 and M5 Ultra

애플이 2nm 공정을 적용한 M6 칩과 쿼드 다이 아키텍처 기반의 M5 Ultra를 공개하며 성능과 AI 연산 능력의 비약적인 발전을 선보였습니다. 커뮤니티에서는 압도적인 하드웨어 스펙에 대한 놀라움과 함께 성능 격차에 대한 기대감이 나타나고 있습니다.

Hacker News

GLM-5.3-Flash

Zhipu AI가 성능과 효율성을 동시에 잡은 새로운 LLM 모델인 GLM-5.3-Flash를 공개했습니다. 모델 가중치가 Hugging Face에 공개되어 오픈 소스 생태계의 접근성을 높였으며, 빠른 발전 속도에 대한 커뮤니티의 높은 관심이 이어지고 있습니다.

Hacker News

AWS Acquires DuckLabs

AWS가 DuckDB 개발팀인 DuckLabs를 인수하며 기술 확장과 오픈 소스 유지 사이의 균형을 꾀하고 있습니다. 이번 인수는 DuckLabs 팀의 합류를 의미하며, DuckDB 프로젝트의 오픈 소스 라이선스는 유지됩니다.

Hacker News

GUIs should be fully keyboard-driven

GUI 환경에서도 TUI처럼 모든 기능을 키보드만으로 제어할 수 있어야 한다는 기술적 제언과 이에 대한 사용자들의 접근성 논쟁을 다룹니다.

나머지 19건 펼쳐보기

Hacker News

Our decision on Cursor following its acquisition by SpaceX

SpaceX의 Cursor 인수 결정에 따른 AI 개발 도구의 거버넌스 변화와 이에 따른 사용자들의 우려를 다루고 있습니다. 특정 기업의 인수합병이 AI 모델의 이용 약관 및 데이터 보안에 미칠 영향을 중심으로 논의가 진행 중입니다.

Hacker News

Htmx 4.0

Htmx 4.0 출시 소식에 대해 개발자들이 단순하고 빠른 웹 개발 스택으로서의 가치를 높게 평가하고 있습니다. 복잡한 프레임워크 대신 Go, SQLite와 결합하여 생산성을 높이는 방식이 주목받고 있습니다.

GeekNews / Hada

스마트 TV가 PC를 통해 소프트웨어를 설치하지 못하게 막는 방법

디스플레이 기기의 식별 정보를 활용한 드라이버 자동 설치 기능이 사용자 의사와 무관한 소프트웨어 설치 통로로 악용될 수 있음을 보여줍니다. 하드웨어 연결 시 발생하는 자동화된 프로세스가 보안과 사용자 통제권 사이에서 심각한 충돌을 일으킬 수 있습니다.

GeekNews / Hada

AI 없는 금요일

AI 도구에 대한 의존도가 높아지는 환경에서 개발자의 핵심 역량과 비판적 사고를 유지하기 위한 전략적 움직임입니다. 기술적 숙련도는 단순히 코드를 생성하는 것이 아니라 문제의 근본 원인을 파악하는 과정에서 형성된다는 점을 시사합니다.

GeekNews / Hada

Show GN: typeboard — 팀 내에서 필요한 터미널을 직접 만들기

사용자 정의가 어려운 기존 터미널의 한계를 극복하기 위해 PTY부터 UI 레이어까지 직접 제어하는 도구를 개발한 사례입니다. 이는 개발자가 자신의 워크플로우에 최적화된 독자적인 터미널 환경을 구축할 수 있음을 시사합니다.

GeekNews / Hada

StemDeck - 음악을 보컬, 드럼 등 6개 트랙으로 나누는 로컬 앱

로컬 컴퓨팅 자원을 활용해 클라우드 서버 없이도 고성능 음원 분리를 구현한 것이 기술적 핵심입니다. 이는 데이터 보안이 중요한 음악 작업 환경에서 강력한 프라이버시 보호와 효율적인 워크플로우를 동시에 제공합니다.

GeekNews / Hada

영국인 93% “개인 메시지는 비공개로 유지돼야”

개인 메시지의 종단간 암호화와 프라이버시 보호에 대한 대중의 강력한 의지를 보여주는 조사 결과입니다. 정부의 감시 권한 확대와 개인의 디지털 프라이버시 사이의 갈등이 향후 기술 정책의 핵심 쟁점이 될 전망입니다.

GeekNews / Hada

낸시 그레이스 로먼 우주망원경

낸시 그레이스 로먼 우주망원경은 광활한 시야와 정밀한 관측 능력을 결거해 우주론의 난제를 풀기 위한 차세대 관측 도구입니다. 이는 기존 허블 망원경의 한계를 넘어 은하 형성 및 외계 행성 탐사 분야에서 획기적인 데이터를 제공할 것으로 기대됩니다.

GeekNews / Hada

Samsung의 메모리 내 연산(PIM)

메모리 내부에서 연산을 수행하는 PIM 기술은 데이터 이동을 최소화하여 AI 연산의 병목 현상을 해결하는 차세대 솔루션입니다. 이는 메모리 대역폭 한계를 극복하고 저전력·고성능 AI 가속을 가능하게 하는 기술적 전환점을 제시합니다.

GeekNews / Hada

Show GN: youdible - 청각장애인을 위한 인공 귀

이 서비스는 청각장애인의 정보 접근성을 높이기 위해 모바일 환경에 최적화된 실시간 음성-자막 변환 기술을 구현했습니다. 기술적 차별화보다는 사용자 중심의 아이디어를 모바일 플랫폼에 이식하여 실질적인 보조 공학 도구로서의 가능성을 보여줍니다.

GeekNews / Hada

캘리포니아주 의회, 연령 확인법에서 Linux를 만장일치로 면제

이번 법안 통과는 오픈소스 라이선스의 특성을 법적 규제 범위에서 명확히 분리하여 소프트웨어 생태계의 자유를 보호한 결정입니다. 이는 기술적 혁신을 저해할 수 있는 과도한 개인정보 수집 의무로부터 오픈소스 커뮤니티를 보호하는 중요한 선례가 될 것입니다.

Reddit

We used HFlow to evaluate the latest open weights VLMs for processing egocentric data

HFlow를 사용하여 1인칭 시점(egocentric) 데이터 처리를 위한 최신 오픈 웨이트 VLM 모델들의 성능을 평가한 결과입니다. Gemma 4와 Qwen 모델이 Gemini 2.5 Flash와 대등한 성능을 보이면서도 비용 효율성이 뛰어나, 프라이버시가 중요한 대규모 데이터 처리에 적합함을 입증했습니다.

Reddit

Are there any interesting architectural innovations that we seem to be on the verge of for LLM models or AI models that might be a big deal? (Excluding maybe N-gram, since everyone is already well aware of that one)

기존의 트랜스포머 구조를 넘어선 근본적인 아키텍처 혁신과 차세대 AI 모델의 잠재적 변화에 대해 논의하고 있습니다. 사용자들은 Mamba와 같은 하이브리드 구조뿐만 아니라 지식 업데이트 방식이나 새로운 예측 모델에 대한 관심을 보이고 있습니다.

Reddit

Opensource Openrouter

OpenRouter의 수수료 문제를 해결하기 위해 개발된 오픈소스 게이트웨이 프로젝트인 use-conifer가 소개되었습니다. 사용자는 추가 수수료 없이 시장 가격으로 100개 이상의 모델을 사용할 수 있으며, 높은 가용성과 확장성을 제공하는 것을 목표로 합니다.

23건

논문

읽어볼 만한 AI 연구

AI 연구

Agentic Game Development as a Verifiable Trajectory Data Engine for Scaling World Models

기존의 월드 모델 확장 전략은 단순히 크롤링된 비디오 데이터를 늘리는 데 집중하여 효율성이 떨어지는 문제가 있습니다. 특히 공간 생성 분야는 코드와 달리 실행 가능한 검증 신호가 부족하여 RL 학습에 어려움을 겪습니다. 본 논문은 게임 개발 환경이 물리, 충돌, 탐색 가능성 등 정교한 보상 신호를 제공할 수 있음에 주목합니다. 이를 위해 엔진의 밀집한 신호와 인간의 피드백을 결합한 RLHEV(Reinforcement Learning with Human-Engine Verification) 방식을 제안합니다. 이 방식은 게임 개발 과정을 통해 고품질의 장기 궤적 데이터와 검증 가능한 보상을 동시에 확보합니다.

AI 연구

PAWBench: How Far Are We from Probabilistically Aligned World Modeling?

최근 비디오 생성 모델은 물리적 세계를 모사하는 월드 모델로 주목받고 있습니다. 그러나 기존 평가는 개별 영상의 개연성만 측정할 뿐, 동일 조건에서 다양한 가능한 결과가 나타나는 확률적 분포를 제대로 검증하지 못합니다. 본 논문은 확률적 정렬(Probabilistic Alignment)을 정식화하고, 이를 평가하기 위한 벤리마크인 PAWBench와 평가 프로토콜인 PAWEval을 도입합니다. 50개 시나리오와 11개 모델을 대상으로 실험한 결과, 현재의 모델들은 정답 확률 분포를 일관되게 재현하지 못하는 한계를 보였습니다. 연구진은 언어 프롬프트나 초기 노이즈 샘플링이 모델의 예측 분포를 어떻게 변화시키는지 분석하며 향후 연구 방향을 제시합니다.

AI 연구

UrbanGround: From Local Perception to Spatial Agency in a Real-Scale City

최근 MLLM은 거리 뷰 해석 능력을 갖추었으나, 에이전트가 이동하며 발생하는 공간적 의사결정 능력은 아직 미흡합니다. 본 논문은 복잡한 실제 도시 환경에서 국소적 인지가 신뢰할 수 있는 행동으로 이어지는 범위를 조사하고자 합니다. 이를 위해 홍콩의 3D 지형 데이터를 기반으로 구축된 물리적 제약 환경인 'UrbanGround' 샌드박스를 제안합니다. 실험 결과, 현재의 MLLM 에이전트는 단기적 시각 인식에는 강하나 장거리 탐사 시 오류가 누적되어 목표 지향적 행동을 유지하는 데 실패함을 확인했습니다. 이 연구는 향후 복잡한 도시 환경에서 에이전트의 신뢰성을 높이는 연구의 기반이 될 것입니다.

AI 연구

TTPO: Test-Time Policy Optimization

최근 LLM의 수학적 추론 성능 향상을 위해 RL과 OPSD가 사용되지만, 정답 라벨이 필수적이라 테스트 시점의 학습(TTT)이 어렵다는 문제가 있습니다. 기존의 다수결 투표(Majority-vote) 방식은 잘못된 투표 결과가 모델 전체를 오염시키는 취약점이 있습니다. 본 논문은 투표 결과와 일치하는 롤아웃은 강화하고, 일치하지 않는 롤아웃은 페널티를 주는 비대칭적 목적 함수인 TTPO를 제안합니다. 여기에 토큰 수준의 선택 기법을 더해 이미 수렴한 위치는 제외하고 확신이 있는 오류만 정교하게 수정합니다. 실험 결과, 라벨 없이도 경쟁 수준의 벤치마크에서 정답 라벨을 사용한 방식과 대등한 성능을 달성하며 강력한 일반화 성능을 보였습니다.

AI 연구

Self-OPD: On-Policy Distillation for Flow Matching Models without Teacher

기존의 On-policy distillation(OPD)은 특정 태스크를 위한 별도의 교사 모델이 필요하여 비용이 높고, 교사와 학생 간의 분포 차이로 인해 생성 오류가 누적되는 문제가 있었습니다. 본 논문은 교사 모델 없이 학생 모델 스스로의 탐색을 단계별 감독 신호로 활용하는 Self-OPD 프레임워크를 제안합니다. 각 타임스텝에서 결정론적 예측을 K개의 확률적 SDE 후보로 분기하고, 이를 ODE 샘플러로 전개한 뒤 보상 기반의 정규화된 이득(Advantage)을 계산합니다. 모든 분기에서 발생하는 pull-push 목적 함수를 통해 고득점 경로는 유도하고 저득점 경로는 밀어내며 속도 필드를 최적화합니다. 실험 결과, Self-OPD는 별도의 교사 모델 없이도 기존 RL 및 OPD 방식보다 우수한 성능을 입증했습니다.

나머지 18건 펼쳐보기

AI 연구

What Makes Good Agentic Data? An ACE Lens on Data Generation for LLM Agents

LLM 에이전트가 외부 환경과 상호작용하며 학습하기 위해 생성된 데이터의 의존도가 높아지고 있습니다. 기존의 데이터 생성 방식은 도메인 중심의 파편화된 구조로 인해 데이터의 일관성 유지와 검증, 선택 과정이 혼재되어 있는 문제가 있었습니다. 본 논문은 에이전트 데이터를 환경, 태스크, 상호작용, 검증기로 구성된 공통 객체로 정의하는 프레임워크를 제안합니다. 또한, 데이터 생성을 정확도(Accuracy), 복잡도(Complexity), 다양성(divErsity)이라는 세 가지 축(ACE)으로 분석하는 방법론을 정립했습니다. 이를 통해 기존 연구들을 재해석하고, 단순한 양적 확장이 아닌 유효하고 정보 가치가 높은 데이터 할당의 중요성을 입증했습니다.

AI 연구

Training Agents to Evolve with Their Harness: TaoLive Digital Avatar Agent Technical Report

실시간 디지털 아바타 스트리머는 낮은 지연 시간과 빈번한 전략 업데이트를 동시에 충족해야 합니다. 기존에는 거대 모델은 느리고, 경량 모델은 고정된 환경(Harness)에 과적합되는 트레이드오프 문제가 있었습니다. 이를 해결하기 위해 환경 변화에 적응하는 'Harness-Aware Training(HAT)' 방식을 제안합니다. 핵심 기술인 HSA(Harness-State Augmentation)를 통해 스킬, 프롬프트, 도구 스키마 등을 변형하며 학습을 진행합니다. 실험 결과, HAT는 높은 QA 성능을 유지하면서도 환경 변화에 대한 강건성을 확보했습니다. 실제 타오바오 라이브 서비스에 적용되어 GMV 등 비즈니스 지표 향상을 입증했습니다.

AI 연구

GameWAM: A World Action Model for Video Games

기존 게임 에이전트는 세계 역학 모델링이 부족하고, 기존 세계 모델은 실제 작업 정책으로 활용하기 어렵다는 문제가 있었습니다. 본 논문은 시각적 관찰과 실행 가능한 키보드/마우스 궤적을 동시에 생성하는 GameWAM을 제안합니다. 이 모델은 블록 인과적 조건부(block-causal conditioning)와 플로우 매칭(flow matching)을 통해 시각적 미래와 액션 궤적을 병렬로 생성합니다. 또한, 이질적인 제어 방식을 처리하기 위해 모드별 예측 분포와 연속 액션 정규화를 도입하고, 장기 상호작용을 위해 블록 사이클 제어 방식을 사용합니다. 실험 결과, 기존 에이전트 대비 적은 액션 실행만으로도 경쟁력 있는 작업 성공률을 달nus했습니다. 또한, 저주파 액션 소스 각인(LASI) 현상을 발견하여 생성형 제어의 취약점을 규명했습니다.

AI 연구

PILOT in the Loop: Live Self-Improvement for Long-Horizon Agents

기존의 에이전트 자가 개선 방식은 작업이 모두 끝난 후에만 경험을 처리하므로, 실행 중인 작업의 방향을 즉시 수정하거나 실시간 피드백을 반영하기 어렵습니다. 본 논문은 실행 중 발생하는 경험을 통해 현재의 실행 경로를 재지정하고 지속적인 하네스를 업데이트하는 '라이브 자가 개선'의 필요성을 제기합니다. 이를 위해 제안된 PILOT은 Supervisor-Worker 구조를 통해 두 가지 메커니즘을 제공합니다. 첫째, 별도의 Supervisor가 실행 중인 Worker를 제어하거나 중단하는 'Live Steering'을 구현합니다. 둘째, 실행 중 발견된 절차와 실패 모드를 재사용 가능한 기술과 메모리로 정제하는 'Live Self-evolution'을 수행합니다. 실험 결과, PILOT은 다양한 벤치마크에서 기존 방식보다 높은 성능을 기록하며 효율적인 토큰 사용량과 성공률 향상을 입증했습니다.

AI 연구

Understanding Evolution Strategies for LLM Reasoning: Broader Reasoning Coverage than GRPO

최근 LLM 추론 성능 향상을 위해 메모리 효율적인 Evolution Strategies(ES)가 주목받고 있으나, 기존 GRPO와 같은 방식과의 차별점과 최적화 메커니즘은 명확히 밝혀지지 않았습니다. 본 논문은 ES의 동역학을 체계적으로 조사하여 ES가 GRPO보다 더 넓은 추론 커버리지를 확보할 수 있음을 이론적, 실증적으로 증명합니다. 연구 결과, GRPO는 엔트로피 붕괴 현상을 보이는 반면, ES는 높은 Pass@K 성능을 유지하며 모델의 잠재력을 더 잘 활용함을 확인했습니다. 또한, 모델 파라미터의 큰 이동에도 불구하고 성능 향상은 일부 희소한 업데이트에 의해 발생하며 치명적 망각이 발생하지 않음을 입증했습니다. 최종적으로 GRPO의 Pass@1 강점과 ES의 Pass@K 강점을 결합한 순차적 학습 전략을 제안합니다.

AI 연구

WikiSkill: Compiling Agent Experience into Persistent Knowledge for Skill Evolution

에이전트 스킬은 특정 워크플로우를 재사용 가능한 자원으로 패키징하여 능력을 확장하는 데 사용됩니다. 기존의 자동 스킬 발견 방식은 최적화 과정에서 얻은 통찰이 파편화되어 체계적인 재사용이 어렵다는 문제가 있었습니다. 이를 해결하기 위해 WikiSkill은 실행 경험, 축적된 지식, 실행 가능한 스킬을 분리하고 경험을 위키(Wiki)로 지속적으로 통합하는 프레임워크를 제안합니다. 실험 결과, WikiSkill은 기존 스킬 진화 방식보다 우수한 성능을 보였으며 모델 크기에 따른 스킬 보완 효과를 입증했습니다. 특히 축적된 지식 베이스가 스킬 진화의 핵심적인 역할을 함을 확인했습니다.

AI 연구

Procedura: Agentic 3D Modeling with Procedural Control

기존의 3D 생성 모델은 정교한 기계적 구조나 부품 분할, 사용자 편집 기능을 제공하는 데 한계가 있었습니다. 이를 해결하기 위해 3동적 3D 형상을 코드로 간주하는 '3D shape as code' 패러다임을 제안합니다. Procedura는 LLM이 객체를 조립 그래프 형태로 계획하고, 타입이 지정된 결합(mate)을 통해 파라메트릭 프로그램을 작성하는 에이전트 프레임워크입니다. 에이전트는 부품별로 코드를 작성하며, 컴파일 및 연결성 검사를 통해 배치 문제를 해결하고 비전 비평가(vision critic)를 통해 결과물을 정교화합니다. 실험 결과, 기존 3D 생성기 및 에이전트보다 우수한 품질과 날카로운 모서리를 구현했으며, 편집 가능한 구조적 프로그램을 생성하는 데 성공했습니다.

AI 연구

Luce: Relightable Gaussians for 3D Asset Generation

고품질 이미지-to-3D 생성을 위해서는 기하학적 구조와 외형을 모두 담는 3D 표현 방식이 필요하지만, 기존 방식은 재조명(Relighting)과 표준 렌더링 파이프라인 통합에 어려움이 있었습니다. 이를 해결하기 위해 본 논문은 기하학적 구조와 PBR 재질을 하나의 복셀화된 멀티모달 가우시안 클라우드 내에 통합하는 Luce를 제안합니다. VAE를 통해 표현 방식을 통합된 재질 인식 잠재 공간으로 압축하고, 사전 학습된 이미지 인코더의 특징을 조건으로 하는 Rectified-flow Transformer를 통해 단일 이미지로부터 이 잠재 공간을 생성합니다. 결과적으로 생성된 잠재 공간은 재조명이 가능한 PBR 가우시안과 텍스처드 메시로 디코딩됩니다. 실험 결과, Luce는 Toys4K 벤치마크에서 기존 최고 성능 대비 FID를 28% 개선하며 SOTA를 달성했습니다.

AI 연구

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

최근 대형 언어 모델(LLM)의 추론 성능 향상을 위해 추론 시간 스케일링 기법이 주목받고 있으나, 이는 반복적인 생성이나 외부 검증으로 인해 비용이 높다는 단점이 있습니다. 본 논문은 모델 규모 간에 실패 모드가 구조적 패턴을 공유한다는 점에 착안하여 CritICL 프레임워크를 제안합니다. CritICL은 약한 모델의 실패 사례를 오히려 가이드로 활용하여 비판 기반의 인컨텍스트 예시를 생성합니다. 동적(dynamic) 방식과 정적(static) 방식 두 가지 변형을 통해 입력별 맞춤형 가이드 또는 안정적인 가이드를 제공합니다. 실험 결과, 제안 방식은 기존 인컨텍스트 러닝보다 우수하며 적은 생성 횟수와 낮은 토큰 비용으로도 기존 추론 스케일링 기법에 필적하는 성능을 달성했습니다.

AI 연구

Magpie: Real-Time World Renderer for Interactive Games

현대 게임 개발은 고품질 에셋 제작과 최적화에 막대한 비용과 시간이 소요되는 문제를 안고 있습니다. 최근 비디오 생성 모델이 발전하고 있으나, 상호작용이 필수적인 게임에서는 시각적 품질뿐만 아니라 게임 규칙과 객체 상태의 재현성이 유지되어야 하는 과제가 있습니다. 본 논문은 게임 플레이 실행과 시각적 생성을 분리하는 실시간 생성형 월드 렌더링 시스템인 Magpie를 제안합니다. 게임 엔진은 플레이어의 행동과 세계 상태를 관리하고, 독립적인 렌더 서버는 엔진의 화이트박스 프레임을 기반으로 시각적 출력을 생성합니다. 이를 통해 게임 설계의 재현성을 유지하면서도 초기 프로토타입 제작 시 고품질 에셋에 대한 의존도를 낮출 수 있습니다.

AI 연구

CaRGo-T: Causal Reasoning Graph-of-Thought improves Multimodal Humor Comprehension

기존의 거대 시각-언어 모델(VLM)은 이미지와 텍스트 간의 복잡한 상호작용이 필요한 유머 이해 작업에서 한계를 보였습니다. 기존의 선형적인 Chain-of-Thought 방식으로는 유머에 내재된 미묘한 인과 관계와 맥락을 포착하기 어렵기 때문입니다. 본 논문은 유머의 인과적/맥락적 관계를 경량 그래프 구조로 표현하는 CaRGo-T 프레임워크를 제안합니다. 생성된 그래프는 코드 기반의 직렬화된 형태로 변환되어 VLM이 해석할 수 있는 형태로 제공됩니다. 실험 결과, CaRGo-T는 다양한 유머 데이터셋에서 기존 추론 방식 대비 유의미한 성능 향상을 달성했습니다.

AI 연구

CaSKG: Counterfactual-Causal Skill Graphs for Scalable Agent Skill Retrieval

LLM 에이전트가 재사용 가능한 스킬 라이브러리를 활용할 때, 컨텍스트 비용과 검색 정확도 사이의 트레이드오프가 발생합니다. 기존의 벡터 검색은 스킬 간의 절차적 관계를 무시하고 독립적인 텍스트로만 취급하는 한계가 있습니다. 이를 해결하기 위해 제안된 CaSKG는 반사실적 선별(Counterfactual Probes)을 통해 스킬 간의 인과적 관계를 교정하는 그래프 기반 프레임워크입니다. 먼저 다양한 증거를 바탕으로 후보 그래프를 구축한 뒤, 스킬 쌍의 순서 변경이나 교체 등을 통해 관계의 신뢰도를 정교하게 조정합니다. 실험 결과, CaSKG는 ALFWorld 및 ScienceWorld 벤치마크에서 기존 방식보다 높은 성공률과 효율적인 실행 단계를 달성했습니다.

AI 연구

TacForcing: Streaming Action Generation with Execution-Time Tactile Feedback

접촉이 빈번한 조작 작업에서는 실행 과정에서 접촉 상태가 급격히 변할 수 있습니다. 기존의 청크 기반 VLA 모델은 실행 전 관측 데이터에 의존하므로 실행 중 발생하는 촉각 정보가 반영되지 않는 문제가 있었습니다. 이를 해결하기 위해 본 논문은 실행 중의 촉각 피드백을 효과적으로 통합하는 스트리밍 액션 생성 프레임워크인 TacForcing를 제안합니다. 특히 실행 직전의 액션에만 촉각 정보를 제한적으로 적용하는 Execution-Aware Tactile Attention(EATA)을 도입하여 시간적 불일치 문제를 완화했습니다. 실험 결과, 시뮬레이션 및 실세계 환경 모두에서 기존 베이스라인보다 높은 성공률을 기록하며 성능을 입증했습니다.

AI 연구

Thinking on Shots: Consistent Multi-Shot Video Editing with Agentic Reasoning

기존 생성형 AI 비디오 편집은 단일 샷이나 짧은 클립에 집중되어 있어, 긴 영상에 여러 명령을 적용할 때 개체 파편화나 시간적 불연속성 문제가 발생합니다. 이를 해결하기 위해 저자들은 다중 명령/다중 샷 긴 영상 편집(MMLVE)이라는 새로운 과제를 정의했습니다. 제안된 에이전트 기반 프레임워크는 LLM과 VLM의 시너지를 활용하여 샷 단위의 디커플링과 정밀한 명령 파싱을 수행합니다. 또한, 복잡한 시공간 역학을 반영한 MMLVE-Bench 데이터셋과 전용 평가 지표를 구축했습니다. 실험 결과, 제안 모델은 기존 SOTA 모델들을 능가하며 편집 환각을 제거하고 매끄러운 시공간 전환을 달성했습니다.

AI 연구

EditaLive! Unified Character Video Editing for Live Streaming

기존 비디오 편집 방식은 장면 중심이라 인물 중심의 라이브 스트리밍에 적용 시 표정 불일치와 높은 지연 시간 문제가 발생합니다. 이를 해결하기 위해 본 논문은 실시간 스트리밍 캐릭터 비디오 편집 프레임워크인 EditaLive를 제안합니다. Wan-Animate 모델을 기반으로 외형과 동작을 분리하고, CharEdit-50K 데이터셋을 통해 참조 프레임 편집 및 비디오 재구성 방식을 학습시켰습니다. 또한 오프라인 양방향 생성을 인과적(causal) 스트리밍 생성 방식으로 전환하고, 두 단계 샘플러로 압축하는 정렬된 self-rollout 증류 전략을 설계했습니다. 실험 결과, EditaLive는 표정 보존 성능이 뛰어나면서도 낮은 지연 시간의 실시간 추론을 달성했습니다.

AI 연구

What Does an Evaluation License? A Commit-Bound Census of Claim-Relative Inference in Inspect Evals

평가 아티팩트는 작업, 스코어러, 지표를 포함하지만, 해당 지표에 담긴 주장이 실제 데이터나 의미론적 근거와 일치하는지는 보장하지 않습니다. 본 논문은 누락된 '주장-재현 레이어'를 정형화하기 위해 고정된 기질(D), 근거 가족(F), 질의(q) 모델을 제안합니다. 이를 바탕으로 특정 커밋 시점의 Inspect Evals 단위 124개를 전수 조사하였습니다. 분석 결과, 110개의 단위가 역사적 증거 부족으로 인해 결정론적 추론 단계 이전에 중단되었습니다. 최종적으로 본 연구는 단순한 강건성 라벨링 대신, 타입화된 중단점과 불안정성 증거를 통해 평가 체계의 구조적 안정성을 확인했습니다.

30건

제품/서비스

이날 공개된 제품과 도구

제품/서비스

Topview Motion Studio

애프터 이펙트 없이 AI로 고퀄리티 제품 출시 영상을 제작하는 모션 디자인 스튜디오

제품/서비스

Hyperfocus

중요한 목표를 일상적인 실행으로 연결하는 macOS 전용 목표 중심 플래너

제품/서비스

Olostep

웹 페이지를 AI 학습 및 에이전트용 정형 데이터로 즉시 변환해주는 API 서비스

제품/서비스

Prequel

편집 과정 없이 바로 완성되는 고화질 시네마틱 화면 녹화 도구

제품/서비스

Referent

법률 업무 자동화를 통해 변호사가 고객과 성장에만 집중할 수 있게 돕는 AI 기반 운영 체제

나머지 25건 펼쳐보기

제품/서비스

Murfy AI

AI 에이전트 팀을 활용해 논문 작성부터 arXiv 출판까지의 워크플로우를 혁신하는 도구

제품/서비스

Ravioli

나만의 커스텀 우표 모양을 간편하게 제작하는 초소형 디자인 도구

제품/서비스

RIP MY BUILD

실패한 사이드 프로젝트를 기록하고 다음 도약을 준비하는 디지털 추모 공간

제품/서비스

Ulpaso

로그인과 클라우드 없이 맥에서 즉시 실행하는 프라이빗 회의록 작성 도구

제품/서비스

Superagent

터미널을 벗어나 브라우저와 시뮬레이터를 직접 다루는 직관적인 코딩 에이전트 환경

제품/서비스

Sayscroll

사용자의 목소리 속도에 맞춰 자동으로 스크롤되는 AI 텔레프롬프터

제품/서비스

Retro Y2K Theme

어떤 웹사이트든 90년대 감성의 레트로 스타일로 변신시켜주는 브라우저 테마 커스텀 도구

제품/서비스

oMLX

Mac을 강력한 로컬 LLM 서버로 변환하여 AI 에이전트의 응답 속도를 극대화하는 도구

제품/서비스

ChordWeaver

음악 이론 학습과 화성 작곡 실험을 동시에 즐길 수 있는 인터랙티브 음악 플레이그라운드

제품/서비스

Maritime

AI 에이전트별 전용 가상 머신(VM) 인프라를 저렴하게 제공하는 서비스

제품/서비스

Skud

브랜드 아이덴티티를 유지하며 파일을 간편하게 공유하고 추적하는 맥 메뉴바 도구

제품/서비스

Edge Drop

화면 가장자리에 숨겨진 클립보드 선반으로 작업 내용을 끊지 않는 생산성 도구

제품/서비스

Caplio

맥에 흩어진 스크린샷과 이미지를 자동으로 정리하고 검색할 수 있는 프라이빗 자산 관리 도구

제품/서비스

Softorino Online Converter

개인정보 유출 걱정 없이 브라우저에서 즉시 파일을 변환하는 보안 중심 컨버터

제품/서비스

Gemini Omni 1.1 Flash

개발자를 위한 정교한 제어가 가능한 AI 비디오 생성 도구

제품/서비스

Brand My Dihh

경쟁사 로고를 제품에 노출시켜 역으로 트래픽을 탈취하는 공격적 마케팅 플랫폼

제품/서비스

Storeline

앱 스토어 및 구글 플레이의 현지화와 배포 과정을 자동화하는 올인원 관리 도구

제품/서비스

Záboj

운전 중에도 업무와 일상을 완벽히 처리하는 차량용 AI 음성 비서

제품/서비스

VDF AI Networks

목표 설정만으로 복잡한 업무를 자동 수행하는 자가 학습형 온프레미스 멀티 에이전트 네트워크

제품/서비스

Harshith's Newsletter

실제 AI 구축 과정에서 얻은 실무 중심의 인사이트를 전달하는 뉴스레터

제품/서비스

Cord

제안부터 결제까지, 고객의 번거로움 없이 하나의 링크로 끝내는 비즈니스 자동화 솔루션

제품/서비스

Avatar Studio

자신의 목소리와 외형을 담은 AI 아바타로 카메라 없이 영상을 제작하는 크리에이터 플랫폼

제품/서비스

skillmates

AI를 통해 취미와 학습 목표가 맞는 사람을 연결하고 함께 성장하는 커뮤니티 플랫폼

제품/서비스

SpeakoFlow Mini

원문 훼손 없이 오타만 정교하게 교정하는 초경량 로컬 받아쓰기 모델

제품/서비스

Choeae

흩어진 K-pop 덕질 콘텐츠를 한곳에 모아 감성적인 앨범으로 만드는 팬덤 미디어 플랫폼

6건

모델/벤치마크

새 모델과 주요 평가 결과

HF Model Trending

Lightricks/LTX-2.5

Lightricks에서 공개한 LTX-2.5 모델이 Hugging Face에서 높은 다운로드 수를 기록하며 주목받고 있습니다. 이 모델은 image-to-video 파이프라인을 지원하는 것이 특징입니다.

HF Model Trending

unsloth/GLM-5.3-Flash-GGUF

unsloth/GLM-5.3-Flash-GGUF 모델이 Hugging Face에서 높은 다운로드 수를 기록하며 주목받고 있습니다. 해당 모델은 text-generation 파이프라인을 지원하는 GGUF 포맷의 모델입니다.

HF Model Trending

zai-org/GLM-5.3

zai-org에서 공개한 GLM-5.3 모델이 Hugging Face에서 높은 다운로드 수를 기록하며 주목받고 있습니다. 이 모델은 text-generation 태스크를 위한 대규모 파라미터를 가진 모델입니다.

LiveCodeBench

LiveCodeBench top model: O4-Mini (High)

LiveCodeBench 벤치마크에서 O4-Mini (High) 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.

LiveCodeBench

LiveCodeBench top model: Gemini-2.5-Pro-06-05

LiveCodeBench 벤치마크에서 Gemini-2.5-Pro-06-05 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.

나머지 1건 펼쳐보기

LiveCodeBench

LiveCodeBench top model: Gemini-2.5-Flash-04-17

LiveCodeBench 벤치마크에서 Gemini-2.5-Flash-04-17 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 avg_pass@1 25.0%를 달성했습니다.