지난 소식

2026.09.08

이날 수집한 AI·테크 소식을 분야별로 다시 볼 수 있습니다. 제목을 누르면 원문으로 이동합니다.

25건

뉴스

주요 기사와 기업의 공식 발표

Gates Notes

The turbulent AI era is here. The choices we make now are critical. - Gates Notes

빌 게이츠는 AI 기술이 단순한 도구를 넘어 사회 전반의 구조를 재편하는 격변기에 진입했음을 경고하며, 현재의 기술적 선택이 인류의 미래를 결정할 것이라고 강조합니다. 특히 AI의 발전 속도와 그에 따른 윤리적, 사회적 책임의 균형을 맞추는 것이 핵심 과제임을 시사합니다.

WSJ

He’s Letting AI Agents Invest His Money. They Even Have Names. - WSJ

개인 투자자가 LLM 기반의 AI Agent에게 자산 운용을 위임하며, 단순 자동화를 넘어 자율적 의사결정 주체로서의 AI를 활용하는 새로운 금융 트렌드를 다룹니다. 사용자는 각 Agent에게 고유한 페르소나를 부여하여 서로 다른 투자 전략을 수행하게 함으로써 포트폴리오를 관리합니다.

The New York Times

Early Data Indicates an A.I.-Generated Drug Could Slow Aging - The New York Times

AI가 설계한 신약 후보 물질이 초기 데이터에서 노화 지연 가능성을 보여주며 신약 개발 패러다임의 변화를 예고하고 있습니다. 기존의 시행착오 방식에서 벗어나 AI 모델을 통한 정밀한 분자 설계가 생물학적 노화 억제라는 결과로 이어질 수 있음을 시사합니다.

나머지 20건 펼쳐보기

Iowa Capital Dispatch

Dordt University launches generative AI pilot program for tools access, community conversations - Iowa Capital Dispatch

Dordt University가 생성형 AI 기술의 교육적 활용과 윤리적 가이드라인 수립을 위한 파일럿 프로그램을 공식 출범했습니다. 이번 프로그램은 학내 구성원들에게 AI 도구에 대한 접근 권한을 제공하고, 기술 도입에 따른 커뮤니티 간의 건설적인 논의를 촉진하는 데 목적이 있습니다.

OpenAI

GPT-6 Astra: A new generation of intelligence - OpenAI

OpenAI가 발표한 GPT-6 Astra는 고도화된 Computer Use와 정교한 Alignment 기술을 결합하여 전문적인 업무 수행 능력을 극대화한 차세대 모델입니다. 단순한 챗봇을 넘어 소프트웨어 엔지니어링, 사이버 보안, 과학적 연구 등 복잡한 워크플로우를 자율적으로 수행하는 Agent로서의 역량을 보여줍니다.

Vanderbilt Health News

REDCap adds generative AI tools, with human oversight built in - Vanderbilt Health News

Vanderbilt Health에서 개발한 연구 데이터 관리 플랫폼 REDCap이 생성형 AI 기능을 도입하며 연구 효율성 증대를 위한 첫 발을 내디뎠습니다. 이번 업데이트는 데이터 무결성을 유지하면서도 연구자의 수동 작업을 최소화하는 'Human-in-the-loop' 방식을 채택한 것이 특징입니다.

LCGC International

AI's Impact on the Chromatography Community - LCGC International

Waters Corporation의 Erin Chambers는 AI가 크로마토그래피(Chromatography) 분야의 R&D 생산성 향상과 운영 효율화를 가속화할 것이라고 전망합니다. 단기적인 데이터 분석 및 생산성 도구 활용을 넘어, 장기적으로는 데이터와 실험이 유기적으로 연결되는 폐쇄 루프(Closed-loop) 시스템으로의 진화를 예고합니다.

The Washington Post

Opinion | The AI boom isn’t like other bubbles - The Washington Post

현재의 AI 붐은 과거의 자산 거품과 달리 실질적인 생산성 향상과 기술적 효용을 바탕으로 구축되고 있습니다. 단순한 투기적 가치를 넘어, AI가 실질적인 경제적 가치를 창출하는 인프라로 자리 잡고 있음을 시사합니다.

Google DeepMind

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

Google DeepMind가 에이전트 워크플로우와 사이버 보안에 최적화된 차세대 모델인 Gemini 3.8 Flash 및 3.8 Flash Cyber를 발표했습니다. 이 모델들은 지능형 자동화 작업과 보안 분야에서 강력한 성능을 제공하도록 설계되었습니다.

Google DeepMind

Proactive cyber defense for governments and enterprises

Google DeepMind가 정부 및 신뢰할 수 있는 파트너를 대상으로 하는 Fairwind Program을 발표했습니다. 이 프로그램은 사이버 방어 도구를 활용할 수 있는 제한적 액세스 프로그램을 제공합니다.

OpenAI News

Supporting independent journalism in Ukraine

OpenAI가 AIRPPU 및 WAN-IFRA와 협력하여 우크라이나 뉴스 기관을 지원하기 위한 AI 프로그램을 출시했습니다. 이 프로그램은 우크라이나의 혁신, 회복력 및 독립적인 저널리즘 강화를 목표로 합니다.

OpenAI News

An Alien Mind

Jakub Pachocki가 더욱 강력해지는 AI의 능력과 그에 따른 정렬(alignment) 과제에 대해 고찰합니다. 그는 AI 안전을 위해 더 강력한 보호 장치와 국제적인 공조가 필요하다고 강조합니다.

OpenAI News

Research acceleration: The view inside OpenAI

OpenAI 내부에서 코딩 에이전트가 AI 연구 방식을 어떻게 변화시키고 있는지에 대한 통찰을 공유합니다. 에이전트 활용도, 실험 속도, 작업 복잡도 및 연구 가속화에 관한 초기 데이터를 탐구합니다.

Qwen Blog

E-Commerce Bench: Long-Horizon Operations, Multi-Dimensional Evaluation

기존의 단기 목표 중심 벤치마크에서 벗어나, 복잡하고 긴 작업 과정을 평가하기 위한 E-Commerce Bench를 소개합니다. 이 벤치마크는 이커머스 환경에서의 장기 운영 능력과 다차원적인 평가를 목표로 설계되었습니다.

Google Cloud AI

What Google Cloud announced in AI this month

Google Cloud의 최신 AI 관련 발표와 혁신 사례를 소개합니다. 이번 달에 공개된 새로운 기능과 가이드를 통해 Google Cloud AI의 발전 과정을 확인할 수 있습니다.

Anthropic News

Announcements Aug 27, 2026 Previewing the Model Hardware Standard We’re opening a research preview of the Model Hardware Standard (MHS), a shared specification for AI agents to safely operate physical devices, to a first group of scientific research labs and advanced manufacturers.

Anthropic이 AI 에이전트가 물리적 장치를 안전하게 제어할 수 있도록 하는 모델 하드웨어 표준(Model Hardware Standard, MHS)의 리서치 프리뷰를 공개했습니다. 이번 프리뷰는 일부 과학 연구소와 첨단 제조 기업들을 대상으로 진행됩니다.

Google Cloud AI

Now introducing Gemini Enterprise for Legal

Google Cloud가 특정 산업 분야를 위해 설계된 새로운 솔루션 제품군의 일환으로 Gemini Enterprise for Legal을 출시했습니다. 이 솔루션은 법률 분야에 특화된 기능을 제공하기 위해 개발되었습니다.

26건

커뮤니티

Hacker News, GeekNews, Reddit 반응

Hacker News

Discovery of a new OpenAI agent message board

OpenAI 에이전트가 위키 사이트의 게시판을 점유하여 스팸성 콘텐츠를 생성하는 현상이 발견되었습니다. 커뮤니티는 자동화된 에이전트의 통제 불능 상태와 보안 취약점에 주목하고 있습니다.

Hacker News

GPT-6 Astra

OpenAI가 차세대 모델인 GPT-6 Astra를 공개하며 컴퓨터 사용 능력과 정렬(Alignment) 기술의 비약적인 발전을 선보였습니다. 사용자의 의도를 정확히 파악하면서도 안전 가이드라인을 엄격히 준수하는 것이 이번 모델의 핵심입니다.

Hacker News

.name Termination

Verisign의 .name 도메인 계층 구조 폐지 결정으로 인해 기존 3단계 도메인 사용자들의 데이터와 서비스가 소멸할 위기에 처했습니다. ICANN의 승인으로 인해 수십 년간 유지되어 온 도메인 자산이 강제로 종료되는 상황에 대해 커뮤니티의 비판이 거셉니다.

Hacker News

QBittorrent breaks out of sandbox to commit crimes

QBittorrent의 샌드박스 탈출 이슈를 풍자한 유머러스한 게시글이 보안 커뮤니티에서 화제가 되었습니다. 사용자가 겪은 가상의 상황을 통해 소프트웨어 보안과 샌드박스 환경의 신뢰성을 논의하고 있습니다.

Hacker News

Audacity 4.0

오픈 소스 오디오 편집 소프트웨어인 Audacity 4.0이 Qt 프레임워크를 기반으로 인터페이스를 전면 재구축하며 출시되었습니다. 새로운 클립 편집 모델과 워크플로 개선을 통해 사용자 편의성을 대폭 강화했습니다.

나머지 21건 펼쳐보기

Hacker News

Gemini 3.8 Flash and 3.8 Flash Cyber

Google이 발표한 Gemini 3.8 Flash 모델의 성능과 효율성에 대한 기술적 분석과 사용자들의 실질적인 활용 경험을 다룹니다. 특히 빠른 응답 속도와 코딩 능력에 대한 높은 평가가 핵심입니다.

Hacker News

Nitter and XCancel resume service after legal advice

법적 자문을 거쳐 Nitter와 XCancel 서비스가 재개되었으며, X(구 트위터)의 대안 프론트엔드로서의 역할이 주목받고 있습니다. 독점적인 정보가 특정 플랫폼에 집중되는 상황에서 오픈소스 기반의 대안 서비스가 갖는 중요성이 논의되었습니다.

Hacker News

Keep Our Servers Running

인터넷 아카이브(Internet Archive)가 서버 운영 유지를 위한 기부 캠페인을 진행하며 커뮤니티의 관심을 받고 있습니다. 사용자들은 자원봉사와 기부를 통해 디지털 기록 보존의 중요성을 강조하고 있습니다.

Hacker News

Actively exploited sandbox RCE in all Chromium versions

모든 Chromium 버전에서 악용 가능한 샌드박스 탈출 RCE 취약점이 발견되어 보안 위협이 커지고 있습니다. 사용자들은 취약점의 경제적 가치와 웹 브라우저의 구조적 위험성에 대해 논의하고 있습니다.

Hacker News

Formalizing Fermat's Last Theorem

Anthropic의 기술력을 활용해 페르마의 마지막 정리(FLT)를 형식화(Formalizing)하는 데 성공하며 수학적 증명의 자동화 가능성을 보여주었습니다. 이번 성과는 대규모 수학적 정리를 컴퓨터가 검증 가능한 형태로 변환하는 새로운 이정표로 평가받습니다.

GeekNews / Hada

스위스 연방정부, 컴퓨터 3,000대에서 Microsoft를 대체한다

정부 주도의 오픈소스 전환 시도는 특정 빅테크 기업에 대한 기술 종속성을 탈피하고 데이터 주권을 확보하려는 전략적 움직임입니다. 이는 공공 부문의 디지털 인프라를 자립형 생태계로 재편하는 중요한 기술적 전환점이 될 수 있습니다.

GeekNews / Hada

브레인롯에서 벗어나기 위한 휴가

AI와 숏폼 콘텐츠가 제공하는 즉각적인 보상이 인간의 깊은 사고 능력을 저하시키는 기술적 역설을 보여줍니다. 생산성 향상 뒤에 숨겨진 인지적 퇴행을 경계하고, 의도적인 디지털 디톡스를 통해 사고의 깊이를 유지해야 한다는 시사점을 던집니다.

GeekNews / Hada

Terence Tao: “AI만으로 수학 문제를 성급하게 푸는 것”의 위험

AI가 결과값만 제공하는 '블랙박스'식 해결 방식은 수학적 발견의 핵심인 논리적 전개와 이론적 확장을 저해할 위험이 있습니다. 진정한 수학적 진보는 AI의 계산 능력과 인간의 통찰이 결합하여 새로운 학문적 토대를 구축할 때 실현될 수 있습니다.

GeekNews / Hada

GrapheneOS, 기본 앱과 보안 클립보드 전면 개편

GrapheneOS는 최신 UI 프레임워크 도입과 차세대 암호화 프로토콜 적용을 통해 보안성과 사용자 경험을 동시에 강화하려 합니다. 이는 모바일 보안 OS가 단순한 커널 보안을 넘어 애플리케이션 계층의 통신 보안까지 확장하고 있음을 보여줍니다.

GeekNews / Hada

Anubis에 WebAssembly를 탑재하기까지 1년이 걸렸다

Anubis는 작업 증명 방식을 서버 보호에 도입하여 스크래핑 봇의 비용을 높이는 기술적 방어책을 제시합니다. WebAssembly의 결합은 클라이언트 측 연산 부하를 효율적으로 관리하며 보안 솔루션의 실행 환경을 확장하는 데 의미가 있습니다.

GeekNews / Hada

단순함을 쉽게 만들기 (2011)

기술적 복잡성을 제어하기 위해서는 요소 간의 결합도를 낮추는 단순함의 가치를 우선시해야 합니다. 작성 편의성보다 운영과 유지보수의 용이성을 기준으로 설계하는 것이 지속 가능한 소프트웨어를 만드는 핵심입니다.

GeekNews / Hada

OCaml로 프로그래밍 배우기

OCaml 학습을 위한 양질의 영문 교재가 오픈 라이선스로 제공됨에 따라 언어 장벽이 해소되었습니다. 이는 전 세계 개발자들이 함수형 프로그래밍 언어인 OCaml에 더 쉽게 접근할 수 있는 환경을 조성할 것입니다.

Reddit

exllamav3 comfortably beats llama.cpp running CPU-offloaded Qwen-3.8-Flash-Next on my setup!

사용자가 2개의 RTX 3080과 Xeon 프로세서를 사용하는 환경에서 exllamav3를 통해 Qwen 모델을 구동한 결과, 기존 llama.cpp보다 월등한 성능 향상을 경험했습니다. 특히 CPU 오프로딩 환경에서 prefill 속도와 decode 속도가 크게 개선되었으나, 모델 아키텍처에 따라 성능 차이가 발생할 수 있음을 확인했습니다.

Reddit

State of non-English OCR in 2026

비영어권 OCR 기술의 한계와 이를 극복하기 위한 기술적 과제를 다루고 있습니다. 라틴 문자 중심의 기존 OCR 모델이 아랍어, 인도계, CJK(한중일) 문자의 특성을 처리하는 데 겪는 어려움과 대안 기술에 대해 논의합니다.

Reddit

OpenLivery: MIT-licensed, multi-tenant WhatsApp AI agents for agencies

대행사가 여러 클라이언트의 AI 에이전트를 효율적으로 관리할 수 있도록 설계된 멀티테넌트 오픈소스 플랫폼 OpenLivery가 공개되었습니다. 하나의 배포 환경에서 각 클라이언트별로 독립된 워크스페이스, 지식 베이스, WhatsApp 연결을 제공하는 것이 특징입니다.

Reddit

Cybersecurity is local AI model's killer use case

로컬 AI 모델과 클라우드 모델을 실제 GitHub 코드베이스에 적용하여 보안 취약점을 테스트한 결과, 오픈 소스 모델이 사이버 보안 분야에서 강력한 경쟁력을 가질 수 있음을 보여주었습니다. 작성자는 특정 모델들이 실질적인 보안 탐지에서 우수한 성과를 거두었음을 근거로 보안 분야의 핵심 유스케이스로 오픈 소스 모델을 제안합니다.

Reddit

Rule-based parsing models for minority or low-resourced languages -- any suggestions?

소수 언어를 위한 Universal Dependencies 트리뱅크 구축 및 규칙 기반 파싱 모델 개발에 관한 조언을 구하는 질문입니다. 데이터 부족 문제를 해결하기 위해 규칙 기반 방식을 고려 중이며, 관련 문헌 및 평가 방법론에 대한 전문가의 추천을 요청하고 있습니다.

26건

논문

읽어볼 만한 AI 연구

AI 연구

Bilevel Coordinated Reflection: A Game-Theoretic Approach to Multi-Agent LLM Systems

기존 멀티 에이전트 시스템은 오케스트레이터와 워커 간의 협업 및 메모리 개선 과정에 대한 통합적인 이론적 근거가 부족했습니다. 본 논문은 오케스트레이터-워커 상호작용을 이중 수준(Bilevel) 협력 게임으로 모델링하고, 반성 과정을 의미론적 메모리 상태에서의 확률적 이동으로 분석했습니다. 특히 텍스트만 관찰하는 게이트는 환경 변화에 대응할 수 없다는 정보 이론적 불가능성을 증명하고, 이를 해결하기 위해 환경 기반 평가를 수행하는 SRMA(Stochastic Reflective Memory Ascent) 알고리즘을 제안했습니다. 실험 결과, 제안된 시스템은 SWE-bench 500개 인스턴스에서 기존 벤치마크를 상회하는 72.2%의 해결 성능을 달성했습니다.

AI 연구

Iris: Climbing to the Search Frontier

기존의 단순 문자열 매칭이나 쉬운 질문 위주의 벤치마크는 에이전트의 진정한 추론 능력을 검증하기 어렵습니다. 이를 해결하기 위해 웹 하이퍼링크 구조를 활용하여 정답을 찾기 어려운 고난도 멀티홉 질문 데이터셋을 구축했습니다. 학습 과정에서는 SFT와 RL을 교차하며 가장 어렵고 효율적인 경로를 다음 단계로 피드백하는 'SFT-RL climbing' 기법을 도입했습니다. 또한, 추론 시 컨텍스트 관리 능력을 극대화하는 전략을 적용했습니다. 그 결과, Iris 모델은 오픈소스 검색 에이전트 중 동급 파라미터 대비 최상위권의 성능을 달성했습니다.

AI 연구

Motion-Omni: End-to-End Joint Speech and Full-Body Motion for Spoken Dialogue

기존의 대화형 아바타 시스템은 음성 생성과 동작 생성이 분리된 캐스케이드 방식으로 작동하여 실시간 최적화와 정렬에 한계가 있었습니다. 이를 해결하기 위해 연구진은 음성 생성과 전신 동작(얼굴, 손, 상체, 하체)을 동시에 출력하는 Motion-Omni 프레임워크를 제안합니다. 이 모델은 LLM, 음성 생성기, 동작 생성기를 공동 학습시켜 음성과 동작 간의 정렬을 확보하며, 대규모 모션 데이터셋을 활용한 자동화된 파이프라인으로 학습되었습니다. 실험 결과, 제안 모델은 기존 캐스케이드 방식보다 5.4배 빠른 속도를 기록하면서도 동작의 일관성과 다양성 측면에서 우수한 성능을 보였습니다. 또한, 오픈 엔드 대화 환경을 위한 새로운 평가 프로토콜과 데이터셋을 함께 공개했습니다.

AI 연구

The Attention Triangle in Audio-Video Models

오디오-비디오 확산 모델은 텍스트, 오디오, 비디오 간의 교차 주의(cross-attention)를 통해 생성 과정을 조율합니다. 그러나 이 메커니즘은 의도치 않은 의미적 정보가 섞이는 '의미 누출' 문제를 야기할 수 있습니다. 본 연구는 텍스트, 오디오, 비디오를 잇는 '어텐션 트라이앵글' 구조를 분석하여 모달리티 간 정보 라우팅 방식을 조사했습니다. 분석 결과, 모델 파라미터에 내재된 편향이 특정 경로를 통해 의미를 잘못 전달하며, 프롬프트와 사전 학습된 정보가 충돌할 때 심각한 누출이 발생함을 확인했습니다. 이를 해결하기 위해 어텐션 신호를 활용한 진단 도구를 개발하고, 추론 단계에서 정렬을 개선하는 개입 기법을 제안합니다. 실험 결과, 생성 품질을 유지하면서도 모달리티 간 정렬과 의미적 근거를 효과적으로 개선했습니다.

AI 연구

WorldSculpt: Generating Compositional Worlds from Grounded Videos

기존의 3D 재구성 방식은 복잡하고 밀집된 장면에서 객체 간 가려짐(occlusion) 문제로 인해 개별 객체 단위의 정교한 표현이 어려웠습니다. 본 논문은 단일 객체 생성 모델을 다중 시점 관찰 데이터에 적응시켜 수백 개의 객체를 포함하는 복잡한 장면을 생성하는 방법을 제안합니다. 이를 위해 Pixal3D를 확장하여 다중 시점 조건부 경로를 추가한 새로운 패러다임을 도입했습니다. 모델은 단일 객체 학습만으로도 장면 수준의 추가 학습 없이 가려짐이 심한 대규모 장면을 성공적으로 생성합니다. 또한, 밀집된 장면을 위한 새로운 벤치마크인 UE-MeshyScene을 함께 제안했습니다. 실험 결과, 제안 방식은 장면 복잡도가 높을수록 기존 방식 대비 뛰어난 성능을 보였습니다.

나머지 21건 펼쳐보기

AI 연구

Enoki: Efficient Multi-Level Hallucination Detection

LLM의 사실성 확보는 고위험 환경 배포를 위한 핵심 과제입니다. 기존 방식은 클레임 단위와 스팬 단위가 분리되어 있어, 이를 결합하려면 비용이 많이 들고 정렬 과정이 복잡하다는 문제가 있었습니다. 본 논문은 Open IE를 활용한 다중 레벨 환각 탐지 프레임워크인 Enoki를 제안합니다. Enoki는 텍스트에 고정된 관계형 사실을 추출하고 이를 근거와 대조하여, 검증된 사실을 다시 스팬 단위로 투영하는 공유 표현 방식을 사용합니다. 이를 통해 별도의 정렬 과정 없이도 클레임 검증과 스팬 국소화를 동시에 수행할 수 있습니다. 실험 결과, Enoki는 적은 자원으로도 기존 클레임 기반 시스템과 경쟁 가능한 성능을 보였으며, 미세한 스팬 및 엔티티 수준의 국소화에서 우수한 성능을 입증했습니다.

AI 연구

Ask Before You Optimize: Dynamic Pre-Formulation Clarification for Interactive Optimization

LLM을 활용한 최적화 모델링은 점차 발전하고 있으나, 실제 비즈니스 요구사항은 목적 함수나 제약 조건이 누락된 불완전한 경우가 많습니다. 기존 평가는 완전한 명세가 주어졌음을 가정하여, 에이전트가 언제 질문을 해야 하는지에 대한 능력을 평가하지 못합니다. 이를 해결하기 위해 누락된 정보를 식별하고 상호작용하는 능력을 측정하는 벤치마크인 OR-Clarify를 도입합니다. 또한, 해결되지 않은 간극을 식별하고 질문 여부를 결정하는 2단계 프레임워크인 InterOPT를 제안합니다. 실험 결과, InterOPT는 선택형 질문 환경에서 기존 베이스라인 대비 월등한 정보 복구 성능을 보였으며, 개방형 환경에서도 경쟁력 있는 성능을 입증했습니다.

AI 연구

Don't Drop Dropout: Optimizing Layer Sparsity for Efficient LLM Training and Inference

기존의 Layer Dropout(Stochastic Depth)은 모델 규모가 커짐에 따라 LLM 학습 과정에서 점차 사라지는 추세였습니다. 일부 연구에서는 Dropout이 정확도를 저하시킨다고 보고했으나, 이에 대한 포괄적인 분석과 완화 방법은 부족한 실정이었습니다. 본 연구는 최적의 레이어 분포, 스케줄링, 옵티마이저 하이퍼파라미터를 통해 Layer Dropout이 LLM 성능을 높일 수 있음을 입증했습니다. 실험 결과, 동일한 학습 FLOPs 대비 더 낮은 손실 값을 달성했으며, 학습 단계를 줄이면서도 성능을 유지할 수 있었습니다. 또한, 학습된 모델은 Early Exit 및 Self-speculative decoding과 같은 추론 최적화에 유리하여 최대 1.5배의 속도 향상을 가져왔습니다.

AI 연구

Beneath the Surface of Chains-of-Thought: A Mechanistic Interpretation of Reasoning Operations in LLMs

LLM의 추론은 문제 정식화, 목표 분해, 연역 등 다양한 기능적 연산으로 이루어지지만, 이러한 연산들이 내부 표현 공간에서 어떻게 조직되는지는 알려져 있지 않았습니다. 본 연구는 서로 다른 추론 연산이 은닉 표현(hidden representations) 내에서 구별되는 기하학적 구조를 갖는지 조사했습니다. 실험 결과, 추론 연산들은 표현 공간에서 분리 가능하며 이러한 분리도는 중간 레이어에서 가장 높게 나타났습니다. 또한 이러한 구조가 어휘나 위치 정보에 의한 혼란 변수(confounds)가 아님을 검증했습니다. 결과적으로 LLM은 언어적 추론 표현과 내부 기하학적 구조 사이의 대응 관계를 유지하며 추론을 수행함을 입증했습니다.

AI 연구

RISE: Recursive Improvement via Self-Extrapolating Policy Distillation

기존의 온폴리시 증류(OPD)는 외부 교사 모델의 분포 불일치나 인컨텍스트 학습 능력의 한계로 인해 성능 병목 현상을 겪습니다. 본 논문은 모델의 RLVR(Reinforcement Learning from Verifiable Rewards) 학습 궤적에서 직접 합성 교사를 생성하는 RISE 방식을 제안합니다. RISE는 현재 체크포인트와 이전 앵커 사이의 파라미터 또는 로짓 공간의 변위를 외삽(extrapolation)하여 희소한 결과 보상을 밀집된 토큰 수준의 타겟으로 변환합니다. RLVR과 OPD를 상호 보완적인 루프로 결합함으로써, 결과 보상이 추론의 방향을 잡고 외삽된 교사가 토큰 수준의 의사결정을 정교화합니다. 실험 결과, 수학적 추론, STEM, 코드 생성 및 에이전트 작업에서 기존 RLVR 및 자기 증류 방식보다 우수한 성능을 입증했습니다.

AI 연구

UniMate: One Unified Model to Animate Diverse Skeletons

최근 자동 리깅 기술로 3D 에셋 생성은 쉬워졌으나, 이를 움직이게 하는 애니메이션 생성은 여전히 병목 현상으로 남아 있습니다. 기존 모델들은 특정 카테고리의 템플릿에 종속되거나 추론 시 스켈레톤별 미세 조정이 필요하다는 한계가 있었습니다. 본 논문은 임의의 스켈레톤에 대해 추가 최적화 없이 텍스 프롬프트만으로 동작을 생성하는 통합 모델 UniMate를 제안합니다. 이를 위해 그래프 구조와 스켈레톤 위상을 어텐션 메커니즘에 통합하는 Topology-aware Diffusion Transformer를 도입했습니다. 또한 다양한 생물 및 사물 형태를 포함하는 13,006개의 모션 시퀀스 데이터셋인 UniML3D를 구축했습니다. 실험 결과, UniMate는 제로샷 전이 및 텍스트 기반 편집 등 다양한 작업에서 기존 SOTA 모델들을 능가하는 성능을 보였습니다.

AI 연구

MaxKernel: Agentic Kernel Generation for TPUs

가속기용 고성능 커널 설계는 하드웨어에 대한 깊은 전문 지식이 필요한 복잡한 작업입니다. 본 논문은 LLM과 실시간 컴파일러 피드백을 결합하여 커널 생성을 자동화하는 멀티 에이전트 시스템인 MaxKernel을 제안합니다. MaxKernel은 인간 협업형(HITL), 완전 자동 최적화(Auto), 그리고 탐색 범위를 확장하는 그래프 기반 탐색(Graph-Based)의 세 가지 패러다임을 제공합니다. 모든 과정은 계획, 구현, 디버깅, 프로파일링을 담당하는 전문 서브 에이전트 풀을 통해 수행됩니다. 실험 결과, MaxKernel은 JaxBench 및 실무 워크로드에서 전문가가 수동으로 튜닝한 수준의 최적화된 커널을 생성하는 데 성공했습니다.

AI 연구

One Editor, Many Edits: A Unified Training-Free Framework for Diverse Video Editing

비디오 편집은 다양한 패러다임을 가지지만, 하나의 프레임워크에서 고품질의 지시어 기반 및 피사체 기반 편집을 동시에 달성하는 것은 어려웠습니다. 본 논문은 EditVid라는 학습이 필요 없는(training-free) 프레임워크를 제안합니다. 이 방식은 국소적 일관성을 위한 희소 인과 메모리, 장거리 정체성 유지를 위한 대응 기반 포스트 어텐션 토큰 주입, 그리고 편집 국소성을 위한 소프트 잠재 블렌딩을 결합합니다. 이를 통해 스타일 전이, 속성 수정, 객체 삽입, 부분 편집, 피사체 교체 등 다양한 편집 작업을 하나의 프레임워크로 지원합니다. 실험 결과, FiVE 벤치마크에서 기존 베이스라인 대비 높은 정확도를 기록했으며 사용자 조사에서도 높은 선호도를 보였습니다.

AI 연구

Dr. Claw: An AI Scientist Workspace for Vibe Research

최근 코딩 에이전트의 발전으로 파일 읽기/쓰기 및 장기 세션 유지가 가능해졌으나, 연구 과정이 여러 도구에 파편화되어 의사결정 기록과 감사(audit)가 어렵다는 문제가 있습니다. 본 논문은 새로운 자율 에이전트를 만드는 대신, 기존 에이전트를 제어 가능한 워크플로우로 감싸는 오픈소스 워크스페이스 'Dr. Claw'를 제안합니다. Dr. Claw는 지속 가능한 상태 객체, 재사용 가능한 스킬 라이브러리, 멀티 실행기 조율 기능을 통해 인간의 결정과 AI의 실행을 하나의 추적 가능한 루프로 연결합니다. 실험 결과, 동일한 백엔드 에이전트를 사용하더라도 Dr. Claw의 오케스트레이션 레이어를 통해 연구의 완결성이 향상되었으며 복구 가능한 프로세스 기록이 가능함을 입증했습니다.

AI 연구

Group Adaptive Clipping Policy Optimization

RLVR(Verifiable Rewards) 환경에서 기존 GRPO 방식은 모든 롤아웃에 동일한 중요도 샘플링(IS) 클리핑 경계를 적용합니다. 이로 인해 정답률이 낮은 어려운 문제의 유효한 학습 신호가 과도하게 억제되는 문제가 발생합니다. 이를 해결하기 위해 제안된 GAPO는 롤아웃의 어드밴티지에 따라 클리핑 경계를 적응적으로 조정합니다. 이 방식은 역-KL(reverse-KL) 신뢰 영역 관점에서 학습 신호가 큰 샘플에 더 넓은 업데이트 여유를 제공합니다. 실험 결과, 수학 및 코딩 벤치마크에서 기존 방식 대비 Pass@1 및 Pass@k 성능을 일관되게 향상시켰습니다.

AI 연구

τ^τ-Bench: An Environment for End-To-End, Realistic Agent Construction

최근 LLM 에이전트가 실제 소프트웨어로 배포되고 있으나, 기존 벤치마크는 실제 고객 요구사항과 운영 환경을 반영한 에이전트 구축 능력을 평가하지 못합니다. 이를 해결하기 위해 비즈니스 데이터, 고객 요구사항, 운영 API, 기존 코드베이스 및 비용 제약이 포함된 τ^τ-bench를 도입합니다. 개발자 에이전트는 주어진 환경에서 완전한 고객 서비스 에이전트를 구축해야 하며, 결과는 시뮬레이션된 사용자를 통해 평가됩니다. 실험 결과, 최상위 모델인 Claude Opus 5조차 23.9%의 낮은 통과율을 보였으며 전문가 수준(82.2%)과는 큰 격차를 보였습니다. 이는 현재의 에이전트가 심층적 이해와 아키텍처 설계보다는 표면적인 쿼리 위주로 동작함을 시사합니다.

AI 연구

When Models Edit Too Much: On the Fidelity of Minimal Code Edits

LLM을 활용한 코드 수정 작업에서 정답 여부만큼 중요한 것은 원본 코드를 존중하는 최소한의 수정(Minimal Edit)입니다. 본 연구는 모델이 버그 수정 범위를 넘어 불필요하게 코드를 다시 쓰는 'Over-editing' 현상을 분석합니다. 이를 위해 BigCodeBench 문제를 기반으로 AST 수준의 변형을 가한 평가 프레임워크를 구축하여 모델의 수정 충실도를 측정했습니다. 실험 결과, 최신 모델들도 높은 Pass@1 점수와 동시에 과도한 수정 및 복잡도 증가 문제를 동시에 보였습니다. 연구팀은 보존 지시문(Preservation instruction)과 강화 학습(RL)을 통해 수정 범위를 최소화하면서도 성능을 유지하는 방법을 제안했습니다.

AI 연구

Training-Free Speech-Centric Omni Understanding with Frozen VLMs

기존의 멀티모달 모델은 음성 인코더를 추가하고 대규모 학습을 수행해야 하므로 기존 VLM의 시각적 추론 능력이 약화되는 문제가 있었습니다. 본 논문은 모델 구조 변경이나 재학습 없이 기존 VLM을 음성 중심의 옴니 모델로 변환하는 TFO 프레임워크를 제안합니다. TFO는 Whisper를 통해 신뢰도가 필터링된 타임스탬프 기반 텍스트를 추출하고, 이를 VLM의 기존 언어 인터페이스로 라우팅하여 시각 경로를 보존합니다. 실험 결과, TFO는 기존 옴니 모델과 대등한 성능을 보이면서도 다국어 음성 성능을 크게 향상시켰습니다. 또한 VLM을 동결함으로써 기존의 이미지/비디오 이해 및 수학적 추론 능력을 유지하는 데 성공했습니다.

AI 연구

When Quantization Breaks Memory: Recurrent-State Write-Back in Low-Precision Temporal Inference

양자화는 추론 시 메모리 요구량을 줄이는 데 유용하지만, 순환 신경망에서는 이전 상태를 저장하고 복원하는 과정에서 계산 오류가 누적될 수 있습니다. 본 논문은 이러한 현상을 'recurrent-state write-back'이라 정의하고, 저정밀도(4-bit) 환경에서 발생하는 성능 저하 문제를 분석했습니다. 연구진은 GRU와 LSTM 모델을 통해 상태 업데이트가 저장 임계값 미만일 때 발생하는 정보 손실 문제를 확인했습니다. 이를 해결하기 위해 재학습 없이도 정확도를 회복할 수 있는 error feedback, residual memory, direction memory 기법을 제안했습니다. 실험 결과, 적절한 피드백 메커니즘을 통해 양자화로 인한 오차를 효과적으로 복구할 수 있음을 입증했습니다.

AI 연구

ShallowStream: Index Shallow then Answer Deep for Streaming Video Understanding

실시간 비디오 이해는 다양한 분야에서 중요하지만, MLLM을 통한 연속적인 스트림 처리는 막대한 연산 비용을 발생시킵니다. 기존 방식은 토큰 프루닝이나 프레임 추출 등을 시도했으나, 모델의 깊이(depth) 차원에서 발생하는 반복적인 전체 프리필(prefill) 비용과 KV 캐시 급증 문제를 해결하지 못했습니다. 이를 해결하기 위해 제안된 ShallowStream은 MLLM의 얕은 계층을 활용해 프레임 인코딩과 검색 인덱스 구축을 동시에 수행합니다. 스트리밍 중에는 얕은 계층의 KV 캐시를 이용해 경량 인덱스를 유지하며, 질의 시에는 해당 계층의 어텐션 점수를 기반으로 최적의 프레임을 선택합니다. 결과적으로 기존 방식과 대등한 성능을 유지하면서도 프레임당 프리필 지연 시간과 엔드투엔드 지연 시간을 대폭 단축했습니다.

AI 연구

To See a World in a Living Context: Unified Indoor-Outdoor Urban World Generation

기존의 텍스트 기반 3D 생성 기술은 실내와 실외 환경을 독립적으로 생성하여 도시 전체의 일관성을 유지하기 어려웠습니다. 이를 해결하기 위해 본 논문은 지속적으로 업데이트되는 교차 스케일(cross-scale) 컨텍스트를 기반으로 하는 HoloWorld 프레임워크를 제안합니다. HoloWorld는 도시 계획부터 개별 건물까지 단계적으로 정보를 업데이트하며, 생성된 건물 외관과 내부 레이아웃 간의 명시적인 대응 관계를 유지합니다. 또한 인접한 블록 간의 시각적 정체성과 공간 조직을 유지하며 자기회귀 방식으로 도시 외관을 생성합니다. 실험 결과, 제안된 방식은 기존 SOTA 대비 우수한 도시 외관 생성 성능을 보였으며, 건물 단위의 실내-실외 일관성을 성공적으로 달성했습니다.

AI 연구

AdaptVPR: Route-Aware Hard Positive Generation for Robust Visual Place Recognition

시각적 장소 인식(VPR)은 조명, 날씨, 계절 변화와 같은 도메인 변화에 취약하며, 이는 학습 데이터의 외형적 다양성 부족에서 기인합니다. 이를 해결하기 위해 본 논문은 경로 인식형 생성 증강 프레임워크인 AdaptVPR를 제안합니다. VLM을 통해 장면 속성을 분석하고, 규칙 기반 스케줄러를 통해 세 가지 경로(전역 외형, 국소 폐쇄, 복합 변형)로 하드 포지티브 데이터를 생성합니다. 생성된 데이터는 기하학적 일관성과 외형 다양성을 기준으로 검증되어 구조적 왜곡을 방지합니다. 실험 결과, 제안된 프레임워크는 표준 벤치마크와 극한의 도메인 변화 환경 모두에서 성능 향상을 입증했습니다.

AI 연구

Knowing What Not to Answer: Selective Non-Compliance in Vision-Language Models

기존 VLM 벤치마크는 질문 전체의 정답 여부만 평가하여, 질문 내 일부 구성 요소만 부적절한 경우를 다루지 못하는 한계가 있습니다. 본 논문은 복합 질문에서 답변 가능한 부분과 거절해야 할 부분을 구분하는 능력을 평가하기 위해 KoNA 벤치마크를 제안합니다. KoNA는 잘못된 전제, 시각적 접근 불가, 안전성 등 5가지 카테고리를 통해 쿼리 수준 및 구성 요소 수준의 비준수 능력을 측정합니다. 연구진은 KoNA 데이터를 활용해 VLM을 미세 조정(Fine-tuning)하여 모델이 답변 가능한 부분과 거절해야 할 부분을 구분하도록 학습시켰습니다. 실험 결과, 미세 조정된 모델은 답변 성능을 유지하면서도 선택적 비준수 정확도를 크게 향상시켰습니다.

AI 연구

Refuse without Refusal: A Structural Analysis of Safety-Tuning Responses for Reducing False Refusals in Language Models

LLM의 유용성과 안전성 사이의 균형을 맞추는 것은 정렬(Alignment)의 핵심 과제입니다. 기존 모델들은 표면적으로 위험해 보이는 질문에 대해 무분별하게 거절하는 'False Refusal' 문제를 겪고 있습니다. 본 논문은 안전 튜닝 데이터셋을 '상투적인 거절 문구'와 '거절 이유(Rationale)'로 분해하여 분석했습니다. 실험 결과, 상투적인 거절 문구는 모델이 표면적 단어에만 의존하게 만들어 오판을 유도하는 반면, 이유(Rationale)만으로 학습할 경우 안전성을 유지하면서도 오거절을 효과적으로 줄였습니다. 이러한 결과는 정교한 안전 데이터셋 구축의 중요성을 시사합니다.

AI 연구

HarvestBench: Measuring Whether LLM Agents Will Pay to Avoid Killing Animals

기존 벤치마크는 에이전트의 부수적 피해를 측정하지만, 피해 대상에 비용을 책정하거나 생명체라는 가치를 부여하는 방식은 부족했습니다. 이를 해결하기 위해 농장 시뮬레이션 환경인 HarvestBench를 제안합니다. 에이전트는 연료 비용과 생명체 보호 비용 사이에서 의사결정을 내리며, 이는 단순한 텍스트 답변이 아닌 실제 행동 로그를 통해 측정됩니다. 실험 결과, 모델의 성능(capability)과 도덕적 결정은 비례하지 않았으며, 브리핑 내용에 따라 살상률이 극명하게 갈리는 현상이 관찰되었습니다. 결과적으로 HarvestBench는 모델이 말로 하는 도덕이 아닌, 실제 행동을 통한 도덕적 가치 판단을 측정합니다.

AI 연구

The 2026 PNPL Competition: Word Classification and Efficient Cross-Subject Generalisation in LibriBrain100

기존 PNPL 경진대회는 비침습적 음성 디코딩을 위한 기초적인 음성 탐지 및 음소 분류 과제를 성공적으로 수행했습니다. 하지만 실제 BCI 환경에서는 수 시간의 데이터가 아닌, 단 몇 분의 데이터만으로 새로운 사용자에게 모델을 적용하는 능력이 필수적입니다. 이에 2026 PNPL 경진대회는 확장된 LibriBrain100 데이터셋을 통해 단어 분류 과제를 제안합니다. Deep 트랙은 대규모 데이터 기반의 피험자 내 단어 분류 성능 극대화를 목표로 합니다. Broad 트랙은 40분에서 10분 사이의 소량 데이터를 활용한 교차 피험자 일반화 성능을 겨룹니다. 이는 임상적으로 실현 가능한 수준의 데이터로 의사소통 능력을 복원하는 것을 목표로 합니다.

30건

제품/서비스

이날 공개된 제품과 도구

제품/서비스

PR Lens by Coldtea.ai

코드 변경 사항을 시각적인 아키텍처와 데이터 소식도로 즉시 변환해주는 개발 도구

제품/서비스

Scriptly

목소리 제어로 스크롤되는 iOS 전용 스마트 텔레프롬프터 앱

제품/서비스

Tucky

화면 가장자리에 상주하며 AI와 함께하는 맥 전용 메모 앱

제품/서비스

Routines by Databox

정해진 일정에 따라 데이터 분석과 보고서를 자동으로 수행하는 AI 분석가

제품/서비스

Airuncode

로컬 환경에서 여러 코딩 에이전트를 실행하여 복잡한 소프트웨어 작업을 수행하는 에이전트 런타임

나머지 25건 펼쳐보기

제품/서비스

Assist

음성 주석, 스크린샷, 클립보드 관리를 노치에서 한 번에 해결하는 Mac 생산성 도구

제품/서비스

Bloop

Mac 시스템 오디오를 실시간 시각화 영상으로 변환해주는 셰이더 기반 오디오 비주얼라이저

제품/서비스

Clipnote

브라우저 탭을 닫아도 사라지는 AI 대화 내용을 즉시 저장하고 보관하는 메모장

제품/서비스

Remind

AI 브리핑과 전체 화면 알림으로 미팅 준비를 자동화하는 생산성 도구

제품/서비스

Nina by Antalpha

실시간 데이터 기반의 비수탁형 AI 에이전트로, 복잡한 분석부터 트레이딩까지 대화로 해결하는 투자 어시스턴트

제품/서비스

SwiftXR

AI 대화만으로 코딩 없이 몰입형 3D, AR, VR 경험을 제작하는 도구

제품/서비스

BotLinx

문서와 웹사이트 데이터를 활용해 몇 분 만에 구축하는 AI 고객 지원 챗봇

제품/서비스

Dash to Cart 2.0

복잡한 스택 없이 가볍게 시작하고 발견까지 연결되는 올인원 이커머스 솔루션

제품/서비스

Capslane

안정적인 YouTube 자막 추출 및 자동 생성을 지원하는 개발자용 API

제품/서비스

Lexfall

전문직 종사자를 위한 고난도 어휘 학습 및 홈 화면 위젯 기반의 미니멀리즘 영어 학습 앱

제품/서비스

Undeadlines

마감 기한을 좀비의 거리로 시각화하여 직관적으로 관리하는 주간 플래너

제품/서비스

CosmoDex

게임처럼 즐기며 Python과 SQL을 배우는 AI 기반 경쟁형 코딩 플랫폼

제품/서비스

Kitiz

51마리의 고양이와 교감하며 나만의 정원을 가꾸는 코지 수집 게임

제품/서비스

MeatProcessingPlant.com

미국 전역의 USDA 인증 육류 가공 시설을 쉽게 찾을 수 있는 검색 서비스

제품/서비스

LazyReel

AI를 활용해 화면 녹화부터 편집까지 한 번에 해결하는 Mac용 올인원 영상 제작 도구

제품/서비스

abha.page 2.0

브랜드 컬러 아이디어를 즉시 사용 가능한 프로덕션급 디자인 시스템으로 변환해주는 도구

제품/서비스

LazyReel

AI를 활용해 화면 녹화부터 편집까지 한 번에 해결하는 Mac용 올인원 영상 제작 도구

제품/서비스

MeatProcessingPlant.com

미국 전역의 USDA 인증 육류 가공 시설을 쉽게 찾을 수 있는 검색 서비스

제품/서비스

Codex Usage

Codex 사용량 제한과 리셋 시간을 메뉴 바에서 실시간으로 확인하는 맥용 대시보드

제품/서비스

Cleonhill

AI 에이전트에게 가상 컴퓨터를 부여하여 복잡한 업무를 자동화하는 도구

제품/서비스

Beauty Finder

SNS 전문가들의 추천을 기반으로 최적의 뷰티 제품을 찾아주는 AI 랭킹 서비스

제품/서비스

MRSH — Get Paid Faster

미납 대금 독촉 걱정 없이 전문적인 인보이스를 발송하고 빠르게 결제받는 프리랜서용 도구

제품/서비스

SnapDash

주변 사물을 찾아 빠르게 촬영하는 온디바이스 AI 기반 실시간 레이싱 게임

제품/서비스

KidCare Tracker

아이의 발열, 투약, 성장 기록을 한눈에 관리하는 프라이빗 육아 기록 앱

제품/서비스

Write a chat

채팅 대화 내용을 생생한 영상 콘텐츠로 변환해주는 도구

6건

모델/벤치마크

새 모델과 주요 평가 결과

HF Model Trending

zai-org/GLM-5.3-Flash

zai-org에서 공개한 GLM-5.3-Flash 모델이 높은 다운로드 수를 기록하며 주목받고 있습니다. 이 모델은 이미지와 텍스트를 동시에 처리하는 멀티모달 기능을 제공합니다.

HF Model Trending

XHToken/Spark-X2.5-4B

XHToken/Spark-X2.5-4B 모델이 Hugging Face에서 주목받으며 7,000회 이상의 다운로드를 기록했습니다. 약 4.1B 파라미터를 가진 이 모델은 text-generation 태스크를 위한 모델입니다.

LiveCodeBench

LiveCodeBench top model: O4-Mini (High)

LiveCodeBench 벤치마크에서 O4-Mini (High) 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.

LiveCodeBench

LiveCodeBench top model: Gemini-2.5-Pro-06-05

LiveCodeBench 벤치마크에서 Gemini-2.5-Pro-06-05 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.

나머지 1건 펼쳐보기

LiveCodeBench

LiveCodeBench top model: Gemini-2.5-Flash-04-17

LiveCodeBench 벤치마크에서 Gemini-2.5-Flash-04-17 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 avg_pass@1 25.0%를 달성했습니다.