지난 소식

2026.09.03

이날 수집한 AI·테크 소식을 분야별로 다시 볼 수 있습니다. 제목을 누르면 원문으로 이동합니다.

23건

뉴스

주요 기사와 기업의 공식 발표

NBC New York

Mamdani bans AI in NYC public schools for students through 8th grade - NBC New York

뉴욕시 교육청이 초·중등 학생(8학년 이하)의 생성형 AI 사용을 1년간 일시 중단하는 강력한 규제 정책을 발표했습니다. 이는 기술적 안전성과 교육적 가치를 검토하기 위한 조치로, 고등학생에게는 AI 리터러시 교육을 제공하는 이원화된 접근 방식을 취합니다.

abc7ny.com

NYC schools ban AI for students through 8th grade under sweeping new policy - abc7ny.com

뉴욕시 교육청이 2026-27 학년도부터 초등(2-K)부터 중등(8학년) 학생들의 생성형 AI 사용을 1년간 금지하는 전면적인 정책을 발표했습니다. 이번 조치는 기술적 검증과 교육적 영향을 분석하기 위한 모라토리엄(Moratorium, 일시적 중단) 성격을 띠며, 고등학생에게는 AI 리터러시 교육을 제공하는 이원화된 전략을 취합니다.

NBC News

Mamdani expected to announce AI ban in NYC schools for young students - NBC News

뉴욕시 교육청이 초등학생의 AI 사용을 제한하고 고등학교 진학 전까지 약 60만 명의 학생에 대해 AI 사용을 1년간 유예하는 강력한 규제 정책을 발표할 예정입니다. 이번 정책은 기술적 도구보다 인간 중심의 교육적 가치를 우선시하며, 학생의 연령별 스크린 타임과 기기 사용을 엄격히 통제하는 데 초점을 맞추고 있습니다.

나머지 18건 펼쳐보기

CBS News

Meta says AI glasses fix stops users from secretly recording others - CBS News

Meta가 AI 스마트 글래스의 무단 촬영 문제를 해결하기 위해 LED 조작 방지 보안 업데이트를 실시했습니다. 사용자가 촬영 중 LED를 가려 신호를 차단하는 행위를 감지하면 카메라 기능이 자동으로 비활성화되는 메커니즘을 도입했습니다.

Axios

Trump's AI team fractures over strategy against G20 backdrop - Axios

트럼프 행정부의 AI 전략팀 내에서 G20 국가들과의 경쟁 구도를 둘러싼 전략적 이견이 발생하며 정책 방향성이 분열되고 있습니다. 미국의 AI 패권을 유지하기 위한 규제 완화와 기술적 우위 확보 사이의 갈등이 핵심 쟁점입니다.

Spectrum News NY1

New York City bans AI use in schools through eighth grade - Spectrum News NY1

뉴욕시 교육 당국은 초등 및 중등 교육 과정(2K-8학년)에서 학생 대상 Generative AI 및 챗봇 사용을 전면 금지하는 새로운 교육 정책을 발표했습니다. 이번 조치는 기술적 편익보다 학생의 사고력 보호와 스크린 타임 제한에 초점을 맞추고 있으며, 고등학교 단계에서만 제한적인 AI 리터러시 교육과 파일럿 프로그램을 운영할 방침입니다.

Google DeepMind

Introducing Gemini 3.8 Flash and 3.8 Flash Cyber

Google DeepMind가 에이전트 워크플로우와 사이버 보안에 최적화된 차세대 모델인 Gemini 3.8 Flash 및 3.8 Flash Cyber를 발표했습니다. 이 모델들은 지능형 자동화 작업과 보안 분야에서 강력한 성능을 제공하도록 설계되었습니다.

Google DeepMind

Proactive cyber defense for governments and enterprises

Google DeepMind가 정부 및 신뢰할 수 있는 파트너를 대상으로 하는 Fairwind Program을 발표했습니다. 이 프로그램은 사이버 방어 도구를 활용할 수 있는 제한적 액세스 프로그램을 제공합니다.

Google DeepMind

Introducing agentic video understanding with Gemini

Google DeepMind가 최신 Gemini 모델에 에이전트 방식의 비디오 이해(agentic video understanding) 기능을 도입했습니다. 이를 통해 비디오 분석의 정확도를 높이면서도 비용과 토큰 사용량을 절감할 수 있습니다.

OpenAI News

How AI-native companies turn workflows into operating capability

AI-native 기업들이 AI 에이전트를 활용하여 워크플로우를 운영 역량으로 전환하는 방법을 다룹니다. Basis, Clay, Exa Labs의 사례를 통해 온보딩, 계정 관리, 개발자 통합 프로세스를 개선하는 방식을 살펴봅니다.

Google Cloud AI

What Google Cloud announced in AI this month

Google Cloud의 최신 AI 관련 발표와 혁신 사례를 소개합니다. 이번 달에 공개된 새로운 기능과 가이드를 통해 Google Cloud AI의 발전 과정을 확인할 수 있습니다.

Anthropic News

Aug 31, 2026 Improving our alignment and security efforts

Anthropic이 모델의 정렬(alignment) 및 보안 역량을 강화하기 위한 새로운 조치를 발표했습니다. 이번 업데이트는 더욱 안전하고 신뢰할 수 있는 AI 시스템을 구축하는 데 중점을 두고 있습니다.

Anthropic News

Announcements Aug 27, 2026 Previewing the Model Hardware Standard We’re opening a research preview of the Model Hardware Standard (MHS), a shared specification for AI agents to safely operate physical devices, to a first group of scientific research labs and advanced manufacturers.

Anthropic이 AI 에이전트가 물리적 장치를 안전하게 제어할 수 있도록 하는 모델 하드웨어 표준(Model Hardware Standard, MHS)의 리서치 프리뷰를 공개했습니다. 이번 프리뷰는 일부 과학 연구소와 첨단 제조 기업들을 대상으로 진행됩니다.

Google Cloud AI

Now introducing Gemini Enterprise for Legal

Google Cloud가 특정 산업 분야를 위해 설계된 새로운 솔루션 제품군의 일환으로 Gemini Enterprise for Legal을 출시했습니다. 이 솔루션은 법률 분야에 특화된 기능을 제공하기 위해 개발되었습니다.

24건

커뮤니티

Hacker News, GeekNews, Reddit 반응

Hacker News

Creepy Crawlies

LLM 학습을 위한 크롤러가 오픈소스 저장소의 리소스를 과도하게 점유하는 문제와 그로 인한 인프라 부하를 다룹니다. 데이터 오염을 피하기 위해 순수 코드를 확보하려는 AI 모델의 수요가 서버 운영에 심각한 비용을 발생시키고 있습니다.

Hacker News

Claude Fable 5.1 and Claude Mythos 5.1

Anthropic이 코딩과 지식 작업에 최적화된 신규 모델인 Claude Fable 5.1과 Claude Mythos 5.1을 발표했습니다. 비용 절감과 데이터 프라이버시 강화를 핵심 가치로 내세우며, 특히 보안과 생명과학 분야를 위한 특화 모델을 함께 공개했습니다.

Hacker News

“I just chose words carefully”

고정 폭(Monospace) 글꼴 환경에서 텍스트 정렬 문제를 해결하기 위해 단어 선택을 정교하게 조절한 독특한 타이포그래피 사례를 소개합니다. 기술적 도구 대신 언어적 정밀함을 통해 시각적 완성도를 높인 방식이 커뮤니티의 관심을 끌고 있습니다.

Hacker News

Hang on to Your Firefox

브라우저 엔진의 다양성을 유지하기 위해 Firefox를 지지해야 한다는 주장이 제기되었습니다. 구글 크롬 독점 체제에서 벗어나 웹 생태계의 경쟁력을 유지하는 것이 핵심 과제입니다.

Hacker News

AnkiDroid: Google Play no longer allowing Open Collective donation link

Google Play의 결제 정책 변화로 인해 1,000만 명 이상의 사용자를 보유한 Open Source 앱 AnkiDroid가 스토어 퇴출 위기에 처했습니다. Google이 501(c)(6) 면세 단체에 대한 기부 링크를 정책 위반으로 간주하면서 발생한 갈등입니다.

나머지 19건 펼쳐보기

Hacker News

How accurate have Ed Zitron's AI skeptic predictions been?

AI 회의론자 Ed Zitron의 예측 적중 여부를 두고 기술적 실현 가능성과 비즈니스 모델의 지속 가능성을 검토하는 논의입니다. AI 기업들의 막대한 인프라 비용 대비 수익 모델이 불투명하다는 점이 핵심 쟁점입니다.

Hacker News

Fastpotify

Spotify의 무거운 성능과 UI 문제를 해결하기 위해 개발된 경량 플레이어 Fastpotify에 대한 기술적 특징과 사용자 반응을 다룹니다. 기존 소프트웨어의 복잡함 대신 가벼운 실행 환경을 지향하는 도구에 대한 커뮤니티의 평가를 담고 있습니다.

Hacker News

Playa Phone

Playa Phone이라는 새로운 하드웨어 프로젝트가 공개되어 커뮤니티의 관심을 받고 있습니다. 개발자가 직접 참여하여 기술적 질문에 답하며 프로젝트의 배경을 공유하고 있습니다.

Hacker News

I trained a small transformer in 1.5hrs and it beats many LLMs

단 1.5시간 만에 학습시킨 소형 Transformer 모델이 기존 LLM 성능을 상회하는 효율성을 보여주며 주목받고 있습니다. 데이터 효율성과 모델 아키텍처 최적화가 성능 향상의 핵심임을 시사합니다.

Hacker News

A Note from LWN

기술 전문 매체 LWN의 운영 방향과 구독 모델 변화에 대한 소식을 다루고 있습니다. 독자들은 오랜 시간 신뢰를 쌓아온 LWN의 전문성과 지속 가능한 운영 모델에 대해 높은 관심을 보이고 있습니다.

GeekNews / Hada

Gemini 3.8 Flash와 보안 특화 모델 Flash Cyber 공개

이번 모델 출시는 특정 작업 목적에 맞춘 초경량·고효율 모델의 세분화 전략을 보여줍니다. 코딩과 보안이라는 실무적 요구사항을 반영하여 AI 에이전트 시대의 기술적 토대를 마련했습니다.

GeekNews / Hada

실제 실업률

공식 실업률과 실제 체감되는 기능적 실업 사이의 거대한 격차를 통해 노동 시장의 질적 저하를 보여줍니다. 단순한 일자리 유무를 넘어 소득과 노동 시간의 적정성을 기준으로 경제적 자립 능력을 평가하는 것이 핵심입니다.

GeekNews / Hada

LWN 구독료 20% 인상 안내

광고 수익 의존도를 낮추고 콘텐츠의 독립성을 확보하려는 구독 모델이 물가 상승이라는 경제적 압박에 직면했습니다. 이는 전문 기술 매체가 지속 가능한 운영을 위해 수익 구조를 현실화하는 과정에서 발생하는 필수적인 선택입니다.

GeekNews / Hada

FBI, 운전면허증 1억 5,300만 건 이상 판매한 서비스 수사

대규모 신분증 데이터 유출은 단순한 정보 유출을 넘어 디지털 신원 도용 범죄의 핵심 자산이 될 수 있습니다. 이번 사건은 신분증 스캔 데이터를 관리하는 서비스의 보안 취약점이 국가적 차원의 개인정보 유출로 이어질 수 있음을 시사합니다.

GeekNews / Hada

Ambient CSS v3 – Blender와 CSS의 만남

Blender의 물리적 조명 연산 방식을 CSS 환경에 이식하여 웹 요소에 깊이감을 부여하는 기술적 시도입니다. 단순한 그래픽 효과를 넘어 수학적 모델을 통해 웹 UI의 입체적 표현 방식을 새롭게 정의합니다.

GeekNews / Hada

Zuzai, AI를 쓰지 않았음을 나타내는 새로운 단어

AI 기술의 보편화로 인해 역설적으로 인간의 순수 창작물을 구분하려는 새로운 언어적 시도가 나타나고 있습니다. 이는 기술적 도구의 사용 여부가 콘텐츠의 가치를 판단하는 중요한 척도가 되었음을 시사합니다.

GeekNews / Hada

클릭하우스(ClickHouse) – 기적의 데이터베이스 기술

이 글은 인덱스 기반의 전통적 RDBMS가 가진 분석 성능의 한계를 열 지향 데이터베이스 기술로 해결하는 과정을 보여줍니다. 대규모 데이터 집계 작업에서 스토리지 구조와 연산 방식의 차이가 성능 격차를 어떻게 만드는지 기술적 통찰을 제공합니다.

Reddit

Mac Heads: Is there any point to MLX in September 2026?

Apple M5 Pro 환경에서 Qwen 27B 모델을 테스트한 결과, llama.cpp의 Metal 지원 강화로 인해 MLX를 사용하던 기존 방식보다 GGUF 모델의 성능이 대등하거나 더 우수하게 나타나고 있습니다. 작성자는 향후 MLX 프레임워크를 계속 사용할 이유가 있는지 의문을 제기하며 성능 최적화에 대한 의견을 구하고 있습니다.

Reddit

SenseNova-Vision: the 50M instruction corpus is open too, not just the weights

새로운 7B 비전 모델인 SenseNova-Vision이 공개되었으며, 모델 가중치뿐만 아니라 5천만 개의 인스트럭션-응답 코퍼스와 데이터 준비 파이프라인이 함께 공개되었습니다. 이번 릴리스는 데이터셋의 투명성과 재사용성을 높였다는 점에서 주목받고 있습니다.

26건

논문

읽어볼 만한 AI 연구

AI 연구

StudentSim: Training LLM-based Student Simulators

AI 튜터가 학생 맞춤형 교육을 제공하려면 학생의 반응 데이터를 수집해야 하지만, 실제 학습자를 대상으로 하는 것은 비용과 시간이 많이 듭니다. 기존의 상태 추적 모델은 설명 처리가 어렵고, LLM 역할극은 학생의 역량을 정확히 모사하지 못하는 한계가 있었습니다. 본 논문은 소량의 학생 데이터를 활용해 개별화된 시뮬레이터를 만드는 StudentSim 프레임워크를 제안합니다. 이 방식은 풀링된 학습 후 개별 학생에 맞게 특화되는 과정을 거쳐, 학생의 응답을 모사함과 동시에 튜터의 가이드에 따라 지식이 업데이트되도록 합니다. 실험 결과, StudentSim은 체스, 영어, 수학 등 다양한 도메인에서 GPT-5.4를 포함한 기존 모델보다 높은 행동 충실도와 가이드 반응성을 기록했습니다. 최종적으로 StudentSim을 보상 모델로 사용했을 때, 인간 전문가로부터 더 정확하고 개인화된 튜터가 생성됨을 입증했습니다.

AI 연구

Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

자율주행 분야에서 범용적인 시각-언어 이해와 정밀한 주행 제어를 동시에 달성하는 것이 과제로 남아있습니다. 본 논문은 사전 학습된 VLM 아키텍처를 유지하면서 3D 인지, VQA, 모션 플래닝을 하나의 프레임워크로 통합한 Qwen-Drive-1.0을 제안합니다. 외부 BEV 인지 헤드를 통해 3D 객체 탐지 및 세그멘테이션을 수행하며, 플래닝 전문가 모듈이 공유된 VLM 표현을 바탕으로 미래 궤적을 생성합니다. 단계별 학습 방식을 통해 일반적인 시각 이해 능력과 주행 특화 역량을 동시에 확보했습니다. 실험 결과, 강력한 3D 인지 및 장면 이해 능력을 보여주었으며 다양한 루프 환경에서 경쟁력 있는 모션 플래닝 성능을 입증했습니다.

AI 연구

SMELT: Scaling Laws for Compute-Matched MoE Looped Transformers

기존의 Looped Transformer 연구는 모델 크기를 고정하여 아키텍처의 이점과 추가 연산량 사이의 변수를 명확히 구분하지 못하는 문제가 있었습니다. 본 논문은 MoE 구조에서 토큰당 FLOPs, 파라미터 수, KV 캐시를 엄격히 일치시킨 상태에서 루핑 효과를 연구했습니다. 연구진은 중간 레이어 절반을 두 번 반복하는 SMELT(Sparse MoE Transformer, middle layers Loop Twice) 기법을 제안했습니다. 실험 결과, SMELT는 동일한 연산 예산 내에서 베이스라인보다 낮은 손실(loss)을 기록하며 효율적인 스케일링 법칙을 보여주었습니다. 특히 코드 생성 및 긴 문맥 처리에서 강점을 보였으며, 두 번째 루프가 어텐션 싱크를 줄이고 콘텐츠 관련 토큰에 집중하게 만드는 효과가 있음을 확인했습니다.

AI 연구

UI-Venus-2 Technical Report

기존의 멀티모달 GUI 에이전트는 벤치마크 중심의 모델로 인해 실제 환경에서의 환경 커버리지 부족, 취약한 작업 구성, 신뢰할 수 없는 보상 검증 문제로 실무 적용에 한계가 있었습니다. 본 논문에서는 모바일, 웹, 데스크톱 환경에서 작동하는 범용 GUI 파운데이션 에이전트인 UI-Venus-2를 제안합니다. 이를 위해 170개 이상의 다국어 모바일 앱 및 데스크톱 OS로 환경을 확장하고, 심층 연구 파이프라인을 통해 기능 중심의 지시문을 생성하며, 시각적 키포인트와 멀티 모델 투표를 결합한 검증 체계를 구축했습니다. 또한 안전을 고려한 메커니즘을 통합하여 실행 제어력을 높였습니다. 결과적으로 UI-Venus-2는 실세계 애플리케이션을 위한 일반화 가능하고 검증 가능한 에이전트 기술을 제시합니다.

AI 연구

H3-World: Turning Language Understanding into World Control

최근 대규모 비디오 생성 모델은 언어를 통해 캐릭터 동작과 카메라 움직임을 제어하는 능력이 나타나고 있습니다. 하지만 기존의 자연어 인터페이스는 제어의 정밀도와 시간적 일관성이 부족하다는 문제가 있습니다. 본 논문은 H3-World 프레임워크를 제안하여, 언어 지시사항을 구조화된 캐릭터/카메라 명령으로 변환하고 이를 비디오 잠재 공간(latents)에 정렬합니다. 특히 시간적 어텐션 라우팅(temporal attention routing)을 도입하여 각 명령이 의도된 시간 구간에만 작용하도록 제어 누출을 방지했습니다. 결과적으로 매우 적은 파라미터와 데이터만으로도 생성 품질을 유지하면서 정밀한 상호작용이 가능한 월드 모델을 구축했습니다.

나머지 21건 펼쳐보기

AI 연구

ZimaBlue: Evolving Generalizable World Action Models through Scalable Video Pre-training

로봇 조작 작업에서 데이터 부족과 일반화 성능 저하는 핵심적인 과제입니다. 기존의 액션 라벨이 포함된 로봇 데이터는 수집 비용이 높고 다양성이 부족하다는 한계가 있습니다. 이를 해결하기 위해 대규모 비디오 데이터를 활용하여 일반화 가능한 세계 모델을 학습하는 ZimaBlue 프레임워크를 제안합니다. 학습은 비디오 사전 학습, 비디오-액션 중간 학습, 타겟 로봇 특화 단계의 3단계 커리큘럼으로 진행됩니다. 또한 실시간 제어를 위해 고용량 Slow 모델과 경량 Fast 모델을 결합한 비동기식 이중 구조를 채택했습니다. 실험 결과, 대규모 비디오 데이터로 확장할수록 제로샷 성공률이 크게 향상되었으며 미학습 작업에서도 강력한 성능을 보였습니다.

AI 연구

From Production Traffic to Post-Training: Building a Self-Hosted LLM That Covers the Corporate Request Mix

기업의 데이터 거주성 제약으로 인해 자체 호스팅 LLM 수요가 늘면서, 여러 모델을 동시에 운영함에 따른 GPU 자원 파편화 문제가 발생했습니다. 연구진은 200개 이상의 내부 애플리케이션 트래픽을 단일 모델로 통합하기 위해 프로덕션 에러 분석을 통한 품질 격차 해소에 집중했습니다. 지시 이행, 함수 호출, 내부 작업 분포라는 세 가지 축을 기준으로 품질을 추적하고, 각 영역에 특화된 GRPO 전문가 모델을 학습시킨 뒤 SLERP 방식으로 병합했습니다. 이 방식은 도메인 간 보상 간섭 문제를 방지하며 각 실패 모드(의미론적 붕괴, 과도한 호출, 장황함)를 효과적으로 해결했습니다. 결과적으로 훨씬 더 큰 파라미터 규모의 베이스라인 모델을 능가하는 성능을 달성하며 월 1억 1,600만 건의 요청을 처리하는 데 성공했습니다.

AI 연구

Hi-Q: Hierarchical Evidence-guided Query Refinement for Multi-Hop Question Answering

멀티홉 QA에서 질문의 입도(granularity)와 검색 가능한 증거의 입도가 일치하지 않는 것이 주요 병목 현상입니다. 기존 방식은 고정된 그래프나 반복적 쿼리 재구성을 사용하지만, 언제 쿼리를 정교화해야 할지 결정하는 데 어려움이 있습니다. 본 논문은 이를 '검색 가능한 입도 발견' 문제로 정의하고, 증거 기반의 계층적 쿼리 정교화 프레임워크인 Hi-Q를 제안합니다. Hi-Q는 검색된 증거가 충분하면 노드를 종료하고, 부족하면 의존성을 유지하며 쿼리를 확장하는 방식으로 동적인 쿼리 트리를 생성합니다. 실험 결과, Hi-Q는 IRCoT 및 PropRAG와 같은 기존 SOTA 모델들을 상회하며 오픈 도메인 환경에서도 강력한 성능을 입증했습니다.

AI 연구

Evaluating Multimodal LLMs as Generalist Vision-Language-Action Agents for Drone Control: Commanding, Approaching, Tracking and Searching

최근 MLLM의 시각 인지 능력은 뛰어나지만, 이를 실제 드론 제어 루프에 직접 투입하여 행동(Action)까지 수행하는 능력은 충분히 검증되지 않았습니다. 기존 방식은 모델의 결정 범위를 좁게 설정하는 경향이 있어, 본 연구는 모델의 자율성을 극대화한 DroneCATS-Agent 아키텍처와 벤치마크인 DroneCATS를 제안합니다. 연구진은 접근, 추적, 탐색, 다수 드론 명령 등 네 가지 핵심 역량을 중심으로 다양한 크기의 모델을 평가했습니다. 실험 결과, 모델의 공간 인지 능력은 준수하지만 임무 종료 시점 판단이나 프로토콜 유지 능력이 성능의 핵심 차이를 만들었습니다. 특히 소형 모델이 대형 모델보다 물리적 이동은 더 잘할 수 있으나, 임무 완수 프로토콜에서 실패하는 역설적인 현상이 관찰되었습니다.

AI 연구

Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System

통합 멀티모달 모델(UMM)은 이해와 생성 기능을 동시에 수행하지만, 두 목적 함수가 서로 시너지를 내거나 혹은 용량을 두고 경쟁할 수 있는 복잡한 관계를 가집니다. 본 연구는 사전 학습된 비전 모델 없이 구조적으로 통합된 환경에서 표현, 태스크, 시스템 수준의 관계를 조사했습니다. 연구 결과, 생성은 이해를 위한 특징을 풍부하게 하고 이해는 생성의 정렬을 강화하는 상호 보완적 관계를 보였으나, 동일한 연산 경로를 사용할 경우 한쪽이 지배하는 비대칭적 성능 저하가 발생했습니다. 이를 해결하기 위해 충돌하는 연산은 분리하되 의미적 상호작용은 유지하는 태스크 분리형 아키텍처를 제안했습니다. 실험을 통해 적절한 특화와 공유 지식 활용이 결합될 때 단순한 기능 통합을 넘어선 강력한 시너지가 발생함을 입증했습니다.

AI 연구

Safin-1: Safety from Within through Memory-Native State Evolution

장기적인 복잡한 작업을 수행하는 파운데이션 모델은 정보를 축적하고 내부 상태를 유지하는 능력이 필수적입니다. 기존의 안전성 확보 방식은 외부 가드레일이나 사후 정렬(SFT)에 의존하여 모델 자체의 내재적 속성으로 만들기 어렵다는 문제가 있습니다. 이를 해결하기 위해 본 논문은 메모리 라우팅과 상태 진화를 통해 안전성을 모델 내부 연산으로 구현하는 Safin-1을 제안합니다. 핵심 아키텍처인 MARCH는 구조화된 메모리 상태를 유지하며 콘텐츠 기반 라우팅을 통해 과거 정보를 선택적으로 검색합니다. 실험 결과, 제안된 방식은 모델의 백본을 수정하지 않고도 테스트 타임에 안전 상태를 적응시킬 수 있으며 안전성 성능을 크게 향상시켰습니다.

AI 연구

AgentJudgeBench: A Multi-Difficulty Benchmark for Evaluating LLM Judges on Agentic Tool-Calling

에이전트 시스템 평가를 위해 LLM을 판사로 사용하는 방식이 널리 쓰이지만, 구조적 의존성이 있는 워크플로우에서의 신뢰성은 충분히 검증되지 않았습니다. 본 연구는 DAG(유향 비순환 그래프) 기반의 도구 호출 작업을 대상으로 하는 벤치마크인 AgentJudgeBench를 제안합니다. 3,808개의 인스턴스를 통해 난이도와 정답(Ground-truth) 유무에 따른 판정 성능을 분석했습니다. 실험 결과, 판정 정확도는 작업 난이도가 높아질수록 급격히 저하되며, 정답이 없을 경우 모델 크기와 상관없이 특정 성능 범위(77-82%)로 수렴하는 한계가 발견되었습니다. 또한 정답 제공이 오히려 특정 모델의 정렬을 방해하는 현상도 관찰되었습니다. 이러한 결과는 에이전트 평가 시 모델 규모보다 작업 구조와 프롬프트 전략이 더 중요함을 시사합니다.

AI 연구

DiagEvo: Diagnosis-Guided Self-Evolution via Hierarchical Error Memory

Self-play 기반의 모델 진화 방식은 외부 가이드 없이는 성능 정체나 퇴보 문제를 겪기 쉽습니다. 기존 방식은 외부 데이터나 인간의 예시를 활용해 방향성을 잡았으나, 이는 외부 자원에 대한 의존성을 높입니다. 본 논문은 모델의 과거 실패 이력에서 직접 방향성을 도출하는 DiagEvo를 제안합니다. DiagEvo는 계층적 오류 원인 메모리를 통해 반복되는 오류를 추출하고, 이를 숙련도(Active/Mastered)로 관리하며 학습 커리큘럼을 생성합니다. 실험 결과, 외부 자원 없이도 수학적 추론 등 다양한 벤치마크에서 기존 SOTA 모델들을 상회하는 성능을 달었습니다.

AI 연구

Harness-of-Harness: Multi-Day Autonomous Software Development with Continual Improvement

LLM 기반 코딩 에이전트가 인간의 개입 없이 요구사항을 완전한 소프트웨어로 변환하는 자율 개발 연구가 활발해지고 있습니다. 기존 방식은 단발성 작업에 그치거나 지속적인 성능 개선이 어렵다는 과제가 있습니다. 본 논문은 기존 코딩 에이전트 하네스를 활용하면서도 반복적인 루프를 통해 성능을 높이는 'Harness-of-Harness(HoH)' 프레임워크를 제안합니다. HoH는 수리(repair)와 역량 성장 사이의 균형을 맞추고, 개발 범위를 검증 가능한 작은 단위로 분할하며, 독립적인 평가 체계를 유지합니다. 실험 결과, HoH는 기존 단독 하네스 대비 평균 52.25%의 성능 향상을 기록했으며, 다일(multi-day) 배포를 통해 복잡한 FPS 게임을 자율적으로 개발하는 데 성공했습니다.

AI 연구

EM^2Mem: Event-Centric Multimodal Memory for Large Language Models

기존의 멀티모달 메모리 방식은 캡션, 프레임, 스크립트 등을 개별 조각으로 저장하여 모델이 추론 시점에 복잡한 정렬 작업을 수행해야 하는 문제가 있었습니다. 이를 해결하기 위해 제안된 EM^2Mem은 이벤트를 중심축(Anchor)으로 삼아 이질적인 증거들을 하나의 메모리 셀에 결합하는 방식을 사용합니다. 각 메모리 셀은 멀티모달 기록, 시간적 맥락, 그래프 관계, 의미적 사실 및 출처를 통합하여 관리합니다. 실험 결과, 기존 베이스라인 대비 정확도가 향상되었으며, 특히 지연 시간(Latency)을 4.67배 단축하고 추론 토큰 수를 63.66% 절감하는 성과를 거두었습니다.

AI 연구

Agents in the Large: Perception-Centered Architecture for Persistent Agents

최근 언어 모델 기반 에이전트는 메모리, 도구, 의사결정 구조를 통해 비약적인 발전을 이루었으나, 주로 한정된 태스크를 해결하는 데 초점이 맞춰져 있습니다. 하지만 실제 환경에서는 사용자 요구와 맥락이 지속적으로 변화하는 장기적인 서비스 환경이 중요해지고 있습니다. 본 논문은 이러한 지속적 에이전트를 정의하고 가이드하기 위해 '지각 중심 아키텍처(Pera)'를 제안합니다. Pera는 에이전트가 주변 환경, 내부 맥락, 과거 작업에서 발생하는 신호를 지속적으로 감지하여 새로운 생애주기 태스크를 생성하고 운영하는 구조를 가집니다. 이를 통해 기존 연구를 재정리하고 향후 적응형 지능 시스템 구축을 위한 방향성을 제시합니다.

AI 연구

Control-Data Flow Separation: Stable Prompt Optimization in Multi-Agent LLMs

멀티 에이전트 시스템에서 프롬프트는 작업 콘텐츠 생성과 실행 프로토콜(라우팅, 포맷 등)이라는 두 가지 역할을 동시에 수행합니다. 이로 인해 콘텐츠 성능을 높이려는 프롬프트 수정이 시스템의 실행 구조를 망가뜨리는 문제가 발생합니다. 연구진은 실행 프로토로는 구조화된 객체로, 작업 내용은 비구조화된 언어로 분리하는 '제어-데이터 소식 분리' 방식을 제안합니다. 이 설계는 프롬프트 최적화 과정에서 프로토콜 인터페이스가 변질되는 것을 방지합니다. 실험 결과, 다양한 워크플로우에서 프로토콜 유효성을 100% 유지하면서도 작업 성능을 향상시켰습니다.

AI 연구

InternReviewer & InternAdvocate: Objective Reward and Evaluation for Agentic Reinforcement Learning in Peer Review and Rebuttal

전문적인 학술 콘텐츠 생성은 도메인 추론과 사실적 근거 확보 사이의 정교한 조화가 필요합니다. 기존의 주관적인 모델 기반 평가 방식은 편향성 문제를 야기할 수 있습니다. 본 연구는 대규모 학술 데이터셋과 arXiv 검색 도구를 결합한 InternReviewer 및 InternAdvocate 프레임워크를 제안합니다. 제안된 시스템은 참조 기반의 의미적 정렬, 구조적 준수, 실시간 로그를 통한 인용 검증 등 다차원적 기준을 통해 RL 보상 체계를 구축합니다. 실험 결과, 이 폐쇄 루프 프레임워크를 통해 학습된 에이전트는 추론 깊이와 인용 정확도 면에서 유의미한 향상을 보였습니다.

AI 연구

E-Commerce Bench: Evaluating LLM Agents on Long-Horizon Autonomous Business Operation

기존의 에이전트 작업은 짧은 태스크 체이닝에 집중되어 있어, 변화하는 환경과 장기 의존성을 다루는 데 한계가 있습니다. 본 논문은 1년 단위의 비즈니스 운영 시나리오를 담은 'E-Commerce Bench'를 소개합니다. 이 벤치마크는 시장 조사, 공급업체 협상, 재고 관리 등 복잡한 의사결정 과정을 포함하며, 실제 이커머스 데이터를 기반으로 동적인 이벤트를 생성합니다. 실험 결과, 18개의 최첨단 모델을 평가한 결과 특정 모델이 모든 영역을 지배하지 못함을 확인했습니다. 특히 모델별로 자산 증식 능력과 운영 효율성, 사기 방지 능력 등에서 뚜렷한 성능 차이가 나타났습니다.

AI 연구

Adapting Without Gradients: Affine Statistics Transport and What Its Certificate Can Tell You

기존의 테스트 시간 적응(TTA) 방식은 모델 파라미터 업데이트를 전제로 하지만, 이는 추론 전용 가속기나 동결된 모델 환경에서는 적용이 어렵습니다. 본 논문은 모델을 고정한 상태에서 적응할 수 있는 CASTER 방식을 제안합니다. CASTER는 소스 클래스 통계량을 판별 공간에 저장하고, 타겟 배치 모멘트를 통해 아핀 변환을 추정하여 소스 분포를 전송하는 그래디언트 프리 방식을 사용합니다. 실험 결과, CASTER는 기존 k-NN보다 적은 메모리를 사용하면서도 다양한 백본과 데이터셋에서 우수한 성능을 보였습니다. 또한, 아핀 변환의 위험성을 관리하기 위해 잔차 대 마진(residual-to-margin) 기반의 신뢰도 인증 지표를 도입하여 안정적인 적응을 지원합니다.

AI 연구

Recursive Criticality of AI Self-Improvement

AI가 차세대 AI를 개발하는 R&D 과정에 투입됨에 따라 발생하는 재귀적 피드백의 특성을 연구합니다. 연구진은 기본 연구 생산성, 재귀적 피드백, 연구 난이도 증가 사이의 관계를 모델링하여 재귀적 재생산 지수(R_AI)를 도출했습니다. R_AI가 1보다 크면 개선 효과가 사이클을 거치며 증폭되는 자기 증폭 상태에 진입하고, 1보다 작으면 효과가 감쇄됩니다. 이 전이는 특정 성능 수준이 아닌 피드백 루프의 구조에 따라 결정되므로, 가시적인 가속화가 나타나기 전에도 시스템이 임계점에 도달할 수 있습니다. 또한, 개별 주체가 아닌 생태계 차원의 공유가 전체 시스템의 자기 증폭을 유도할 수 있음을 보여줍니다.

AI 연구

ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation

SAR 관측 데이터로부터 EO 이미지를 생성하는 작업은 기존의 사전 학습된 오토인코더에 의존하여 재구성 정밀도가 떨어지는 문제가 있었습니다. 이를 해결하기 위해 연구진은 SAR와 EO 재구성을 동시에 고려하여 최적의 코덱을 선택하는 ReFlowSET 프레임워크를 제안합니다. 이 방식은 무거운 사전 학습 모델 대신, 선택된 잠재 공간 내에서 작은 크기의 조건부 DiT를 처음부터 학습시킵니다. 학습 과정에서 Frozen Vision Foundation Model을 사용하여 노이즈가 포함된 EO 특징을 깨끗한 타겟 EO 표현과 정렬함으로써 의미적 가이드를 제공합니다. 실험 결과, 제안된 방법은 다양한 지각적 충실도 및 분포 지표에서 SOTA 성능을 달성했습니다.

AI 연구

Learning Where Outcomes Change:Credit-Addressable Reasoning for Multimodal Geometry

기존의 멀티모달 기하학 추론은 자유 형식의 추론 과정으로 인해 의사결정 과정을 파악하기 어렵고, 최종 결과에만 의존하는 강화학습 방식은 보상 분산 문제가 발생합니다. 이를 해결하기 위해 추론 과정의 의미 단위가 학습의 비교 및 보상 할당 기준이 되는 'Credit-Addressable Reasoning'을 도입했습니다. 구체적으로는 시각적 관계를 실행 가능한 코드로 표현하는 Code-CoT와 이벤트 경계 기반의 보상 할당 방식인 CE-GRPO를 제안합니다. 실험 결과, 제안 방식은 9개의 기하학 벤치마크에서 기존 모델 및 일반 GRPO 대비 우수한 성능을 기록했습니다. 특히 추론 단계가 길고 의존성이 높은 문제에서 그 효과가 더욱 두드러졌습니다.

AI 연구

Token-Efficient Data Reasoning Agents via Adaptive Structuring of Unstructured Data

기업용 AI 에이전트가 비정형 데이터(PDF, 웹 등)를 기반으로 복잡한 질문에 답할 때, 매번 대규모 문서를 다시 읽는 방식은 막대한 토큰 비용을 발생시킵니다. 모든 데이터를 미리 구조화하는 것은 불가능하며, 어떤 구조가 유용할지 쿼리 전에는 알 수 없다는 문제가 있습니다. 이를 해결하기 위해 본 논문은 추론 과정에서 데이터 구조화를 적응적(Adaptive)이고 투기적(Speculative)으로 수행하는 'Agentic Data Cracking' 방식을 제안합니다. 에이전트가 문서를 열 때 별도의 서브 에이전트가 미래의 관련 쿼리에 유용한 구조를 미리 추출하여 저장합니다. 결과적으로 시간이 흐를수록 구조화된 데이터만으로 질문을 해결할 수 있게 되어, 정확도는 유지하면서 비용을 획기적으로 절감합니다.

AI 연구

DramaChain Bench: An End-to-End Benchmark for Short-Drama Generation

기존의 숏폼 드라마 생성 평가는 주로 최종 비디오 생성 단계에만 집중하여, 상위 단계의 의도 반영 여부나 에피소드 간 일관성 문제를 해결하지 못했습니다. 이를 해결하기 위해 대본, 스토리보드, 키프레임, 영상 생성 등 전체 제작 체인을 평가하는 'DramaChain Bench'를 제안합니다. 이 벤치마크는 63개의 세부 차원을 가진 'DramaChain Dimensions'와 전문 인력이 검증한 데이터셋을 기반으로 구축되었습니다. 또한, 자동화된 'DramaChain Agentic Judge'를 통해 인간의 평가와 높은 상관관계(PLCC 0.918)를 보이는 자동 평가 시스템을 구현했습니다. 실험 결과, 상위 단계의 결함이 최종 품질에 연쇄적으로 영향을 미침을 확인하였으며, 자동화된 에이전트가 인간의 평가를 효과적으로 대체할 수 있음을 입증했습니다.

30건

제품/서비스

이날 공개된 제품과 도구

제품/서비스

Browzer

GitHub 저장소와 연동하여 기술 문서와 블로그 포스트를 자동으로 생성하고 관리하는 DevRel 자동화 도구

제품/서비스

Monid

단 하나의 API 키로 1,800개 이상의 외부 도구를 연결하는 AI 에이전트용 통합 허브

제품/서비스

Articos

가상 페르소나를 통해 제품 메시지와 랜딩 페이지를 검증하는 AI 시뮬레이션 도구

제품/서비스

CleanShot 5.0 with Studio Mode

단순 캡처를 넘어 전문적인 영상 제작까지 가능한 Mac 전용 스크린샷 및 녹화 툴킷

제품/서비스

Dial

AI 에이전트에게 10초 만에 실제 전화번호를 부여하는 API 서비스

나머지 25건 펼쳐보기

제품/서비스

OpenClaw 2.0

설정은 간편하게, 협업은 강력하게 만드는 로컬 실행형 AI 에이전트

제품/서비스

Parasocial

파워 리스너를 위한 빠르고 강력한 네이티브 팟캐스트 플레이어

제품/서비스

Dyson CameraJet

양치와 치간 세정을 동시에 해결하는 AI 기반 스마트 전동 칫솔

제품/서비스

Claude Fable 5.1

코딩과 전문 지식 업무에 최적화된 Claude의 최첨단 AI 모델

제품/서비스

RoundOS

비용 부담 없이 보안 문서 공유와 데이터 분석을 제공하는 무료 VDR 솔루션

제품/서비스

deepeye by deepidv

브라우징과 메신저 환경에서 실시간으로 딥페이크를 감지하는 보안 도구

제품/서비스

Touchy

현실 세계의 맥락을 이해하여 스마트폰 사용 시간을 줄여주는 iOS AI 비서

제품/서비스

Doop

AI 에이전트와 실시간으로 협업하며 디자인하는 무한 캔버스 도구

제품/서비스

Onset MCP

AI 에이전트가 코드를 바탕으로 릴리스 노트를 자동 작성하고 배포하는 도구

제품/서비스

Userlens

데이터 기반의 AI 에이전트가 사용자 맞춤형 가이드를 통해 제품 도입을 자동화합니다.

제품/서비스

Basedash AI Sources

AI 답변의 근거가 되는 데이터 소스와 SQL 쿼리를 투명하게 검증하는 도구

제품/서비스

HydraDB OSS

AI 인프라를 위해 설계된 초고속·저비용 오픈소스 네이티브 그래프 데이터베이스

제품/서비스

Roadie

맥(Mac)의 오디오 기기를 우선순위에 따라 자동으로 전환해주는 메뉴바 오디오 스위처

제품/서비스

Porte

스마트폰으로 로컬 Grok 세션을 원격 제어하는 오픈소스 리모컨

제품/서비스

GhostReply

사용자의 메시지 스타일을 학습하여 iMessage 답장을 자동화하는 Mac용 AI 도구

제품/서비스

Dynamic Edge

윈도우 환경에 최적화된 플로팅 인터페이스로 미디어 제어와 생산성 도구를 하나로 통합한 도구

제품/서비스

NextAdmin

AI 에이전트가 프로젝트 패턴을 즉시 이해하고 일관된 UI를 생성할 수 있도록 설계된 Next.js 관리자 대시보드

제품/서비스

Crosspublish

모든 주요 소셜 네트워크에 최적화된 콘텐츠를 제작하고 배포하는 통합 퍼블리싱 도구

제품/서비스

AdArena

단 하나의 브리프를 통해 수많은 AI 크리에이터들의 경쟁을 통해 최적의 광고를 발굴하는 AI 광고 리그

제품/서비스

Wircle

인간과 AI 에이전트를 위한 검증된 신원 기반의 전문 소셜 네트워크

제품/서비스

GeoRankers

AI 검색 엔진에서의 브랜드 노출도를 추적하고 최적화 전략을 제공하는 마케팅 솔루션

제품/서비스

fedt.ai

AI 에이전트가 웹사이트를 원활하게 탐색하고 작업할 수 있는지 검증하는 최적화 도구

제품/서비스

Unitpost

AI 에이전트가 이메일 캠페인 기획부터 발송까지 자동화하는 통합 이메일 플랫폼

제품/서비스

Authorizer

기업용 애플리케이션과 AI 에이전트를 위한 오픈소스 자가 호스팅 인증 솔루션

6건

모델/벤치마크

새 모델과 주요 평가 결과

HF Model Trending

unsloth/Qwen3.8-Flash-Next-GGUF

unsloth에서 공개한 Qwen3.8-Flash-Next-GGUF 모델이 높은 다운로드 수를 기록하며 주목받고 있습니다. 이 모델은 image-text-to-text 파이프라인을 지원하는 GGUF 포맷 모델입니다.

HF Model Trending

BreezeBlue/Breeze-TTS-2

BreezeBlue에서 공개한 Breeze-TTS-2 모델이 Hugging Face에서 주목받고 있습니다. 이 모델은 text-to-speech 파이프라인을 지원하는 음성 합성 모델입니다.

HF Model Trending

deepseek-ai/DeepSeek-V4-Flash-Vision-Exp

DeepSeek-AI에서 출시한 DeepSeek-V4-Flash-Vision-Exp 모델이 Hugging Face에서 주목받고 있습니다. 이 모델은 이미지와 텍스트를 결합하여 처리하는 멀티모달 기능을 제공합니다.

LiveCodeBench

LiveCodeBench top model: O4-Mini (High)

LiveCodeBench 벤치마크에서 O4-Mini (High) 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.

LiveCodeBench

LiveCodeBench top model: Gemini-2.5-Pro-06-05

LiveCodeBench 벤치마크에서 Gemini-2.5-Pro-06-05 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.

나머지 1건 펼쳐보기

LiveCodeBench

LiveCodeBench top model: Gemini-2.5-Flash-04-17

LiveCodeBench 벤치마크에서 Gemini-2.5-Flash-04-17 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 avg_pass@1 25.0%를 달성했습니다.