모델 평가 자료
모델/벤치마크
모델 공개와 주요 벤치마크 결과를 한곳에서 확인할 수 있게 정리했습니다.
MiniMaxAI/MiniMax-H3
MiniMaxAI에서 공개한 MiniMax-H3 모델이 Hugging Face에서 주목받고 있습니다. 이 모델은 image-text-to-video 파이프라인을 지원하는 것이 특징입니다.
Comfy-Org/MiniMax-H3
Comfy-Org에서 공개한 MiniMax-H3 모델이 Hugging Face에서 주목받고 있습니다. 해당 모델은 418개의 likes를 기록하며 사용자들의 관심을 끌고 있습니다.
unsloth/DeepSeek-V4-Flash-0731-GGUF
unsloth에서 공개한 DeepSeek-V4-Flash-0731-GGUF 모델이 높은 다운로드 수를 기록하며 주목받고 있습니다. 해당 모델은 GGUF 포맷으로 제공되어 다양한 환경에서의 활용이 가능합니다.
Introducing CodeClash, our new eval of LMs as goal (not task) oriented developers! [ Link ]
SWE-bench 팀이 언어 모델을 단순 작업 수행자가 아닌 목표 지향적 개발자로 평가하기 위한 새로운 벤치마크인 CodeClash를 소개합니다. 이 평가는 모델이 주어진 과제를 넘어 최종 목표를 달성하는 능력을 측정하는 데 중점을 둡니다.
mini-SWE-agent scores 65% on SWE-bench Verified in 100 lines of python code. [ Link ]
mini-SWE-agent가 SWE-bench Verified 벤치마크에서 65%의 점수를 기록했습니다. 이 성과는 단 100라인의 Python 코드로 달성되었습니다.
SWE-smith is out! Train your own models for software engineering agents. [ Link ]
소프트웨어 엔지니어링 에이전트 학습을 위한 SWE-smith가 출시되었습니다. 사용자가 직접 모델을 학습시킬 수 있는 환경을 제공합니다.
LiveCodeBench top model: O4-Mini (High)
LiveCodeBench 벤치마크에서 O4-Mini (High) 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.
LiveCodeBench top model: Gemini-2.5-Pro-06-05
LiveCodeBench 벤치마크에서 Gemini-2.5-Pro-06-05 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 테스트를 진행했습니다.
LiveCodeBench top model: Gemini-2.5-Flash-04-17
LiveCodeBench 벤치마크에서 Gemini-2.5-Flash-04-17 모델이 상위 성적을 기록했습니다. 해당 모델은 4개의 문제를 대상으로 avg_pass@1 25.0%를 달성했습니다.