PyoSignal Logo
PyoSignal
← 커뮤니티로 돌아가기
Redditr/LocalLLaMALocalLLaMA

We tested Deepseek v4 flash, GLM 5.2, and Kimi K3 on hard agentic tasks, and DeepSeek just crushed

2026년 8월 3일 오후 07:306 추천0 댓글
#LLM_Benchmark#DeepSeek#Agent#AI_Agent#AI

요약

DeepSeek v4 flash, GLM 5.2, Kimi K3 모델을 대상으로 복잡한 에이전트 작업 성능을 테스트한 결과, DeepSeek가 압도적인 속도와 비용 효율성을 보여주었습니다. 세 모델 모두 성공률은 비슷했으나 DeepSeek는 가장 빠르고 저렴하게 작업을 수행하며 뛰어난 가성비를 입증했습니다.

주요 내용

  • DeepSeek v4 flash는 작업당 164초를 기록하며 GLM 5.2나 Kimi K3보다 훨씬 빠른 속도와 약 0.08달러라는 매우 낮은 비용을 달성했습니다.
  • 성공률 측면에서는 DeepSeek(20/30), Kimi(21/30), GLM(21/30)이 모두 유사한 성적을 거두었으며, 이는 최상위 모델인 GPT-5.6 Sol(24/30) 등과 비교해도 근접한 수준입니다.
  • 모델별 특성상 GLM은 토큰 사용량이 적고 느린 반면, DeepSeek는 토큰 사용량은 많지만 속도가 매우 빠른 효율적인 작업 방식을 보였습니다.