Ship to Production 시즌4를 진행하기 전 Upstage의 모델을 미리 써보았습니다

안녕하세요! CloudBro 커뮤니티 운영진 이수빈입니다.
곧 다가올 추석, 커뮤니티 회원님들 모두 평안한 연휴가 되시길 바라며 추석 이후 다가올 STP 시즌4에 관심있는 분들을 위해 곧 프로모션으로 제공될 Upstage Solar Pro 4 모델을 운영진으로서 미리 써보고 공유해보려고 합니다.

모델의 성능

모델의 성능은 공식 홈페이지 기준 아래와 같은 성능을 내고 있습니다.

Category Benchmark Solar Open 2 Solar Pro 4 Gap
Agent execution Terminal-Bench v2.1 43.2 57.0 +13.8
Agent execution GDPval-AA v2 31.4 38.8 +7.4
Agent execution BrowseComp* 37.3 49.2 +11.9
Agent execution SWE-Bench Verified (OpenHands)* 69.2 70.6 +1.4
Agent execution MCP-Atlas* 58.2 61.4 +3.2
Agent execution APEX-Agents* 16.6 18.7 +2.1
Agent execution τ³-Banking 18.1 23.0 +4.9
Long documents AA-LCR 62.7 71.0 +8.3
Knowledge, reasoning, coding GPQA Diamond 85.6 89.0 +3.4
Knowledge, reasoning, coding MMLU-Pro* 86.2 86.3 +0.1
Knowledge, reasoning, coding LiveCodeBench* 87.0 87.8 +0.8
Knowledge, reasoning, coding AIME 2026* 95.7 95.3 -0.4
Korean and Japanese work KMMLU-Pro* 78.4 79.2 +0.8
Korean and Japanese work KBL (law)* 75.5 77.5 +2.0
Korean and Japanese work KorMedMCQA (medicine)* 93.0 93.2 +0.2
Korean and Japanese work Ko-GDPval* 86.8 87.3 +0.5
Korean and Japanese work Arena-Hard v2 (Japanese)* 75.3 81.9 +6.6
Korean and Japanese work MMLU (Japanese)* 89.3 89.5 +0.2
Korean and Japanese work IFEval (Japanese)* 82.5 81.6 -0.9

실제로 사용했을 때 체감은 타사 Claude 모델의 sonnet 5를 사용하는 듯한 느낌을 받았습니다. 그렇지만 제가 직접 벤치마크를 진행하고 지표로 제공하는 것은 아니기에 참고사항으로만 생각해 주시면 좋을 것 같습니다!

주요 예상 사용처

해당 모델은 장기 작업(Agentic Coding 등) 혹은 많은 Context를 요구하는 작업보다는 AIOps를 위한 metric 분석 도구, 혹은 가벼운 조사 및 연구 등 이미 갖춰진 기반하에 보조 도구로 사용하면 어떨까 하는 생각을 해보았습니다. 다만 개인 체감으로 설명해드리다 보니 추후 실제로 Solar Pro 4를 사용해주실 STP 시즌 4 빌더 분들의 의견도 향후에 여쭤보고 싶습니다.

운영진의 사용처

저는 CloudBro 내부 프로젝트에 코딩 에이전트 형태로 사용을 해보았습니다, Upstage에서는 hermes agent를 공식적으로 셋업해주는 가이드가 있어 쉽게 연동 후 사용할 수 있었습니다.

정리

CloudBro에서 진행될 Ship to Production 시즌4 에서는 Upstage, Zadara 등 글로벌 서비스 제공사를 통해 빌더 분들에게 프로덕션을 구축하시는 것에 집중하실 수 있도록 다양한 제휴 및 접근을 진행하고 있습니다. 앞으로 있을 Ship to Production 뿐만 아니라 CloudBro 커뮤니티에서도 다양한 컨텐츠, 행사가 다가올 예정이오니 많은 관심 부탁드립니다!

3개의 좋아요