카테고리
Empty
추가 모델 도입 아이디어가 하나 있어서 적어봤습니다.

최대한 비용 절감으로 SLM을 사용해보자는 아이디어입니다.

Qwen 3.6 35B-A3B
장점 - JSON 처리 능력 , 한국어 구사 능력과 기본적으로 Thinking이 탑재되어있어서 복잡한 상황 판단 능력이 매우 뛰어남. 특히 MoE 처리 구조로 LLM인 Claude Opus 4.5에 버금가는 압도적 성능을 가짐.

단점 - 추론 모드로 인해서 토큰 소모율이 가끔씩 비정상적으로 높게 튈수가 있음.
보완점 - 추론 모드에 부분적 제한을 걸거나 추론에 사용되는 토큰을 제한해서 비용을 적절히 절감하면서 질 높은 답변을 유도.

Mistral NeMo 12B
장점 - 128k의 매우 긴 Context Window로 캐릭터챗에 필요한 대부분의 내용들을 넣어 사용할수 있고 작은 모델 크기로 서버 비용이 적게 들어감.

단점 - 한국어 구사 능력이 매우 떨어져 매우 많은 양의 파인 튜닝 자료가 필요하고 이에 따른 시간도 오래 걸림. Context Window는 길지만 이에 대한 처리 능력이 소형 모델의 한계로 인해 떨어짐.
보완점 - 128k 모델을 다 채우지 말고 핵심 정보 위주로 32~48k로 일부분만 채워서 NIH(바늘 구멍찾기) 실패율을 낮추고 적절한 파인 튜닝과 기본 프롬프트 지시 사항으로 한국어 구사 능력을 어느정도 끌어올리기.

Magistral 24B
장점 - 추론에 특화되어 있어 캐릭터 연기성에 있어서 성능이 매우 뛰어남. 또한 소형 최적화 모델로 응답 속도가 매우 빠름.

단점 - 추론 특화 모델이라는 특성 때문에 과도한 설명충 기질이 장문, 감정성을 가끔 해치는 수준의 답변이 나올수 있음.
보완점 - 설명충 기질을 파인 튜닝이나 직접 프롬프트 지시 사항에 간결한 문장과 대사 및 행동 묘사 비율을 비슷하게 맞추라는 지시 사항으로 어느정도 보완이 가능함.

일단 제가 조사한건 이정도고 더 괜찮아보이는게 있으면 따로 추가하겠습니다.
1
👍
이즈리얼
안녕하세요. 좋은 의견 감사합니다. 말씀주신 모델은 실제로 타 서비스에서 부분 적용하기도 합니다.
해당 모델은 local llm 으로 보통 저희같은 개발사 서버에 설치해서 사용하길 권장되는 모델인데
설치를 하려면 gpu 가 좋은 서버 (ai 를 위한)가 필요한데 초기 투자비용이 상당히 발생합니다
아직은 제가 갖고 있는 ai 서버가 없기때문에 향후 서비스가 수익이 나서 투자가 가능한 시점에 도입을 다시 검토하도록 하겠습니다.
See latest comments