사이오닉에이아이가 안정적으로 정보를 찾는 범용 검색 모델을 내놨다.
사이오닉에이아이는 실제 검색 환경을 반영한 한국어·일본어 검색 임베딩 모델을 공개했다고 13일 밝혔다.
한국어 검색 임베딩 모델 '컴샛 임베드 코 8B 프리뷰'는 MTEB 한국어 검색 9개 데이터셋 평가에서 평균 NDCG@10 79.30을 기록해 비교 모델 가운데 가장 높은 성능을 나타냈다. 알리바바 '큐원3 임베딩 8B'는 78.25점, 마이크로소프트 '해리어 OSS v1 27B'는 76.69점을 기록했다.
일본어 모델도 MTEB 일본어 검색 11개 데이터셋 평가에서 우수한 성능을 기록했다. '컴샛 임베드 자 8B 프리뷰'는 평균 NDCG@10 81.33을 기록했으며 3억 파라미터 규모 경량 모델 '컴샛 임베드 자 0.3B 프리뷰'도 4B 이하 비교 모델 가운데 1위를 차지했다.
사이오닉에이아이는 실제 검색 환경을 반영한 학습 데이터 구성이 성능 향상 배경이라고 설명했다. 실제 검색에서는 짧은 키워드부터 여러 문단을 종합해야 하는 질문까지 형태가 다양하고 검색 대상 문서의 길이나 정답이 등장하는 위치도 일정하지 않다는 점을 학습 과정에 반영했다.
회사는 이를 위해 다양한 출처의 문서를 수집한 뒤 여러 형태의 검색 질문을 합성했다. 질문과 문서 관계도 단순한 1대1 방식에서 벗어나 1대다·다대1 구조로 학습시키고 실제 정답과 의미는 비슷하지만 정답이 아닌 문서를 학습하는 '하드 네거티브 마이닝'과 교사 모델의 검색 순위를 학습하는 지식 증류 방식을 적용했다.
관련기사
- "계약서 자동 검토"…BHSN, 한컴오피스에 '앨리비' 공급2026.08.13
- 로크웰오토메이션, 김낙현 한국 사장 선임…27년 산업·영업 경험2026.08.13
- 엔비디아, '네모트론 3.5 라이트닝' 공개…로컬 AI 생태계 확장2026.08.12
- '제미나이' 앱 사용자 10억 명 넘어…"챗GPT 바짝 추격"2026.08.12
사이오닉에이아이는 특정 벤치마크 점수를 끌어올리는 데 그치지 않고 언어나 분야·질문 형태가 달라져도 필요한 문서를 정확하게 찾는 모델 개발을 목표로 하고 있다. 특정 데이터셋의 성능 상승으로 다른 데이터셋의 하락을 상쇄하는 방식이 아니라 평가셋 전반에서 고른 성능 개선을 확인했다고 설명했다.
이번 모델은 범용 임베딩 모델 개발을 목표로 하는 '유레카' 프로젝트 일환으로 개발됐다. 한국어와 일본어 컴샛 임베드 모델은 현재 허깅페이스에 프리뷰 버전으로 공개됐다.











