RU Embedding Model Selection

Выбор embedding-модели для русскоязычного и смешанного RU+EN retrieval (RAG). Главный ориентир — бенчмарк ruMTEB (RU-версия MTEB именно для эмбеддингов, не путать с MERA для LLM). «Лучшей» модели нет — есть подходящая под корпус и бюджет.

Заметка содержит быстро устаревающие данные (лидерборд ruMTEB, конкретные модели и баллы) — status/volatile. Сверяй актуальный лидерборд при ревизии.

Суть

Общая концепция эмбеддингов — в Embeddings. Здесь — прикладной слой: какие модели реально брать под RU/RU+EN и как это проверять. Retrieval-качество меряют на ruMTEB; конкретные лидеры меняются, поэтому заметка volatile.

Зачем это нужно

Качество retrieval критичнее качества LLM («мусор на входе = мусор на выходе», см. RAG), а на русском общеязыковые англо-центричные модели часто проседают. Правильный выбор embedding-модели под RU напрямую поднимает recall и точность поиска.

Как работает (выбор)

  • Бенчмарк ruMTEB — RU-расширение MTEB: 23 датасета / 7 категорий (Classification, Clustering, MultiLabelCls, PairCls, Reranking, Retrieval, STS). Метрики: nDCG@10 (retrieval), MAP@10 (reranking), Spearman (STS), Accuracy (classification).

  • Лидеры по состоянию на 2026-08 (сверка лидерборда):

    Модель ruMTEB avg Заметка
    Qwen3-8B ~70.6 первое место; общемультиязычная, не RU-специализированная
    Qwen3-4B ~69.5 вдвое легче при разнице в 1 пункт
    GigaEmbeddings (на базе GigaChat-3B) ~69.1 была SOTA в мае 2026, сейчас третья; vendor — Sber, нативно понимает русские реалии
    E5-mistral-7b-instruct 67.18 сильная multilingual-instruct
    mE5-large-instruct 66.03 multilingual-instruct
    ru-en-RoSBERTa 61.77 RU-фокус, наравне с BGE-M3
    BGE-M3 61.58 популярная multilingual (dense+sparse+colbert)

Что изменилось с мая 2026 и что из этого следует. GigaEmbeddings перестала быть первой строкой лидерборда — её обошли Qwen3-8B и Qwen3-4B. Но разрыв между первой и третьей моделью — 1.5 пункта, и на практике он обычно неразличим: выбор решается не баллом, а размером, лицензией и поведением на вашем домене.

Отсюда правило, устойчивее любой таблицы: на смешанном RU+EN корпусе проверяйте обе ветки — общемультиязычную (Qwen3, BGE-M3, multilingual-e5) и RU-специализированную (GigaEmbeddings, USER-bge-m3, ru-en-RoSBERTa). RU-файнтюны обычно выигрывают на узких русских доменах и проигрывают на смешанных корпусах, где половина терминологии английская — типичный случай для технической базы знаний.

  • Критерии выбора под RU/RU+EN корпус:
    • бюджет памяти (ср. размеры Qwen3-emb в Embeddings) против качества;
    • multilingual vs RU-специализированная — для смешанного RU+EN важна устойчивость на обоих языках;
    • не верить одной цифре лидерборда — проверять на своём домене (см. открытый вопрос);
    • доменная терминология (мед./юр.) → возможен finetune retrieval (см. Embeddings).
  • Где смотреть актуальное: huggingface.co/spaces/mteb/leaderboard с фильтрами по русскому языку и задаче Retrieval. Средний балл ruMTEB — плохой ориентир для RAG: он усредняет семь категорий, из которых прямое отношение к поиску имеет одна.
  • ruMTEB ≠ MERA: MERA оценивает генеративные LLM, ruMTEB — именно embedding-модели для retrieval.

Проверка на своём корпусе и нужен ли finetune

Процедура та же, что для любой части retrieval-контура, и набор для неё нужен один на всё: 100-300 кейсов, собранных срезами, включая перефразировки, точные сущности и вопросы без ответа в корпусе (RAG Metrics). Модели сравниваются на одном и том же наборе и одной нарезке — иначе меряется разница чанкинга, а не эмбеддингов.

Признак, по которому решают про finetune, конкретный: модель ошибается не на редких, а на частотных запросах вашего домена, и ошибается систематически — путает доменные термины, которых нет в общем языке, или считает близкими пары, различие между которыми критично именно у вас. Если же промахи разрозненные, finetune retrieval не поможет: он лечит систематический сдвиг, а не общий уровень качества.

Прежде чем дообучать, стоит исчерпать дешёвое: реранкер (Reranking) снимает заметную часть промахов ранжирования, а гибридный поиск (Hybrid Search) закрывает именно те случаи, где важно точное совпадение термина, — а это и есть типичная слабость эмбеддингов на доменной лексике.

Связано с

  • Embeddings — что такое эмбеддинги (базовый стабильный концепт)
  • RAG — где embedding-модель работает (retrieval-слой)
  • Model Selection — общий выбор модели под задачу; здесь — частный случай для RU embedding-моделей