Заметка содержит быстро устаревающие данные (лидерборд ruMTEB, конкретные модели и баллы) — status/volatile. Сверяй актуальный лидерборд при ревизии.
Суть
Общая концепция эмбеддингов — в Embeddings. Здесь — прикладной слой: какие модели реально брать под RU/RU+EN и как это проверять. Retrieval-качество меряют на ruMTEB; конкретные лидеры меняются, поэтому заметка volatile.
Зачем это нужно
Качество retrieval критичнее качества LLM («мусор на входе = мусор на выходе», см. RAG), а на русском общеязыковые англо-центричные модели часто проседают. Правильный выбор embedding-модели под RU напрямую поднимает recall и точность поиска.
Как работает (выбор)
Бенчмарк ruMTEB — RU-расширение MTEB: 23 датасета / 7 категорий (Classification, Clustering, MultiLabelCls, PairCls, Reranking, Retrieval, STS). Метрики: nDCG@10 (retrieval), MAP@10 (reranking), Spearman (STS), Accuracy (classification).
Лидеры по состоянию на 2026-08 (сверка лидерборда):
Модель ruMTEB avg Заметка Qwen3-8B ~70.6 первое место; общемультиязычная, не RU-специализированная Qwen3-4B ~69.5 вдвое легче при разнице в 1 пункт GigaEmbeddings (на базе GigaChat-3B) ~69.1 была SOTA в мае 2026, сейчас третья; vendor — Sber, нативно понимает русские реалии E5-mistral-7b-instruct 67.18 сильная multilingual-instruct mE5-large-instruct 66.03 multilingual-instruct ru-en-RoSBERTa 61.77 RU-фокус, наравне с BGE-M3 BGE-M3 61.58 популярная multilingual (dense+sparse+colbert)
Что изменилось с мая 2026 и что из этого следует. GigaEmbeddings перестала быть первой строкой лидерборда — её обошли Qwen3-8B и Qwen3-4B. Но разрыв между первой и третьей моделью — 1.5 пункта, и на практике он обычно неразличим: выбор решается не баллом, а размером, лицензией и поведением на вашем домене.
Отсюда правило, устойчивее любой таблицы: на смешанном RU+EN корпусе проверяйте обе ветки — общемультиязычную (Qwen3, BGE-M3, multilingual-e5) и RU-специализированную (GigaEmbeddings, USER-bge-m3, ru-en-RoSBERTa). RU-файнтюны обычно выигрывают на узких русских доменах и проигрывают на смешанных корпусах, где половина терминологии английская — типичный случай для технической базы знаний.
- Критерии выбора под RU/RU+EN корпус:
- бюджет памяти (ср. размеры Qwen3-emb в Embeddings) против качества;
- multilingual vs RU-специализированная — для смешанного RU+EN важна устойчивость на обоих языках;
- не верить одной цифре лидерборда — проверять на своём домене (см. открытый вопрос);
- доменная терминология (мед./юр.) → возможен finetune retrieval (см. Embeddings).
- Где смотреть актуальное:
huggingface.co/spaces/mteb/leaderboardс фильтрами по русскому языку и задаче Retrieval. Средний балл ruMTEB — плохой ориентир для RAG: он усредняет семь категорий, из которых прямое отношение к поиску имеет одна. - ruMTEB ≠ MERA: MERA оценивает генеративные LLM, ruMTEB — именно embedding-модели для retrieval.
Проверка на своём корпусе и нужен ли finetune
Процедура та же, что для любой части retrieval-контура, и набор для неё нужен один на всё: 100-300 кейсов, собранных срезами, включая перефразировки, точные сущности и вопросы без ответа в корпусе (RAG Metrics). Модели сравниваются на одном и том же наборе и одной нарезке — иначе меряется разница чанкинга, а не эмбеддингов.
Признак, по которому решают про finetune, конкретный: модель ошибается не на редких, а на частотных запросах вашего домена, и ошибается систематически — путает доменные термины, которых нет в общем языке, или считает близкими пары, различие между которыми критично именно у вас. Если же промахи разрозненные, finetune retrieval не поможет: он лечит систематический сдвиг, а не общий уровень качества.
Прежде чем дообучать, стоит исчерпать дешёвое: реранкер (Reranking) снимает заметную часть промахов ранжирования, а гибридный поиск (Hybrid Search) закрывает именно те случаи, где важно точное совпадение термина, — а это и есть типичная слабость эмбеддингов на доменной лексике.
Связано с
- Embeddings — что такое эмбеддинги (базовый стабильный концепт)
- RAG — где embedding-модель работает (retrieval-слой)
- Model Selection — общий выбор модели под задачу; здесь — частный случай для RU embedding-моделей