Как работает Llama Nemotron Embed VL 1B V2?
Llama Nemotron Embed VL 1B V2 — мультимодальная модель эмбеддингов от NVIDIA, рассчитанная на поиск ответов по разнородным документам: она переводит в единое векторное пространство текст, изображение или связку изображение плюс текст, поэтому один индекс покрывает и страницы, и скриншоты. Через BotHub модель доступна из России без VPN и зарубежной карты, с оплатой в рублях по факту использования и через единый OpenAI-совместимый API, так что подключение к Qdrant, pgvector или собственному пайплайну не требует переписывания кода. Применяют её для RAG-поиска по технической документации, кластеризации карточек товаров с фото, дедупликации и ранжирования внутренних баз знаний.Частые вопросы о Llama Nemotron Embed VL 1B V2
Вы можете использовать результаты генерации в коммерческих целях. Все права на созданный контент принадлежат вам. Единственное ограничение: убедитесь, что в запросе не использовались защищённые авторским правом материалы третьих сторон. Ответственность за соблюдение прав на входные данные лежит на пользователе.
Это мультимодальная embedding-модель: она превращает текст, документы и изображения в векторы, а не генерирует контент. Подходит для семантического поиска, RAG, кластеризации и дедупликации, ранжирования и поиска по картинкам. Векторы складывайте в Qdrant или pgvector и ищите по близости.
Нисколько: на выходе вы получаете не текст, а числовой вектор. В наших данных указан технический потолок ответа — 43253 токена, но он относится к формату API-ответа. Для генерации статей и писем выбирайте в BotHub любую генеративную модель.
Отдельный режим рассуждений в наших данных не отмечен, и для эмбеддингов он не нужен: модель не строит цепочку мыслей, а кодирует смысл фрагмента в вектор. Логику поверх результатов обычно задаёт ваш пайплайн — ранжирование, фильтры и генеративная модель на финальном шаге.
Вызов функций и строгие JSON-схемы в наших данных не отмечены — это инструменты генеративных моделей. Но сам ответ приходит структурированным JSON с массивом векторов через единый OpenAI-совместимый API BotHub, так что встроить модель в существующий пайплайн несложно.
Изображения и документы — да, это ровно её профиль: VL-модель кодирует картинки и текстовые фрагменты в одно векторное пространство, поэтому можно искать изображения по описанию и наоборот. Приём аудио и видео в наших данных не отмечен. Контекст — 131072 токена.
Данных о языках у нас нет, поэтому обещать ничего не будем — качество эмбеддингов на вашем домене проверяется только замером. Соберите небольшой набор запросов и правильных ответов, посчитайте recall и сравните с другой моделью в BotHub, не меняя интеграцию.