SEOFAQ Telegram, маркетинг и SEO Канал SEOFAQT в мессенджере Telegram

Все чаты​Инсайты о чанкинге и не только от Google

 103  


​Инсайты о чанкинге и не только от Google

Вот несколько интересных цитат из документации Vertex AI:

— По умолчанию документы разбиваются на чанки с определенным перекрытием для повышения релевантности и качества поиска. Стандартное перекрытие чанков составляет 200 токенов.

— Когда документы добавляются в индекс, они разбиваются на чанки. Параметр chunk_size (в токенах) определяет размер чанка. Размер чанка по умолчанию — 1024 токена.

— Меньший размер чанка означает более точные эмбеддинги. Больший размер чанка означает, что эмбеддинги могут быть более общими, но могут упускать конкретные детали.

— layout parser извлекает из документа такие элементы контента, как текст, таблицы и списки. Затем layout parser создает контекстно-зависимые чанки, которые облегчают поиск информации в генеративном ИИ и поисковых приложениях.

— LLM parser, управляемый промптом, обращал внимание на структуру заголовков и мог извлекать всю релевантную информацию, связанную с определенной темой или разделом.

— Имейте в виду, что парсинг в значительной степени зависит от HTML-тегов, поэтому форматирование на основе CSS может не учитываться.

— Связь между сгенерированным контентом и grounding chunks. Это повторяющееся поле. Каждое поле grounding_supports показывает связь между одним текстовым сегментом сгенерированного контекста и одним или несколькими чанками, полученными с помощью RAG.

— Confidence Score: Оценка, которая используется для привязки текста к определенному чанку. Максимально возможная оценка — 1, и чем выше оценка, тем выше уровень уверенности. Каждая оценка соответствует каждому grounding_chunk_indices. В вывод включаются только чанки с confidence score не ниже 0.6.

Про ranking API:

— Набор записей, релевантных запросу. Записи предоставляются в виде массива объектов. Каждая запись может включать уникальный ID, заголовок и содержимое документа. Для каждой записи указывайте либо заголовок, либо содержимое, либо и то, и другое. Максимальное количество поддерживаемых токенов на запись зависит от используемой версии модели. Например, модели до версии 003 поддерживают 512 токенов, а версия 004 — 1024 токена. Если общая длина заголовка и содержимого превышает лимит токенов модели, лишний контент обрезается. Вы можете включать до 200 записей в одном запросе.

— Score: значение с плавающей точкой от 0 до 1, которое указывает на релевантность записи.

@MikeBlazerX

Ссылки из поста:
https://www.linkedin.com/feed/update/urn:li:activi...
https://t.me/MikeBlazerX

Источник новости https://t.me/mikeblazerx/5321...