Инсайты о чанкинге и не только от Google
103
Инсайты о чанкинге и не только от Google
Вот несколько интересных цитат из документации Vertex AI:
— По умолчанию документы разбиваются на чанки с определенным перекрытием для повышения релевантности и качества поиска. Стандартное перекрытие чанков составляет 200 токенов.
— Когда документы добавляются в индекс, они разбиваются на чанки. Параметр chunk_size (в токенах) определяет размер чанка. Размер чанка по умолчанию — 1024 токена.
— Меньший размер чанка означает более точные эмбеддинги. Больший размер чанка означает, что эмбеддинги могут быть более общими, но могут упускать конкретные детали.
— layout parser извлекает из документа такие элементы контента, как текст, таблицы и списки. Затем layout parser создает контекстно-зависимые чанки, которые облегчают поиск информации в генеративном ИИ и поисковых приложениях.
— LLM parser, управляемый промптом, обращал внимание на структуру заголовков и мог извлекать всю релевантную информацию, связанную с определенной темой или разделом.
— Имейте в виду, что парсинг в значительной степени зависит от HTML-тегов, поэтому форматирование на основе CSS может не учитываться.
— Связь между сгенерированным контентом и grounding chunks. Это повторяющееся поле. Каждое поле grounding_supports показывает связь между одним текстовым сегментом сгенерированного контекста и одним или несколькими чанками, полученными с помощью RAG.
— Confidence Score: Оценка, которая используется для привязки текста к определенному чанку. Максимально возможная оценка — 1, и чем выше оценка, тем выше уровень уверенности. Каждая оценка соответствует каждому grounding_chunk_indices. В вывод включаются только чанки с confidence score не ниже 0.6.
Про ranking API:
— Набор записей, релевантных запросу. Записи предоставляются в виде массива объектов. Каждая запись может включать уникальный ID, заголовок и содержимое документа. Для каждой записи указывайте либо заголовок, либо содержимое, либо и то, и другое. Максимальное количество поддерживаемых токенов на запись зависит от используемой версии модели. Например, модели до версии 003 поддерживают 512 токенов, а версия 004 — 1024 токена. Если общая длина заголовка и содержимого превышает лимит токенов модели, лишний контент обрезается. Вы можете включать до 200 записей в одном запросе.
— Score: значение с плавающей точкой от 0 до 1, которое указывает на релевантность записи.
@MikeBlazerX

– https://www.linkedin.com/feed/update/urn:li:activi...
– https://t.me/MikeBlazerX
Источник новости https://t.me/mikeblazerx/5321...

