Использование средства file_search
Подсказка
Дополнительные сведения см. на вкладке "Текст и изображения ".
Средство file_search позволяет модели получать соответствующие сведения из собственных отправленных документов во время ответа.
Что такое средство file_search?
Средство file_search помогает модели отвечать на вопросы с помощью частных или доменных файлов, таких как документы политики, руководства, контракты и внутренние базы знаний. Вместо того чтобы полагаться только на общие обучающие данные, модель может выполнять поиск индексированного содержимого файла и возвращать обоснованные ответы.
Это особенно полезно, если вам нужны точные ответы из доверенных внутренних документов.
К ключевым функциям относятся:
- Ответы, основанные на документе. Ответы основаны на отправленных файлах
- Семантический поиск - Поиск соответствующих фрагментов по значению, а не только по точным совпадениям ключевых слов
- Интеграция хранилища векторов — поиск по одной или нескольким индексированных коллекциям документов
- Ссылки и прозрачность — включение сопоставленных результатов для отладки и трассировки
- Повышение релевантности предприятия . Использование знаний, относящихся к организации, в выходных данных модели
Распространенные варианты использования
| Вариант использования | Пример |
|---|---|
| Вопросы и ответы о политике | Ответы на вопросы сотрудников из PDF-файлов политики кадров |
| Помощники по поддержке | Извлечение шагов устранения неполадок для продукта из внутренних руководств |
| Юридическая проверка | Нахождение определенных пунктов в документах контракта |
| Обнаружение набора знаний | Сводка ответов из технических наборов документации |
Простой пример
Ниже приведен пример использования API ответов OpenAI с включенным file_search:
from openai import OpenAI
client = OpenAI(
base_url={openai_endpoint},
api_key={auth_key_or_token}
)
# Create vector store and upload a file
vector_store = client.vector_stores.create(name="policy-docs")
client.vector_stores.files.upload_and_poll(
vector_store_id=vector_store.id,
file=open("expenses_policy.pdf", "rb")
)
# Get response using the file_search tool
response = client.responses.create(
model=model_deployment,
instructions="You are an AI assistant that provides information from HR policy documents.",
input="What's the maximum amount I can claim for a taxi ride?",
tools=[{
"type": "file_search",
"vector_store_ids": [vector_store.id]
}],
include=["file_search_call.results"]
)
print(response.output_text)
В этой программе модель выполняет поиск индексированного файла политики и использует извлеченные фрагменты для создания обоснованного ответа.
Как работает средство file_search
Общий процесс использования средства file_search:
- Вы подготавливаете файлы — загружаете документы в векторное хранилище.
- Вы отправляете запрос . Включите file_search в массив инструментов с идентификаторами векторного хранилища.
- Модель выполняет извлечение . Выполняет поиск индексированных блоков для соответствующего содержимого.
- Результаты вводятся - Соответствующие фрагменты предоставляются модели.
- Ответ сформирован — модель формирует ответ с использованием контекста извлеченного документа.
Лучшие практики
- Используйте высококачественные исходные файлы - Чистые и актуальные документы повышают точность извлечения.
- Создавайте точные подсказки — задавайте конкретные вопросы, чтобы уменьшить неоднозначные совпадения.
- Тщательно организуйте вектор области - отделяйте домены (HR, юридические, финансовые) для удобства
- Включение результатов извлечения в разработку - Используйте включение ответа для устранения неполадок
- Просмотрите ответы на критически важные рабочие процессы - Сохранение проверки человеком в критических ситуациях
Ограничения, о которые следует знать
- Качество ответа зависит от качества документа, охвата и релевантности блоков
- Очень большие или смешанные хранилища данных могут возвращать менее специфичный контекст
- Обновленные исходные файлы могут потребовать повторного индексирования перед поиском нового содержимого
- Извлечение улучшает обоснование, но не заменяет человеческий обзор при принятии деликатных решений.
При правильном использовании file_search превращает модель общего назначения в помощника, обладающего знанием домена, который может отвечать на вопросы, исходящие из документов, которые ваша команда действительно использует.
Замечание
Средство «file_search» — отличный способ привязки модели к определенному набору документов или файлов данных. Однако для агентов корпоративного масштаба, которым требуется доступ к большим объемам данных в нескольких хранилищах данных, следует рассмотреть возможность использования решения хранилища знаний Foundry IQ с агентом Microsoft Foundry. Дополнительные сведения см. в статье о создании агентов искусственного интеллекта с помощью Foundry IQ