Использование средства file_search

Завершено

Подсказка

Дополнительные сведения см. на вкладке "Текст и изображения ".

Средство file_search позволяет модели получать соответствующие сведения из собственных отправленных документов во время ответа.

Что такое средство file_search?

Средство file_search помогает модели отвечать на вопросы с помощью частных или доменных файлов, таких как документы политики, руководства, контракты и внутренние базы знаний. Вместо того чтобы полагаться только на общие обучающие данные, модель может выполнять поиск индексированного содержимого файла и возвращать обоснованные ответы.

Это особенно полезно, если вам нужны точные ответы из доверенных внутренних документов.

К ключевым функциям относятся:

  • Ответы, основанные на документе. Ответы основаны на отправленных файлах
  • Семантический поиск - Поиск соответствующих фрагментов по значению, а не только по точным совпадениям ключевых слов
  • Интеграция хранилища векторов — поиск по одной или нескольким индексированных коллекциям документов
  • Ссылки и прозрачность — включение сопоставленных результатов для отладки и трассировки
  • Повышение релевантности предприятия . Использование знаний, относящихся к организации, в выходных данных модели

Распространенные варианты использования

Вариант использования Пример
Вопросы и ответы о политике Ответы на вопросы сотрудников из PDF-файлов политики кадров
Помощники по поддержке Извлечение шагов устранения неполадок для продукта из внутренних руководств
Юридическая проверка Нахождение определенных пунктов в документах контракта
Обнаружение набора знаний Сводка ответов из технических наборов документации

Простой пример

Ниже приведен пример использования API ответов OpenAI с включенным file_search:

from openai import OpenAI

client = OpenAI(
    base_url={openai_endpoint},
    api_key={auth_key_or_token}
)

# Create vector store and upload a file
vector_store = client.vector_stores.create(name="policy-docs")
client.vector_stores.files.upload_and_poll(
    vector_store_id=vector_store.id,
    file=open("expenses_policy.pdf", "rb")
)

# Get response using the file_search tool
response = client.responses.create(
    model=model_deployment,
    instructions="You are an AI assistant that provides information from HR policy documents.",
    input="What's the maximum amount I can claim for a taxi ride?",
    tools=[{
        "type": "file_search",
        "vector_store_ids": [vector_store.id]
    }],
    include=["file_search_call.results"]
)
print(response.output_text)

В этой программе модель выполняет поиск индексированного файла политики и использует извлеченные фрагменты для создания обоснованного ответа.

Как работает средство file_search

Общий процесс использования средства file_search:

  1. Вы подготавливаете файлы — загружаете документы в векторное хранилище.
  2. Вы отправляете запрос . Включите file_search в массив инструментов с идентификаторами векторного хранилища.
  3. Модель выполняет извлечение . Выполняет поиск индексированных блоков для соответствующего содержимого.
  4. Результаты вводятся - Соответствующие фрагменты предоставляются модели.
  5. Ответ сформирован — модель формирует ответ с использованием контекста извлеченного документа.

Лучшие практики

  • Используйте высококачественные исходные файлы - Чистые и актуальные документы повышают точность извлечения.
  • Создавайте точные подсказки — задавайте конкретные вопросы, чтобы уменьшить неоднозначные совпадения.
  • Тщательно организуйте вектор области - отделяйте домены (HR, юридические, финансовые) для удобства
  • Включение результатов извлечения в разработку - Используйте включение ответа для устранения неполадок
  • Просмотрите ответы на критически важные рабочие процессы - Сохранение проверки человеком в критических ситуациях

Ограничения, о которые следует знать

  • Качество ответа зависит от качества документа, охвата и релевантности блоков
  • Очень большие или смешанные хранилища данных могут возвращать менее специфичный контекст
  • Обновленные исходные файлы могут потребовать повторного индексирования перед поиском нового содержимого
  • Извлечение улучшает обоснование, но не заменяет человеческий обзор при принятии деликатных решений.

При правильном использовании file_search превращает модель общего назначения в помощника, обладающего знанием домена, который может отвечать на вопросы, исходящие из документов, которые ваша команда действительно использует.

Замечание

Средство «file_search» — отличный способ привязки модели к определенному набору документов или файлов данных. Однако для агентов корпоративного масштаба, которым требуется доступ к большим объемам данных в нескольких хранилищах данных, следует рассмотреть возможность использования решения хранилища знаний Foundry IQ с агентом Microsoft Foundry. Дополнительные сведения см. в статье о создании агентов искусственного интеллекта с помощью Foundry IQ