Примечание.
Для доступа к этой странице требуется авторизация. Вы можете попробовать войти или изменить каталоги.
Для доступа к этой странице требуется авторизация. Вы можете попробовать изменить каталоги.
SynapseML (ранее известный как MMLSpark) — это библиотека с открытым кодом, которая упрощает создание масштабируемых конвейеров машинного обучения (ML) и LLM. SynapseML предоставляет простые, составные и распределенные API для задач машинного обучения, таких как анализ текста, компьютерное зрение и обнаружение аномалий. SynapseML основан на распределенной вычислительной платформе Apache Spark и использует тот же API, что и библиотека Spark MLlib. Это выравнивание позволяет внедрять модели SynapseML в существующие рабочие процессы Apache Spark.
С помощью SynapseML можно создавать масштабируемые интеллектуальные системы для решения проблем в доменах, таких как обнаружение аномалий, компьютерное зрение, глубокое обучение и анализ текста. SynapseML обучает и оценивает модели на одном узле, нескольких узлах и эластично изменяемых кластерах. Этот подход позволяет масштабировать работу без использования ресурсов. SynapseML работает с Python, R, Scala, Java и .NET. Его API работает со многими базами данных, файловыми системами и облачными хранилищами данных, чтобы упростить эксперименты независимо от того, где хранятся данные.
Чтобы включить преобразования на основе ИИ в рабочие процессы данных, рекомендуется использовать функции ИИ Fabric в качестве простого подхода. Сведения о распределенной обработке с полным контролем см. в статье "Использование Azure OpenAI с SynapseML".
Installation
SynapseML предварительно установлен в средах выполнения Fabric PySpark. Определенную версию можно установить, ссылаясь на страницу установки.
Перейдите к краткому руководству: первые модели для создания первого конвейера. Ознакомьтесь с openAI.ipynb , чтобы просмотреть примеры использования Azure OpenAI с SynapseML.
Ключевые функции SynapseML
SynapseML предлагает простую интеграцию и предварительно обученные ресурсы, чтобы лучше понять и применить данные к вашим бизнес-потребностям. SynapseML объединяет несколько существующих платформ машинного обучения и расширяет вызовы API LLM в масштабе вместе с новыми алгоритмами Майкрософт в одном масштабируемом API, который можно использовать в Python, R, Scala и Java. SynapseML также помогает разработчикам понять прогнозы моделей, введя новые инструменты для выявления того, почему модели делают определенные прогнозы и как улучшить набор данных обучения для устранения предвзятости.
Единый API для создания, обучения и оценки моделей
SynapseML предлагает единый API, упрощающий разработку отказоустойчивых распределенных программ. В частности, SynapseML предоставляет множество различных платформ машинного обучения в рамках одного API, который является масштабируемым, не зависящим от данных и языка, и работает для пакетной, потоковой передачи и обслуживания приложений.
Унифицированный API стандартизирует множество инструментов, платформ и алгоритмов и упрощает распределенный интерфейс машинного обучения. Это позволяет разработчикам быстро создавать разрозненные платформы машинного обучения, очищать код и поддерживать рабочие процессы, требующие нескольких платформ. Например, для рабочих процессов, таких как веб-защищенное обучение или создание поисковой системы, требуются несколько служб и платформ. SynapseML защищает пользователей от этой дополнительной сложности.
Использование предварительно созданных интеллектуальных моделей
Инструменты SynapseML не требуют большого обучающего набора данных с метками. Вместо этого SynapseML предоставляет простые API-интерфейсы для предварительно созданных интеллектуальных служб, таких как Средства Foundry, для быстрого решения крупномасштабных задач искусственного интеллекта, связанных как с бизнесом, так и с исследованиями. SynapseML позволяет разработчикам внедрять более 50 различных служб машинного обучения непосредственно в свои системы и базы данных. Эти готовые алгоритмы могут анализировать широкий спектр документов, транскрибировать беседы с несколькими ораторами в режиме реального времени и переводить текст на более чем 100 языков.
Для простого подхода к использованию Azure OpenAI в Fabric рассмотрим функции ИИ, которые предоставляют расширения Pandas и PySpark DataFrame с минимальным кодом. Сведения о распределенной обработке с полным контролем см. в статье "Использование Azure OpenAI с SynapseML". Для дополнительных примеров использования готового ИИ для быстрого решения задач см. когнитивные примеры SynapseML.
Чтобы обеспечить быструю и эффективную интеграцию SynapseML с Средствами Foundry, SynapseML предоставляет множество оптимизаций для рабочих процессов, ориентированных на обслуживание. В частности, SynapseML автоматически анализирует распространенные ответы на ограничения скорости, чтобы убедиться, что задания не перегружают серверные службы. Кроме того, он использует экспоненциальный алгоритм отката для обработки ненадежных сетевых подключений и неудачных ответов. Наконец, рабочие машины Spark остаются заняты новыми примитивами асинхронного параллелизма. Асинхронная параллелизм позволяет рабочим машинам отправлять запросы во время ожидания ответа от сервера и может обеспечить десятикратное увеличение пропускной способности.
Широкая совместимость экосистем с ONNX
SynapseML позволяет разработчикам использовать модели из многих различных экосистем машинного обучения с помощью платформы Open Neural Network Exchange (ONNX). С помощью этой интеграции можно выполнять широкий спектр классических и глубоких моделей обучения в масштабе только с несколькими строками кода. SynapseML автоматически обрабатывает распространение моделей ONNX на рабочие узлы, пакетизацию и буферизацию входных данных для высокой пропускной способности и планирование работы с аппаратными ускорителями.
Перенос ONNX в Spark не только помогает разработчикам масштабировать модели глубокого обучения, но и обеспечивает распределенные выводы в разнообразных экосистемах машинного обучения. В частности, ONNXMLTools преобразует модели из TensorFlow, scikit-learn, Core ML, LightGBM, XGBoost, H2O и PyTorch в ONNX для ускорения и распределенного вывода с помощью SynapseML.
Создание ответственных систем ИИ
После создания модели необходимо, чтобы исследователи и инженеры понимали свои ограничения и поведение перед развертыванием. SynapseML помогает разработчикам и исследователям создавать ответственные системы ИИ, внедряя новые инструменты, которые показывают, почему модели делают определенные прогнозы и как улучшить набор данных обучения для устранения предвзятости. SynapseML значительно ускоряет процесс понимания обученной модели пользователя, позволяя разработчикам распределять вычисления по сотням компьютеров. В частности, SynapseML включает в себя распределенные реализации инструкций по интерпретации шаплейских аддитивных объяснений (SHAP) и локально интерпретируемых Model-Agnostic объяснений (LIME) для объяснения прогнозов зрения, текста и табличных моделей. Он также включает такие средства, как индивидуальное условное ожидание (ICE) и частичный анализ зависимости для распознавания предвзятых наборов данных.
Поддержка предприятия в Azure Synapse Analytics
SynapseML общедоступен в Azure Synapse Analytics с поддержкой предприятия. Создание крупномасштабных конвейеров машинного обучения с помощью средств Foundry, LightGBM, ONNX и других выбранных функций SynapseML. Используйте шаблоны для быстрого прототипа распределенных систем машинного обучения, таких как визуальные поисковые системы, конвейеры прогнозного обслуживания и перевод документов.
Связанный контент
Использование служб ИИ в Fabric
- Обзор функций ИИ — самый простой подход для операций преобразования текста
- Использование Azure OpenAI с SynapseML — распределенная обработка для крупномасштабных рабочих нагрузок
- Использование Azure OpenAI с пакетом SDK для Python — точное управление для отдельных вызовов API
- Инструменты Foundry в SynapseML с использованием собственных ключей — специализированные инструменты Foundry