← На главную За неделю Telegram

ИИ и софт

Новый инструмент Microsoft позволяет разработчикам ускорять тесты поведения ИИ, используя текстовые описания

Новый инструмент Microsoft для оценки поведения ИИ на основе текстовых описаний

Исследования и разработки в области искусственного интеллекта достигли значительных успехов в оценке моделей по различным критериям, включая безопасность и соответствие. Однако компании и разработчики сталкиваются с необходимостью удостовериться, что их ИИ-системы работают так, как задумано для конкретных продуктов или услуг.

Чтобы упростить этот процесс тестирования, Microsoft представила ASSERT, что расшифровывается как адаптивная система оценки на основе спецификаций для оценки и регрессионного тестирования. Эта открытая платформа позволяет использовать ИИ для преобразования описаний целей и ожидаемого поведения на естественном языке в детализированные тесты, которые можно оценивать.

ASSERT преобразует простые языковые описания ожидаемого поведения ИИ в структурированный набор допустимых и недопустимых действий, создает тестовые сценарии, запускает их в целевой системе и оценивает результаты. Платформа также фиксирует пути, по которым проходит система, включая промежуточные действия и вызовы инструментов, что помогает разработчикам выявлять причины сбоев.

Разработчики могут настраивать контекст системы, инструменты и ограничения для более точной настройки тестирования. Например, можно установить правило, что ИИ-агент не должен отправлять электронные письма за пределы компании, а конфиденциальная информация должна быть доступна только руководителям высшего звена. ASSERT будет генерировать тесты для проверки соблюдения этих правил.

По мнению Microsoft, ASSERT заполняет пробелы, которые не могут быть охвачены более общими оценками, когда речь идет о поведении ИИ, зависящем от контекста приложения или продукта. Сара Берд, директор по продукту в области ответственного ИИ, отметила, что такие оценки критически важны для принятия обоснованных решений о работе ИИ-систем.

Релиз ASSERT происходит на фоне широкой трансформации в индустрии ИИ, где акцент смещается на повторяемое тестирование и регрессионные проверки, что подтверждается инициативами таких организаций, как Стэнфордский университет и MLCommons.

Вам будет интересно

Microsoft event debuts new AI-friendly hardware and Windows changesGemini app limiting what models free & AI Plus users can access, AI Pro adding Deep ThinkWhatsApp expands parental controls to teen accounts with group alerts, Meta AI restrictionsOpenAI Launches Always-On 'Dots' Agents to Rival Meta's Muse

Источник: TechCrunch