Этот проект представляет собой фреймворк для проведения и оценки мультиагентных экспериментов. Он включает автоматизированные пайплайны запуска задач в разных экспериментальных режимах и последующий анализ качества полученных результатов. В системе доступны синхронные и асинхронные исполнители, а также модульный набор инструментов для расчёта rule-based и LLM-метрик.
Цель проекта — упростить масштабные и воспроизводимые эксперименты с мультиагентными сценариями. Система позволяет системно проверять разные конфигурации агентов (режимы), собирать артефакты выполнения (включая расход токенов и время), а затем автоматически оценивать качество спецификаций, use case’ов и user story. Финальная задача — количественно сравнивать эффективность стратегий мультиагентного взаимодействия.