Pipecat 1.11.0: ресемплер с ручным сбросом и оценка вызовов функций в сценариях
18 сентября 2026 года вышел Pipecat 1.11.0 — открытый Python-фреймворк для real-time голосовых и мультимодальных агентов. С прошлого разбора вышли два выпуска: 1.10.0 и 1.11.0.
Что нового
- Ручное управление границами аудиопотока. В BaseAudioResampler добавлены flush() и reset(): flush() возвращает аудио, которое ресемплер ещё держит для завершившегося потока, reset() отбрасывает его для заброшенного. Раньше границы определялись только таймаутом неактивности SOXRStreamAudioResampler — теперь вызывающий код сам решает, где поток закончился.
- Оценка вызовов функций в сценариях. В scripted eval для function_call появилась директива eval:: — каждый совпавший вызов оценивается по имени и аргументам отдельным judge-промптом. Отклонённый вызов завершает ход с kind judge_no. Это позволяет проверять аргументы, которые нельзя сопоставить дословно.
- Настройка стабильности промежуточных результатов AWS Transcribe. AWSTranscribeSTTService.Settings получил partial_results_stability — выбор «high», «medium» или «low» для стабильности промежуточных результатов распознавания. По умолчанию остаётся «high».
- Эффекты для Azure TTS. В AzureTTSService и AzureHttpTTSService добавлена настройка effect, которая передаёт аудиоэффект-процессор Azure (eq_car, eq_telecomhp8k) в запрос синтеза.
- Управление усилием рассуждения в Groq. GroqLLMService.Settings получил reasoning_effort — значения зависят от модели: «low», «medium», «high» для GPT-OSS и qwen/qwen3.8-27b, «none» и «default» для Qwen-моделей.
В выпуске 1.10.0 (12 сентября) также появились: continuation API для Smallest TTS (фрагменты текста в пределах одного хода LLM объединяются в одну непрерывную генерацию), настройка audio_out_queue_size_ms для LiveKit, серверное определение границ хода в GradiumSTTService и переход на openai 3 SDK с HTTP-клиентами на httpx2.
Что платформа умеет
Pipecat — это фреймворк для real-time голосовых и мультимодальных агентов: можно собрать одного агента или целую систему, где специалисты передают задачи друг другу, работают параллельно и координируются через общую шину — локально или распределённо. Платформа интегрирует распознавание речи, синтез речи и обработку разговора, поддерживает голос, видео и изображения. Для отладки заявлены OpenTelemetry и Sentry, для развёртывания — CLI с мониторингом и деплоем в production.
Своя модель вместо облака
Из документации следует, что своя модель подключается через Ollama. Ставится фреймворк через pip install pipecat-ai, лицензия — BSD-2-Clause.
Чем отличается от соседей
По сверке с CrewAI, Agno и AgentScope у Pipecat нет признаков, которые были бы заявлены только у него. При этом в документации Pipecat не упомянуты свои инструменты и функции, поддержка MCP, протокол A2A, память агента, база знаний (RAG) и подтверждение человеком — всё это заявлено у большинства соседей. Pipecat выделяется фокусом на real-time голосовые и мультимодальные сценарии, тогда как соседи больше ориентированы на оркестрацию автономных агентов и работу с инструментами.
| Pipecat | CrewAI | Agno | AgentScope | |
|---|---|---|---|---|
| Вид | фреймворк | фреймворк | фреймворк | фреймворк |
| Язык | Python | Python | Python | Python |
| Лицензия | BSD-2-Clause | MIT | Apache-2.0 | Apache-2.0 |
| Звёзд на GitHub | 15 677 | 58 728 | 42 233 | 31 923 |
| Выпусков за 90 дней | 8 | 23 | 29 | 6 |
| Несколько агентов в связке | есть | есть | — | есть |
| Свои инструменты и функции | — | есть | есть | есть |
| Поддержка MCP | — | есть | есть | есть |
| Протокол A2A | — | есть | есть | есть |
| Память агента | — | есть | есть | есть |
| База знаний (RAG) | — | есть | есть | есть |
| Выполнение кода в песочнице | — | — | — | есть |
| Подтверждение человеком | — | есть | есть | — |
| Графы и сохранение состояния | — | есть | — | — |
| Трассировка и отладка | есть | — | есть | — |
| Голос и речь | есть | — | — | есть |
| Свой сервер и Docker | есть | — | есть | — |
| Картинки и документы | есть | — | — | есть |
| Своя модель: Ollama | есть | есть | есть | есть |
| Своя модель: LM Studio | — | есть | — | — |
| Своя модель: OpenAI-совм. API | — | — | есть | — |
Сверка по README и документации проектов на 20.09.2026: «есть» — возможность там заявлена, прочерк — об этом не сказано (это не значит, что возможности нет). Звёзды и выпуски — по данным GitHub.
Присмотреться к обновлению стоит тем, кто уже собирает голосовых агентов на Pipecat и хочет точнее управлять границами аудиопотоков или проверять аргументы вызовов функций в сценариях. Следить за новыми выпусками платформ для агентов можно в ленте CPU3D.



