Pipecat 1.11.0:支持手动重置的重采样器与场景中的函数调用评估
2026 年 9 月 18 日,Pipecat 1.11.0 发布——这是一个用于实时语音和多模态智能体的开源 Python 框架。自上次解析以来,共发布了两个版本:1.10.0 和 1.11.0。
新功能
- 手动控制音频流边界。BaseAudioResampler 中新增了 flush() 和 reset():flush() 返回重采样器为已结束的流仍保留的音频,reset() 则为已废弃的流丢弃这些音频。此前边界仅由 SOXRStreamAudioResampler 的非活动超时决定——现在由调用方代码自行决定流在哪里结束。
- 场景中函数调用的评估。scripted eval 中针对 function_call 新增了 eval:: 指令——每个匹配的调用都会按名称和参数由单独的 judge 提示词进行评估。被拒绝的调用会以 kind judge_no 结束本轮。这样可以检查无法逐字匹配的参数。
- AWS Transcribe 中间结果稳定性设置。AWSTranscribeSTTService.Settings 新增了 partial_results_stability——可选择「high」「medium」或「low」来设置识别中间结果的稳定性。默认仍为「high」。
- Azure TTS 的音效。AzureTTSService 和 AzureHttpTTSService 中新增了 effect 设置,将 Azure 音频效果处理器(eq_car、eq_telecomhp8k)传入合成请求。
- Groq 中推理力度的控制。GroqLLMService.Settings 新增了 reasoning_effort——取值取决于模型:GPT-OSS 和 qwen/qwen3.8-27b 为「low」「medium」「high」,Qwen 模型为「none」和「default」。
1.10.0 版本(9 月 12 日)还新增了:Smallest TTS 的 continuation API(同一次 LLM 轮次内的文本片段会合并为一次连续生成)、LiveKit 的 audio_out_queue_size_ms 设置、GradiumSTTService 中的服务端轮次边界判定,以及迁移到 openai 3 SDK,HTTP 客户端改用 httpx2。
平台功能
Pipecat 是一个用于实时语音和多模态智能体的框架:可以构建单个智能体,也可以构建一整套系统,其中各专家相互传递任务、并行工作并通过共享总线协调——本地或分布式均可。该平台集成了语音识别、语音合成和对话处理,支持语音、视频和图像。调试方面提供了 OpenTelemetry 和 Sentry,部署方面提供了带监控和生产部署的 CLI。
用自己的模型替代云服务
从文档来看,自己的模型通过 Ollama 接入。框架通过 pip install pipecat-ai 安装,许可证为 BSD-2-Clause。
与同类产品的区别
与 CrewAI、Agno 和 AgentScope 对比后,Pipecat 没有任何仅它自己宣称的特性。同时,Pipecat 文档中没有提到自己的工具和函数、MCP 支持、A2A 协议、智能体记忆、知识库(RAG)和人工确认——这些在大多数同类产品中都有宣称。Pipecat 的突出之处在于专注实时语音和多模态场景,而同类产品更偏向自主智能体的编排和工具使用。
| Pipecat | CrewAI | Agno | AgentScope | |
|---|---|---|---|---|
| 类型 | 框架 | 框架 | 框架 | 框架 |
| 语言 | Python | Python | Python | Python |
| 许可证 | BSD-2-Clause | MIT | Apache-2.0 | Apache-2.0 |
| GitHub 星标 | 15 677 | 58 728 | 42 233 | 31 923 |
| 90 天内发布次数 | 8 | 23 | 29 | 6 |
| 多智能体协同 | 有 | 有 | — | 有 |
| 自己的工具和函数 | — | 有 | 有 | 有 |
| MCP 支持 | — | 有 | 有 | 有 |
| A2A 协议 | — | 有 | 有 | 有 |
| 智能体记忆 | — | 有 | 有 | 有 |
| 知识库(RAG) | — | 有 | 有 | 有 |
| 沙箱中执行代码 | — | — | — | 有 |
| 人工确认 | — | 有 | 有 | — |
| 图与状态保存 | — | 有 | — | — |
| 追踪与调试 | 有 | — | 有 | — |
| 语音与言语 | 有 | — | — | 有 |
| 自有服务器与 Docker | 有 | — | 有 | — |
| 图片与文档 | 有 | — | — | 有 |
| 自己的模型:Ollama | 有 | 有 | 有 | 有 |
| 自己的模型:LM Studio | — | 有 | — | — |
| 自己的模型:OpenAI 兼容 API | — | — | 有 | — |
依据各项目 README 和文档于 2026 年 9 月 20 日核对:「有」表示那里宣称了该能力,破折号表示未提及(这并不意味着没有该能力)。星标和发布次数为 GitHub 数据。
值得关注这次更新的是那些已经在 Pipecat 上构建语音智能体,并希望更精确地控制音频流边界或在场景中检查函数调用参数的人。可以在 CPU3D 动态中关注智能体平台的新版本发布。


