CPU3D3D、视频与音频的 AI 工具

Pipecat 1.11.0:支持手动重置的重采样器与场景中的函数调用评估

2026 年 9 月 18 日,Pipecat 1.11.0 发布——这是一个用于实时语音和多模态智能体的开源 Python 框架。自上次解析以来,共发布了两个版本:1.10.0 和 1.11.0。

新功能

  • 手动控制音频流边界。BaseAudioResampler 中新增了 flush() 和 reset():flush() 返回重采样器为已结束的流仍保留的音频,reset() 则为已废弃的流丢弃这些音频。此前边界仅由 SOXRStreamAudioResampler 的非活动超时决定——现在由调用方代码自行决定流在哪里结束。
  • 场景中函数调用的评估。scripted eval 中针对 function_call 新增了 eval:: 指令——每个匹配的调用都会按名称和参数由单独的 judge 提示词进行评估。被拒绝的调用会以 kind judge_no 结束本轮。这样可以检查无法逐字匹配的参数。
  • AWS Transcribe 中间结果稳定性设置。AWSTranscribeSTTService.Settings 新增了 partial_results_stability——可选择「high」「medium」或「low」来设置识别中间结果的稳定性。默认仍为「high」。
  • Azure TTS 的音效。AzureTTSService 和 AzureHttpTTSService 中新增了 effect 设置,将 Azure 音频效果处理器(eq_car、eq_telecomhp8k)传入合成请求。
  • Groq 中推理力度的控制。GroqLLMService.Settings 新增了 reasoning_effort——取值取决于模型:GPT-OSS 和 qwen/qwen3.8-27b 为「low」「medium」「high」,Qwen 模型为「none」和「default」。

1.10.0 版本(9 月 12 日)还新增了:Smallest TTS 的 continuation API(同一次 LLM 轮次内的文本片段会合并为一次连续生成)、LiveKit 的 audio_out_queue_size_ms 设置、GradiumSTTService 中的服务端轮次边界判定,以及迁移到 openai 3 SDK,HTTP 客户端改用 httpx2。

平台功能

Pipecat 是一个用于实时语音和多模态智能体的框架:可以构建单个智能体,也可以构建一整套系统,其中各专家相互传递任务、并行工作并通过共享总线协调——本地或分布式均可。该平台集成了语音识别、语音合成和对话处理,支持语音、视频和图像。调试方面提供了 OpenTelemetry 和 Sentry,部署方面提供了带监控和生产部署的 CLI。

用自己的模型替代云服务

从文档来看,自己的模型通过 Ollama 接入。框架通过 pip install pipecat-ai 安装,许可证为 BSD-2-Clause。

与同类产品的区别

与 CrewAI、Agno 和 AgentScope 对比后,Pipecat 没有任何仅它自己宣称的特性。同时,Pipecat 文档中没有提到自己的工具和函数、MCP 支持、A2A 协议、智能体记忆、知识库(RAG)和人工确认——这些在大多数同类产品中都有宣称。Pipecat 的突出之处在于专注实时语音和多模态场景,而同类产品更偏向自主智能体的编排和工具使用。

PipecatCrewAIAgnoAgentScope
类型框架框架框架框架
语言PythonPythonPythonPython
许可证BSD-2-ClauseMITApache-2.0Apache-2.0
GitHub 星标15 67758 72842 23331 923
90 天内发布次数823296
多智能体协同
自己的工具和函数
MCP 支持
A2A 协议
智能体记忆
知识库(RAG)
沙箱中执行代码
人工确认
图与状态保存
追踪与调试
语音与言语
自有服务器与 Docker
图片与文档
自己的模型:Ollama
自己的模型:LM Studio
自己的模型:OpenAI 兼容 API

依据各项目 README 和文档于 2026 年 9 月 20 日核对:「有」表示那里宣称了该能力,破折号表示未提及(这并不意味着没有该能力)。星标和发布次数为 GitHub 数据。

值得关注这次更新的是那些已经在 Pipecat 上构建语音智能体,并希望更精确地控制音频流边界或在场景中检查函数调用参数的人。可以在 CPU3D 动态中关注智能体平台的新版本发布。

相关阅读