daily - Daily real-time voice and multimodal AI
Provides guidance for building real-time voice and multimodal AI applications with Daily or Pipecat-style transports.
Tags
Updated: 2026-09-29Capabilities
Typical Inputs
Typical Outputs
What this skill does
- Build real-time voice pipelines
- Process multimodal inputs
- Integrate AI services
- Configure speech recognition
- Configure speech synthesis
- Connect external tools
- Manage conversation context
- Handle turn taking
- Monitor pipeline performance
- Deploy scalable applications
Inputs
- User audio
- User video
- User text
- AI service configurations
- Transport configurations
- Conversation context
- Tool definitions
- External API data
- Deployment configuration
Outputs
- Transcriptions
- Synthesized audio
- Language model responses
- Multimodal processing results
- Conversation context updates
- Connection lifecycle events
- Latency metrics
- Usage metrics
- Distributed traces
Requirements
- Supported transport
- Configured AI services
- Required service credentials
- Compatible client SDK
