🪴 Prabhav's Log
Search
Search
Dark mode
Light mode
Explorer
BlogPosts
Audio Features
Classifier Metrics
Course Work
Deep Learning Optimizers
Environment Setup
KMeans Clustering
Resources
Understanding Latents: Variational Auto-Encoder
GradSchool
GradSchool
Research Wikis
Audio LLM Wiki
Concepts
Audio-Text Pretraining Patterns
Encoder-Free Early Fusion
Full-Duplex Spoken Dialogue
Inner Monologue
Interaction Models
Interaction-Background Model Split
Multi-Stream Audio Modeling
RQ-Transformer
Speech Understanding
Thinker-Talker Architecture
Time-Aligned Micro-Turns
Entities
AuT (Audio Transformer)
FD-bench
Helium
Mimi (neural audio codec)
Moshi
Qwen3-Omni
TML-Interaction-Small
Voxtral
Sources
Interaction Models: A Scalable Approach to Human-AI Collaboration
Moshi: a speech-text foundation model for real-time dialogue
Qwen3-Omni (technical report)
Voxtral
Topics
Real-Time Interactive Speech Models
Home
❯
tags
❯
Tag: speech
Tag: speech
16 items with this tag.
Jul 22, 2026
RQ-Transformer
concept
architecture
speech
Jul 22, 2026
Speech Understanding
concept
speech
multimodal
architecture
Jul 22, 2026
Thinker-Talker Architecture
concept
speech
architecture
speech-generation
streaming
Jul 22, 2026
AuT (Audio Transformer)
entity
model
audio
speech
audio-encoder
Jul 22, 2026
Mimi (neural audio codec)
entity
model
audio-codec
speech
Jul 22, 2026
Moshi
entity
model
speech
full-duplex
Jul 22, 2026
Qwen3-Omni
entity
model
multimodal
omni-modal
audio
speech
full-duplex
open-weights
Jul 22, 2026
Voxtral
entity
model
speech
audio-understanding
multimodal
open-weights
Jul 22, 2026
Moshi: a speech-text foundation model for real-time dialogue
source
speech
full-duplex
real-time
multimodal
Jul 22, 2026
Qwen3-Omni (technical report)
source
paper
multimodal
audio
speech
Jul 22, 2026
Voxtral
source
speech
audio-understanding
multimodal
open-weights
Jul 22, 2026
Real-Time Interactive Speech Models
topic
real-time
speech
full-duplex
Jul 22, 2026
Audio-Text Pretraining Patterns
concept
training
speech
multimodal
Jul 22, 2026
Full-Duplex Spoken Dialogue
concept
speech
real-time
human-ai-collaboration
Jul 22, 2026
Inner Monologue
concept
speech
architecture
Jul 22, 2026
Multi-Stream Audio Modeling
concept
speech
architecture
real-time