🪴 Prabhav's Log
Search
Search
Dark mode
Light mode
Explorer
BlogPosts
Audio Features
Classifier Metrics
Course Work
Deep Learning Optimizers
Environment Setup
KMeans Clustering
Resources
Understanding Latents: Variational Auto-Encoder
GradSchool
GradSchool
Research Wikis
Audio LLM Wiki
Concepts
Audio-Text Pretraining Patterns
Encoder-Free Early Fusion
Full-Duplex Spoken Dialogue
Inner Monologue
Interaction Models
Interaction-Background Model Split
Multi-Stream Audio Modeling
RQ-Transformer
Speech Understanding
Thinker-Talker Architecture
Time-Aligned Micro-Turns
Entities
AuT (Audio Transformer)
FD-bench
Helium
Mimi (neural audio codec)
Moshi
Qwen3-Omni
TML-Interaction-Small
Voxtral
Sources
Interaction Models: A Scalable Approach to Human-AI Collaboration
Moshi: a speech-text foundation model for real-time dialogue
Qwen3-Omni (technical report)
Voxtral
Topics
Real-Time Interactive Speech Models
Home
❯
BlogPosts
Folder: BlogPosts
8 items under this folder.
Jul 22, 2026
Audio Features
Jul 22, 2026
Classifier Metrics
Jul 22, 2026
Course Work
Jul 22, 2026
Environment Setup
Jul 22, 2026
Resources
Jan 14, 2026
Deep Learning Optimizers
optimizers
adam
adagrad
rmsprop
muon
machine-learning
deep-learning
Sep 26, 2025
Understanding Latents: Variational Auto-Encoder
latent-representations
vae
generative-models
Dec 18, 2024
KMeans Clustering
kmeans
clustering
unsupervised-learning