🪴 Prabhav's Log

    • BlogPosts
      • Audio Features
      • Classifier Metrics
      • Course Work
      • Deep Learning Optimizers
      • Environment Setup
      • KMeans Clustering
      • Resources
      • Understanding Latents: Variational Auto-Encoder
    • GradSchool
      • GradSchool
    • Research Wikis
      • Audio LLM Wiki
        • Concepts
          • Audio-Text Pretraining Patterns
          • Encoder-Free Early Fusion
          • Full-Duplex Spoken Dialogue
          • Inner Monologue
          • Interaction Models
          • Interaction-Background Model Split
          • Multi-Stream Audio Modeling
          • RQ-Transformer
          • Speech Understanding
          • Thinker-Talker Architecture
          • Time-Aligned Micro-Turns
        • Entities
          • AuT (Audio Transformer)
          • FD-bench
          • Helium
          • Mimi (neural audio codec)
          • Moshi
          • Qwen3-Omni
          • TML-Interaction-Small
          • Voxtral
        • Sources
          • Interaction Models: A Scalable Approach to Human-AI Collaboration
          • Moshi: a speech-text foundation model for real-time dialogue
          • Qwen3-Omni (technical report)
          • Voxtral
        • Topics
          • Real-Time Interactive Speech Models
    Home

    ❯

    Research Wikis

    ❯

    Audio LLM Wiki

    ❯

    Concepts

    Folder: wiki/mm-llm-wiki/Concepts

    11 items under this folder.

    • Jul 22, 2026

      RQ-Transformer

      • concept
      • architecture
      • speech
    • Jul 22, 2026

      Speech Understanding

      • concept
      • speech
      • multimodal
      • architecture
    • Jul 22, 2026

      Thinker-Talker Architecture

      • concept
      • speech
      • architecture
      • speech-generation
      • streaming
    • Jul 22, 2026

      Time-Aligned Micro-Turns

      • concept
      • architecture
      • real-time
    • Jul 22, 2026

      Audio-Text Pretraining Patterns

      • concept
      • training
      • speech
      • multimodal
    • Jul 22, 2026

      Encoder-Free Early Fusion

      • concept
      • architecture
      • multimodal
    • Jul 22, 2026

      Full-Duplex Spoken Dialogue

      • concept
      • speech
      • real-time
      • human-ai-collaboration
    • Jul 22, 2026

      Inner Monologue

      • concept
      • speech
      • architecture
    • Jul 22, 2026

      Interaction Models

      • concept
      • real-time
      • multimodal
      • human-ai-collaboration
    • Jul 22, 2026

      Interaction-Background Model Split

      • concept
      • architecture
      • agentic
    • Jul 22, 2026

      Multi-Stream Audio Modeling

      • concept
      • speech
      • architecture
      • real-time

    Created with Quartz v4.4.0 © 2026

    • GitHub
    • Discord Community