espnet2.speechlm.dataloader.multimodal_loader.audio_loader.OmniIOAudioReader
Less than 1 minute
espnet2.speechlm.dataloader.multimodal_loader.audio_loader.OmniIOAudioReader
class espnet2.speechlm.dataloader.multimodal_loader.audio_loader.OmniIOAudioReader(parquet_path: str, valid_ids: list | None = None)
Bases: object
Dict-like lazy audio reader using omniio parquets.
Reads audio data from omniio parquet files. Audio is accessed via byte offsets and time boundaries stored in the parquet metadata.
- Returns: Tuple of (audio_array, sample_rate) where audio_array has shape [num_samples, num_channels].
- Parameters:
- parquet_path – Path to the parquet file containing audio metadata.
- valid_ids – List of valid IDs to keep (optional, keeps all if None).
items() → Iterator[Tuple[str, Tuple[ndarray, int]]]
Return iterator over (id, (audio_array, sample_rate)) pairs.
keys() → Iterator[str]
Return iterator over IDs.
values() → Iterator[Tuple[ndarray, int]]
Return iterator over (audio_array, sample_rate) tuples.
