espnet2.speechlm.dataloader.multimodal_loader.audio_loader.KaldiAudioReader
Less than 1 minute
espnet2.speechlm.dataloader.multimodal_loader.audio_loader.KaldiAudioReader
class espnet2.speechlm.dataloader.multimodal_loader.audio_loader.KaldiAudioReader(index_path: str, valid_ids: list | None = None)
Bases: object
Dict-like lazy audio reader using Kaldi ark files via kaldiio.
Reads audio data from Kaldi ark files using an index file. The index file should contain one entry per line in the format: “example_id ark_path:offset”
- Returns: Tuple of (audio_array, sample_rate) where audio_array has shape [num_samples,] or [num_samples, num_channels].
- Parameters:
- index_path – Path to the index file containing “example_id ark:offset” per line.
- valid_ids – List of valid IDs to keep (optional, keeps all if None).
items() → Iterator[Tuple[str, Tuple[ndarray, int]]]
Return iterator over (id, (audio_array, sample_rate)) pairs.
keys() → Iterator[str]
Return iterator over IDs.
values() → Iterator[Tuple[ndarray, int]]
Return iterator over (audio_array, sample_rate) tuples.
