تبدیل فایل صوتی جلسه، مصاحبه، کلاس یا یادداشت صوتی به متن دیگر الزاماً به سرویسهای آنلاین نیاز ندارد. با استفاده از Whisper میتوان فرایند تبدیل صدا به متن را روی خود کامپیوتر انجام داد و فایل صوتی را برای پردازش به یک سرویس ابری ارسال نکرد. این روش بهخصوص برای فایلهایی که حاوی اطلاعات کاری، شخصی یا محرمانه هستند، کاربردی است.
Whisper یک مدل تشخیص گفتار از OpenAI است که از زبانهای مختلف پشتیبانی میکند و علاوه بر تبدیل گفتار به متن، امکان ترجمه گفتار به انگلیسی را نیز دارد. نسخههای مختلف این مدل از مدل بسیار سبک Tiny تا مدلهای بزرگتر عرضه شدهاند و انتخاب مدل مستقیماً روی سرعت، مصرف حافظه و کیفیت خروجی تأثیر میگذارد.