این ابزار چطور گوش میدهد؟
یک حدس از یک لحظهی صدا قابلاعتماد نیست: صحبت، افکت یا یک مقدمهی آرام میتواند هر موتور تشخیصی را به جواب بیربطی برساند. برای همین بهجای یک بار پرسیدن، ابزار صدای شما را به چند پنجرهی کوتاه در طول آن تقسیم میکند و هرکدام را به چند شکل آماده میکند: همانطور که ضبط شده، با صدای یکنواختشده، و با حذف بم و خشهای اضافه. بعد دربارهی همهی آنها همزمان میپرسد.
آهنگ فقط وقتی اعلام میشود که دو پنجرهی مستقل روی آن توافق کنند. اگر فقط یک پنجره چیزی بشنود، یا دو پنجره دو آهنگ مختلف بشنوند، گزینهها را بهصورت دکمه میگیرید و خودتان انتخاب میکنید؛ بهجای اینکه یک جواب اشتباه را با اطمینان بشنوید.
بخشهای بیصدا بهجای هدر دادن یک جستجو کنار گذاشته میشوند و کل جستجو زمانبندی دارد تا منتظر یک جواب کُند نمانید.
بیش از یک موتور
شزم سریع است و کاتالوگ عظیمی دارد، اما هیچ کاتالوگی همهچیز را ندارد؛ و بیشترین جای خالی شزم در موسیقی فارسی و منطقهای است. در تلگرام، وقتی دور اول به نتیجه نرسد، ربات موتورهای دیگر را همزمان به کار میگیرد: ACRCloud، AudD و AcoustID که اثر انگشت صوتی را به روش دیگری میسازند، و موتوری که کلمات خواندهشده را به متن تبدیل و جستجو میکند. جوابهایشان بر اساس اسم آهنگ ترکیب میشود و توافق بین موتورها هم مثل توافق بین پنجرهها حساب میشود.
بعد چه میشود؟
دانستن اسم، نصف کار است. در تلگرام ربات همان آهنگ را پیدا میکند (نسخهی استودیویی، بررسیشده با کاتالوگ) و بهصورت فایل تگدار با کاور و دکمهی متن آهنگ برایتان میفرستد. روی سایت همین جواب را همراه دکمههای دانلود، دیدن متن آهنگ یا باز کردن در ربات میگیرید.
وقتی آهنگ داخل یک ویدیوست
اگر آهنگ در یک ویدیو پخش میشود (ریلز، تیکتاک، کلیپ یوتیوب) لازم نیست ضبطش کنید. پیدا کردن آهنگ از ویدیو را ببینید: خود ویدیو را بفرستید یا آپلود کنید تا صدای آن مستقیم تشخیص داده شود.
نکتههایی برای تشخیص بهتر
- به بلندگو نزدیک شوید و از صدای صحبت دور.
- اگر میتوانید، بخش اصلی (کورس) آهنگ را ضبط کنید؛ متمایزترین بخش است.
- ۱۰ تا ۱۵ ثانیه کافی است؛ بیشتر هم ضرری ندارد.
- برای اجراهای زنده و کاورها، تشخیص فقط وقتی نسخهی اصلی را پیدا میکند که اجرا به آن نزدیک باشد.