GPT
A

ast-finetuned-audioset-10-10-0.4593

קוד פתוח

MITbsd-3-clause2022-11-14

  • transformers
  • pytorch
  • safetensors
  • audio-spectrogram-transformer
  • audio-classification

טרנספורמר לסיווג אודיו שלוקח ספקטרוגרמה ומתייחס אליה כמו תמונה. הוא מגיע מכוונן על AudioSet כדי לזהות אירועי קול שונים בהקלטה.

  • 87Mפרמטרים
  • 661 MBמשקל הקבצים
  • 776,779הורדות בחודש
  • 369לייקים

מה זה

הרעיון פה הוא לקחת ארכיטקטורת Vision Transformer רגילה לחלוטין ולהפעיל אותה על אודיו. גלי הקול מומרים קודם לתמונה של ספקטרוגרמה, ומשם המודל מעבד אותם בדיוק כמו שמעבדים פיקסלים ברשת ראייה ממוחשבת. הוא מבוסס על 12 שכבות וכולל כ־87 מיליון פרמטרים, גודל קומפקטי שמכוון כולו למשימת סיווג סאונד לקטגוריות המוגדרות מראש.

המשקל הזה אומן במקור על AudioSet, מה שאומר שהוא מחפש תבניות שמע מתוך מאגר עצום של צלילי סביבה, דיבור וכלי נגינה. לפי המאמר המקורי הגישה הזו הביאה תוצאות מובילות במבחני סיווג אודיו שונים, בעיקר בזכות היכולת של מנגנון הקשב ללכוד הקשרים בזמן ובתדר בלי להסתמך על רשתות קונבולוציה כבדות.

מתאים ל

  • זיהוי אירועי קול בסביבה

    זיהוי נביחות, זכוכית נשברת או צפירות בהקלטות שטח מתוך סיווגי AudioSet.

  • תיוג תוכן אודיו ווידאו

    מיון אוטומטי של קובצי מולטימדיה לפי סוגי רעשי רקע, מוזיקה ודיבור.

  • סינון רעשים מבוסס הקשר

    שכבת בדיקה מקדימה שמזהה איזה סוג קול קיים בערוץ כדי להחליט איך לעבד אותו.

איפה זה נופל

המודל מוגבל לסיווג בלבד לפי הקטגוריות של AudioSet, כך שהוא לא מתמלל דיבור ולא מבודד ערוצים. הכרטיס מציין במפורש שהצוות ששחרר את הקוד המקורי לא כתב את התיעוד אלא אנשי Hugging Face, ולכן חסרים פרטים על הטיות במאגר, מגבלות אורך אודיו או תנאי רעש חריגים.

שאלות
נפוצות

האם המודל יודע לתמלל מה נאמר בהקלטה?

לא. מדובר במודל סיווג שמע בלבד שמחזיר הסתברות לקטגוריות מוגדרות מראש, כמו זיהוי שמישהו מדבר, אך הוא לא מוציא טקסט.

האם חייבים GPU כדי להריץ אותו במוצר?

לא חובה. עם 87 מיליון פרמטרים ומשקל קבצים קטן, אפשר להריץ אותו על מעבד מרכזי סביר עבור נפחי עיבוד נמוכים עד בינוניים.

איך מריצים

טוענים אותו ישירות דרך ספריית transformers ב־PyTorch עם המחלקה ASTForAudioClassification. הקבצים שוקלים סך הכול 661 מגהבייט בדיוק של float32, כך שאין שום צורך במערך שרתים מסובך. אפשר להריץ אותו בקלות על מעבד רגיל, ובכרטיס מסך בסיסי לחלוטין הוא יעבד חלקי אודיו בזמן אפסי.

בגודל כזה, אין היגיון לשלם על API חיצוני אם אתם כבר מחזיקים שרת פעיל. הוא קל לתחזוקה מקומית, אבל תצטרכו להכין את צד הנתונים בעצמכם, כלומר להמיר את קובצי השמע לספקטרוגרמות בפורמט שהרשת מצפה לקבל.

from transformers import pipeline

pipe = pipeline("audio-classification", model="MIT/ast-finetuned-audioset-10-10-0.4593")
print(pipe("שלום"))

הקבצים

6 קבצים במאגר, 661 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא BSD תלת סעיפי, מה שמאפשר שימוש מסחרי חופשי לחלוטין בתוך מוצר. אתם רשאים לשנות ולהפיץ את הקוד, כל עוד אתם שומרים על הודעת זכויות היוצרים המקורית, תנאי הרישיון, ולא משתמשים בשם של MIT כדי לפרסם את המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗