GPT
A

audiobox-aesthetics

קוד פתוח

facebookcc-by-4.02025-02-13

  • safetensors
  • model_hub_mixin
  • pytorch_model_hub_mixin
  • audio-classification

הערכה אוטומטית של איכות שמע עבור דיבור, מוזיקה וצלילים. מפיק ארבעה ציונים אסתטיים נפרדים מקובצי אודיו בגישה ישירה וללא צורך במודל כבד.

  • 104Mפרמטרים
  • 793 MBמשקל הקבצים
  • 559,329הורדות בחודש
  • 51לייקים

מה זה

המודל מבצע הערכת איכות כוללת לקובצי שמע ומספק מדד אסתטי מקיף שמחולק לארבעה צירים מוגדרים. הוא בודק הנאה מהתוכן, שימושיות התוכן, מורכבות ההפקה ואיכות ההפקה. במקום להתמקד רק ברעשי רקע או בעיוותים טכניים צרים, הוא מסתכל גם על חוויית ההאזנה ועל העניין בתוכן עצמו.

המבנה שלו נשען בין היתר על רכיבים שמקורם בפרויקט WavLM, וגודלו הצנוע, כ־104 מיליון פרמטרים, הופך אותו לפתרון קל יחסית שמתאים לבדיקות מהירות. המטרה כאן היא לתת תמונה רחבה על סאונד, ממוזיקה מורכבת ועד להקלטות דיבור פשוטות, על בסיס נתונים שתוייגו במקור על ידי מעריכים אנושיים.

מתאים ל

  • סינון קבצים לאימון מודלים

    ניפוי אוטומטי של הקלטות באיכות ירודה מתוך מאגרי שמע גדולים.

  • בקרת איכות להסכתים

    קבלת ציון מהיר על רמת ההפקה והסאונד של קובץ השמע לפני העלאה.

  • תעדוף מוזיקה בקטלוג

    מיון ראשוני של רצועות סאונד לפי מורכבות הפקה והנאה מהתוכן.

איפה זה נופל

המודל פולט ארבעה מספרים צפים על בסיס התרשמות אסתטית, אך התיעוד לא כולל מדדי דיוק מספריים או השוואה מפורטת על ביצועיו מול שיטות אחרות. בנוסף, חלוקת הציונים למושגים כמו הנאה או שימושיות נשענת על טעם אנושי ממאגרי נתונים ספציפיים, ולכן עלולה להיות סובייקטיבית או פחות רלוונטית לשפות שאינן אנגלית ולסגנונות שמע שאינם מיוצגים בדאטה.

שאלות
נפוצות

האם צריך כרטיס מסך חזק כדי להריץ אותו?

לא. המודל שוקל פחות מגיגה־בייט וכולל כ־104 מיליון פרמטרים. מעבד רגיל יספיק לרוב הקבצים הבודדים, וכרטיס מסך פשוט יאיץ ריצות באצווה.

האם המודל מאבחן סוגי רעש ספציפיים?

לא. הוא מחזיר ארבעה ציונים כלליים של איכות, מורכבות, הנאה ושימושיות, ולא דוח טכני על תדרים או רעשי רקע מסוימים.

איך מריצים

ההתקנה מתבצעת ישירות דרך pip עם החבילה audiobox_aesthetics, בדרישה לפייתון 3.9 ומעלה ו־PyTorch 2.2 לפחות. המשקל הכולל של הקבצים עומד על 793 מגה־בייט, כך שכל מעבד מודרני ממוצע או כרטיס מסך בסיסי לחלוטין יכולים להריץ אותו מקומית בלי לחשוב פעמיים.

אפשר לעבוד ישירות מסקריפט פייתון דרך טעינת טנזורים או נתיבי קבצים, או להשתמש בכלי השורת פקודה המובנה audio-aes. הכלי יודע לקבל קובץ jsonl עם נתיבים וטווחי זמנים, ומכיל תמיכה מובנית בריצה מבוזרת באשכולות מחשוב עם SLURM כשצריך לעבד כמויות גדולות.

pip install -U huggingface_hub
hf download facebook/audiobox-aesthetics

הקבצים

6 קבצים במאגר, 793 MB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון העיקרי הוא CC-BY 4.0, שמתיר שימוש מסחרי, שינוי והפצה כל עוד נותנים קרדיט מתאים ליוצרים. חלקים מהקוד שנלקחו מ־WavLM כפופים לרישיון MIT, שגם הוא מתיר שימוש חופשי כמעט לכל מטרה.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗