GPT
L

larger_clap_music

קוד פתוח

laionapache-2.02023-10-30

  • transformers
  • pytorch
  • clap
  • feature-extraction
  • endpoints_compatible

יש כאן גם סקירה על LAION עצמו.

הוא ממיר קטעי מוזיקה וטקסט לאותו מרחב וקטורי כדי לחבר ביניהם. אם אתם צריכים לסווג שירים לפי תיאור מילולי חופשי בלי לאמן מודל מאפס, זו נקודת התחלה טובה.

  • 744 MBמשקל הקבצים
  • 33,846הורדות בחודש
  • 49לייקים
  • 16שכבות

מה זה

מדובר במימוש של ארכיטקטורת CLAP שעבר אימון ייעודי על נתוני מוזיקה. הרעיון זהה למה שמוכר מתחום התמונה, הצמדה של ייצוג קולי לייצוג טקסטואלי. בצד הקול הוא משתמש ב־SWINTransformer שמעבד ספקטרוגרמות מסוג log-Mel, ובצד הטקסט רץ מודל מסוג RoBERTa. שניהם מוציאים וקטורים באותו ממד בדיוק, ומכפלה סקלרית ביניהם נותנת ציון התאמה ישיר.

היתרון של הגרסה הזו מול מודלים כלליים של אודיו הוא המיקוד שלה. היא מיועדת לחלץ מאפיינים ממוזיקה ולא מסתם רעשי סביבה, ולכן מבינה טוב יותר הקשרים מוזיקליים לעומת צלילים יומיומיים. אין כאן מנגנון יצירה של צליל אלא רק ניתוח, חילוץ אמבדינגס וסיווג לפי תוויות טקסט חופשיות.

מתאים ל

  • סיווג שירים ללא אימון

    הוא משווה קובץ שמע לרשימת תוויות טקסט חופשיות ומחזיר את הז'אנר או מצב הרוח המתאים ביותר.

  • חיפוש קטעי סאונד בטקסט

    הוא מייצר וקטורים לקטלוג מוזיקה שלם ומאפשר למצוא שירים בעזרת תיאור מילולי פשוט.

  • חילוץ וקטורים למערכות המלצה

    הוא מוציא ייצוג מספרי מקובץ השמע שמשמש למדידת דמיון בין שירים שונים במאגר.

איפה זה נופל

למרות שהוא אומן ספציפית על מוזיקה, הכרטיס מציג דוגמה של זיהוי נביחות כלב ושואב אבק מתוך מאגר ESC50, מה שמראה שהתיעוד לא מפרט אילו ז'אנרים או סגנונות נכללו באימון. לא ברור איך הוא מתמודד עם שפות שאינן אנגלית בתיאורי הטקסט, וברירת המחדל של RoBERTa מכוונת לאנגלית. בנוסף, חסרים בכרטיס מדדי ביצועים מספריים מדויקים על קטעי מוזיקה אמיתיים, כך שחובה לבדוק אותו על הדאטה הספציפי שלכם לפני שמסתמכים על הסיווג שלו.

שאלות
נפוצות

האם המודל יודע לייצר מוזיקה חדשה מטקסט?

לא, הוא לא מודל יוצר. הוא יודע רק לחלץ מאפיינים, להשוות בין קול לטקסט ולבצע סיווג, אך אין לו שום יכולת לפלוט קובץ אודיו חדש.

האם אפשר להריץ אותו על מחשב אישי רגיל?

כן, המשקל שלו הוא 744 מגה בייט בלבד והוא עובד ישירות על המעבד. אין חובה בכרטיס מסך כדי לבדוק אותו או לסווג קבצים בודדים.

איך מריצים

המשקל הכולל של הקבצים עומד על 744 מגה בייט בלבד, כך שלא צריך שרת מפלצתי בשביל להריץ אותו. הוא נטען דרך ספריית transformers הרגילה של פייתון, ורץ בלי בעיה על מעבד סטנדרטי בלי לחנוק את הזיכרון. אם יש לכם כרטיס מסך פשוט, ההסקה תהיה מהירה משמעותית, במיוחד בעיבוד אצוות של קטעי שמע.

הריצה המקומית פשוטה ואין פה סיבוך תשתיתי שמצדיק חיפוש של API חיצוני בתשלום. אתם טוענים את ClapModel יחד עם ClapProcessor, מעבירים מערך של גל קול או טקסט, ומקבלים וקטור מספרי. הקוד מוכן לעבודה ישירה ולא דורש התאמות מיוחדות.

from transformers import pipeline

pipe = pipeline("feature-extraction", model="laion/larger_clap_music")
print(pipe("שלום"))

הרישיון

הוא מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי של הקוד והפצה מחדש. הדרישה העיקרית היא שמירה על הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם. אתם יכולים לשלב אותו בתוך מוצר מסחרי בלי לשלם תמלוגים ובלי לפתוח את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗