GPT
C

clap-htsat-fused

קוד פתוח

laionapache-2.02023-02-16

  • transformers
  • pytorch
  • safetensors
  • clap
  • feature-extraction

יש כאן גם סקירה על LAION עצמו.

מודל שמחבר בין אודיו לשפה טבעית, ומאפשר לסווג קולות או לחפש קטעי שמע בעזרת טקסט חופשי בלי אימון מחדש. הוא שוקל מעט ורץ בקלות כמעט על כל מכונה.

  • 154Mפרמטרים
  • 514טוקנים בהקשר
  • 1.1 GBמשקל הקבצים
  • 8,485,095הורדות בחודש

מה זה

במקום לתייג אודיו לפי רשימת קטגוריות סגורה וקבועה מראש, המודל ממפה קטעי קול ותיאורים מילוליים לאותו מרחב וקטורי. הוא אומן על מאגר LAION-Audio-630K שמכיל מעל 633 אלף צמדי אודיו וטקסט, ומשתמש במנגנון של היתוך מאפיינים שמתמודד עם קטעי שמע באורכים משתנים.

התוצאה בפועל היא יכולת לבצע סיווג ללא דוגמאות מוקדמות פשוט על ידי כתיבת שמות הקטגוריות באנגלית, כמו נביחה של כלב או רעש של שואב אבק. מעבר למיון, הוא מייצר וקטורים מייצגים גם לקול וגם לטקסט, מה שהופך אותו לשימושי למנועי חיפוש של קובצי שמע לפי תיאור מילולי חופשי.

מתאים ל

  • סיווג רעשים ללא אימון

    זיהוי צלילי סביבה כמו שואב אבק או נביחה, בלי צורך לבנות מערך נתונים ייעודי.

  • חיפוש קובצי קול בטקסט

    שליפת קטעי שמע מתוך מאגר גדול לפי תיאור מילולי חופשי באנגלית.

  • חילוץ וקטורים לאודיו

    יצירת ייצוג וקטורי דחוס של קובצי קול לצורך השוואת דמיון או קלסטרינג.

איפה זה נופל

חלון ההקשר שלו מוגבל ל־514 טוקנים של טקסט, והוא אומן על נתונים באנגלית בלבד. אם תנסו לתת לו תוויות או שאילתות בעברית, הביצועים שלו יצנחו ולא תקבלו תוצאות עקביות, כך שתצטרכו לתרגם כל קלט לאנגלית לפני שליחה.

בנוסף, הוא מיועד לסיווג רעשים, צלילי סביבה ותבניות קוליות כלליות. הוא לא מודל לתמלול דיבור ולא מיועד לחילוץ טקסט מתוך שיחה, ולכן אי אפשר להשתמש בו כתחליף למערכות זיהוי דיבור.

שאלות
נפוצות

האם המודל מבין תוויות ותיאורים בעברית?

הוא אומן על נתונים באנגלית בלבד והשפה המוגדרת שלו היא en. כדי לעבוד איתו בארץ על קלטים בעברית, צריך לתרגם את הטקסט לאנגלית לפני שמעבירים אותו למודל.

האם אפשר להשתמש בו כדי לתמלל הקלטות קוליות?

לא. המודל מסווג סוגי צלילים ומשווה אותם לטקסט, אך אינו מיועד לתמלול דיבור ולא יודע לחלץ מילים שנאמרו מתוך הקלטה.

איך מריצים

עם 154 מיליון פרמטרים ומשקל קבצים של 1.1 גיגה בייט, המודל הזה קל מאוד לתפעול. הוא עולה ישירות דרך ספריית transformers של פייתון, ואין שום צורך בחומרת שרתים יקרה או בכרטיס מסך מפלצתי.

אפשר להריץ אותו ישירות על מעבד רגיל של מחשב נייד בלי להרגיש כבדות, או לזרוק אותו על מעבד גרפי בסיסי וזול אם צריך לעבד כמויות גדולות של קבצים בזמן קצר. בגלל המשקל הקטן והפשטות שלו, אין שום סיבה אמיתית לשלם לספק ענן צד שלישי על API חיצוני כשאפשר פשוט לארח אותו לבד במערכת.

from transformers import pipeline

pipe = pipeline("audio-classification", model="laion/clap-htsat-fused")
print(pipe("שלום"))

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תשלום תמלוגים. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וצירוף עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗