GPT
S

SenseVoiceSmall

קוד פתוח

FunAudioLLMother2024-07-03

  • funasr
  • speech-recognition
  • asr
  • emotion-recognition
  • audio-event-detection

מודל תמלול מהיר במיוחד שמזהה במקביל גם רגשות ורעשי רקע. מתאים למי שחייב השהיה אפסית ולא רוצה שרתים כבדים.

  • 900 MBמשקל הקבצים
  • 30,518הורדות בחודש
  • 475לייקים

מה זה

המודל הזה לוקח קבצי שמע וממיר אותם לטקסט, אבל במקום להסתפק במילים הוא מחלץ שכבת מידע נוספת. הוא מאומן על יותר מ־400,000 שעות שמע ותומך בלמעלה מ־50 שפות, עם התמקדות בסינית, קנטונזית, אנגלית, יפנית וקוריאנית. בנוסף לתמלול הוא מזהה את השפה המדוברת, סוגי רגש, ואירועי סאונד נפוצים כמו מחיאות כפיים, מוזיקת רקע, שיעול וצחוק.

השוני העיקרי מול פתרונות מקבילים כמו Whisper נובע מהארכיטקטורה. המודל בנוי במבנה שאינו אוטורגרסיבי, מה שחותך את זמני הריצה בצורה חדה. לפי הבדיקות של המפתחים, עיבוד של 10 שניות אודיו לוקח 70 אלפיות השנייה בלבד, קצב שמהיר פי 5 מ־Whisper-Small ופי 15 מ־Whisper-Large. במבחני זיהוי דיבור על מאגרי מידע מוכרים הוא עוקף את המתחרים בעיקר בשפות אסייתיות, ובמבחני רגש הוא הציג ביצועים גבוהים יותר ממודלים ייעודיים לתחום.

מתאים ל

  • בוטים קוליים בזמן אמת

    זמן עיבוד של 70 אלפיות השנייה לעשר שניות מאפשר שיחה רציפה בלי שיהוקים.

  • ניתוח שיחות במוקדי שירות

    זיהוי כעס או בכי לצד הטקסט נותן תמונת מצב מיידית על שביעות רצון.

  • הפעלה במכשירי קצה ללא GPU

    תמיכה ב־GGUF מאפשרת לרוץ ישירות על מעבד פשוט עם מעט מאוד זיכרון.

איפה זה נופל

הנקודה הקריטית ביותר היא שאין שום נתונים על תמיכה בעברית. המודל מצהיר על מעל 50 שפות אך מדגיש אנגלית ושפות מזרח אסיה, כך שבלי בדיקה מעשית על קבצים מקומיים אי אפשר להסתמך עליו בארץ. חולשה נוספת נוגעת לזיהוי אירועי קול סביבתיים כלליים. המפתחים עצמם מודים שבמבחן ESC-50 המודל נופל ממערכות ייעודיות כמו BEATS, מכיוון שהוא אומן אך ורק על הקלטות דיבור ולא על מאגרי סאונד מגוונים.

שאלות
נפוצות

האם המודל מתאים לתמלול שיחות בעברית?

התיעוד מציין תמיכה ב־50 שפות אבל מדגיש רק אנגלית, סינית, קנטונזית, יפנית וקוריאנית. אין שום תיעוד רשמי על ביצועים בעברית, ולכן צריך לבדוק אותו עצמאית לפני שבונים עליו.

איך מתמודדים עם קובץ הקלטה ארוך של שעה?

המודל מתוכנן לעבד מקטעים של עד 30 שניות ברצף. כדי לעבד קובץ ארוך מפעילים אותו דרך ספריית funasr יחד עם מודל זיהוי קול שמפצל את השיחה לחלקים קטנים ומאחד את התוצאות.

איך מריצים

המודל שוקל 900 מגה בייט בלבד, כך שלא חובה להחזיק כרטיסי מסך יקרים כדי לעבוד איתו. אפשר להריץ אותו על GPU מקומי דרך ספריית funasr בפייתון, לייצא אותו ל־ONNX או libtorch, ואפילו להריץ קובץ בינארי בודד דרך llama.cpp או פורמט GGUF על גבי מעבד רגיל בלי להתקין סביבת פייתון בכלל.

אם הקבצים שלכם ארוכים מ־30 שניות, חובה לשלב מודל VAD שחותך את האודיו למקטעים קצרים, והקוד מספק תמיכה מובנית בפיצול הזה. שירותי ענן בתשלום יהיו רלוונטיים רק אם אתם לא רוצים לנהל שום תשתית או שאין לכם צורך במהירות עיבוד מקומית.

pip install -U huggingface_hub
hf download FunAudioLLM/SenseVoiceSmall

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או אפאצ׳י. זה אומר שחובה להיכנס למאגר הגיטהאב של FunASR ולקרוא את תנאי השימוש המדויקים לפני שמשלבים אותו במוצר מסחרי, כדי לא להסתבך בהפרת זכויות יוצרים של היוצרים.

הרישיון המלא בעמוד המודל ↗