GPT
S

SenseVoice

רץ בדפדפן

FunAudioLLMother2024-07-17

  • gradio

מעלים קובץ שמע ומקבלים תמלול טקסט יחד עם זיהוי רגשות ואירועי קול ברקע. הכלי מיועד למי שצריך לפענח הקלטות בחמש שפות נתמכות, אבל עברית לא ביניהן.

  • הורדות בחודש
  • 96לייקים

מה זה

אתם מעלים קובץ קול או מקליטים ישירות מהמיקרופון, ובוחרים שפה מתוך תפריט נפתח אם לא רוצים להסתמך על הזיהוי האוטומטי. בתגובה, מקבלים תיבת טקסט עם התמלול, כולל סיווג של רגשות וצלילי רקע שקרו בזמן הדיבור.

מאחורי הממשק רץ המודל SenseVoiceSmall דרך ספריית FunASR. המפתחים מציגים אותו כמודל שמבין דיבור במהירות של פי 7 לעומת Whisper-small, והוא מתמקד בחמש שפות בלבד: אנגלית, סינית, קנטונזית, יפנית וקוריאנית. הממשק כולל גם דוגמאות מוכנות שמאפשרות לבדוק את התוצאות מיד בלי להעלות קובץ אישי.

מתאים ל

  • תמלול הקלטות באנגלית

    המרת ראיונות או שיחות קוליות באנגלית לטקסט מהיר ישירות מהדפדפן.

  • זיהוי רגש ואירועי צליל

    בדיקת מצב הרוח של הדובר וזיהוי רעשי רקע שמופיעים לאורך האודיו.

  • ניתוח דיבור בשפות מזרח אסיה

    תמלול מדויק של קטעי קול ביפנית, קוריאנית, סינית או קנטונזית.

איפה זה נופל

החיסרון הברור ביותר לישראלים הוא היעדר תמיכה בעברית. בנוסף, הממשק מריץ את הגרסה הקטנה של המודל ולא את הגרסה המלאה, מה שיכול להשפיע על הדיוק בהקלטות מורכבות או רועשות במיוחד. אל תצפו ממנו לערוך את הטקסט או לתרגם אותו לשפות אחרות מעבר לפענוח הקיים.

שאלות
נפוצות

האם הכלי הזה עובד בעברית?

לא. המודל תומך כרגע באופן רשמי רק באנגלית, סינית, קנטונזית, יפנית וקוריאנית. אם תעלו הקלטה בעברית, תקבלו ג'יבריש או ניסיון שגוי לפענח את המילים באחת השפות הנתמכות.

האם צריך לשלם או להירשם כדי להשתמש?

השימוש בהדגמה בדפדפן פתוח לחלוטין וללא עלות. אין צורך לפתוח חשבון, רק נכנסים לדף, מעלים קובץ ומפעילים.

האם אפשר להריץ את זה מקומית על המחשב?

כן, הקוד והמודל זמינים דרך פרויקט FunASR וגיטהאב של המפתחים. תוכלו להתקין את החבילות אצלכם ולהריץ את SenseVoiceSmall עצמאית ללא תלות ברשת.

מה קורה עם קובצי השמע שאני מעלה?

הקבצים מועברים לעיבוד על גבי השרת שמריץ את אפליקציית ה־Gradio. לכן לא מומלץ להעלות הקלטות רגישות, סודיות או מידע פרטי שלא תרצו שיעבור ברשת.

איך משתמשים

השימוש פשוט מאוד. בוחרים דוגמה או מעלים הקלטה, לוחצים על Recognize ומחכים לפלט בתיבת התוצאה, שמגיעה גם עם כפתור העתקה נוח. הריצה מתבצעת על חומרת zero-a10g שמקצה מעבד גרפי לפי דרישה, כך שהעיבוד עצמו מהיר מאוד, אם כי לפעמים תיתקלו בהמתנה קצרה של שניות ספורות כשהשרת מתעורר.

הרישיון

הרישיון של המרחב מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי. כדאי לבדוק את תנאי המאגר המקורי בגיטהאב לפני שימוש מסחרי, ולקחת בחשבון שכל קובץ שאתם מעלים נשלח ומעובד בשרת מרוחק.

הרישיון המלא ב־Hugging Face ↗