GPT
F

Fun-ASR-Nano-2512

קוד פתוח

FunAudioLLMapache-2.02025-12-15

  • funasr
  • speech-recognition
  • asr
  • end-to-end
  • multilingual

זה מודל תמלול של 800 מיליון פרמטרים שמיועד למי שחייב דיוק גבוה בסינית, אנגלית או יפנית. הוא מתאים במיוחד כשצריך להריץ מקומית בלי כרטיס מסך מפלצתי.

  • 1.9 GBמשקל הקבצים
  • 2,959הורדות בחודש
  • 227לייקים

מה זה

המודל פותח במעבדות Tongyi ואומן על עשרות מיליוני שעות הקלטה. עם משקל קבצים של 1.9 גיגה בייט, הוא מכוון למשימות תמלול באנגלית, יפנית ומבחר עצום של ניבים ומבטאים בסינית. קיימת גם גרסת מולטי שמרחיבה את הכיסוי ל־31 שפות, אך המיקוד המרכזי כאן נשאר אסיה.

במדדי השגיאה המוצגים, הדגם הזה עוקף מתחרים גדולים ממנו כמו Whisper large v3 במבחני שטח רועשים, הקלטות מרחוק ותמלול דיאלקטים. בבדיקות של דיבור ממרחק הוא הגיע ל־5.79 אחוזי שגיאה לעומת מעל עשרים אחוז של וויספר. היתרון הגדול שלו מופיע בסביבות אקוסטיות קשות, מוזיקת רקע או שירים, היכן שמודלים קודמים התקשו לשמור על רצף מילים הגיוני.

מתאים ל

  • תמלול פגישות באנגלית וסינית

    מתאים לחדרי ישיבות רועשים בזכות ביצועים חזקים בהקלטה מרחוק.

  • הרצה מקומית על מחשבי קצה

    פועל על מעבד רגיל דרך GGUF בלי צורך בתשתיות ענן או כרטיס מסך יקר.

  • חילוץ מילים משירים והיפ הופ

    אומן ספציפית להתמודד עם מוזיקת רקע וקצב דיבור מהיר.

איפה זה נופל

עברית לא נתמכת כאן, והמודל לא מיועד לשוק המקומי בישראל. מעבר לזה, רשימת המשימות הפתוחות של המפתחים מבהירה שחסרות יכולות בסיסיות: אין כרגע חותמות זמן למילים או למשפטים, אין זיהוי והפרדה בין דוברים, ואין אפשרות מובנית לאמן או לכוונן אותו מחדש.

שאלות
נפוצות

האם המודל מתאים לתמלול שיחות בעברית?

לא, המודל אינו כולל עברית ברשימת השפות הנתמכות. הוא מתמקד באנגלית, יפנית, ניבים סיניים ומספר שפות אסייתיות, כך שעבור עברית צריך לחפש פתרון אחר.

האם מקבלים חותמות זמן כדי לסנכרן כתוביות לווידאו?

כרגע לא, החזרת חותמות זמן עדיין מסומנת כמשימה פתוחה בפיתוח. המודל מחזיר את הטקסט המתוזמן ברמת הפלט הכללי ולא בחלוקה מדויקת של שניות לכל מילה.

האם חייבים כרטיס מסך כדי להריץ אותו בייצור?

ממש לא, קיימת גרסת GGUF שמאפשרת להריץ אותו כקובץ בינארי עצמאי על מעבד רגיל. עבור עומסים נמוכים או מכשירי קצה, מעבד מודרני מספיק בהחלט בזכות גודלו הקומפקטי.

איך מריצים

אפשר להריץ את המודל דרך פייתון עם ספריית funasr או ישירות בקוד שמסופק במאגר על מעבד גרפי יחיד. כיוון שמדובר ב־800 מיליון פרמטרים, הוא רץ בלי בעיה על מעבדים גרפיים צנועים עם כמה גיגה בייטים של זיכרון.

מי שאין לו כרטיס מסך יכול להריץ אותו דרך גרסת GGUF המותאמת ל־llama.cpp כקובץ הרצה עצמאי על מעבד רגיל. אם התשתית שלכם כבר נשענת על שירות ענן סגור ואין לכם עניין בתחזוקת שרתים או טיפול באודיו אצלכם, שימוש בשירות חיצוני עדיין יהיה פשוט יותר מאשר להרים סביבה מקומית.

pip install -U huggingface_hub
hf download FunAudioLLM/Fun-ASR-Nano-2512

הרישיון

הקוד והמשקלים משוחררים ברישיון Apache 2.0. הרישיון מאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה פנימית או חיצונית בתוך מוצר, ללא תשלום תמלוגים, ובלבד ששומרים על הודעת זכויות היוצרים ומסמך הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗