GPT
P

parakeet-tdt-0.6b-v3 — הדגמה

קוד פתוח

nvidiacc-by-4.02025-08-08

  • gradio

nvidia עומדים גם מאחורי NVIDIA AI, ויש עליו סקירה כאן.

הכלי מתמלל קובצי שמע והקלטות קוליות למסמכי טקסט וכתוביות בעזרת מודל שפיתחה אנבידיה. הוא מיועד למי שצריך תמלול מדויק עם חלוקה לזמנים בלי להגדיר שרת משלו.

  • 627Mפרמטרים
  • 5.3 GBמשקל הקבצים
  • הורדות בחודש
  • 135לייקים

מה זה

אתם מעלים קובץ קול או מקליטים ישירות מהדפדפן, והמערכת מחזירה טבלה מפורטת עם התמלול וזמני ההתחלה והסיום של כל קטע. הממשק תומך בקובצי שמע מסוג מונו או סטריאו בלבד, וממיר אותם בעצמו לעיבוד. יש שם גם נגן מובנה, כך שלחיצה על שורה ספציפית בטבלת התוצאות משמיעה מיד רק את אותו קטע דיבור.

מאחורי הקלעים רץ המודל nvidia/parakeet-tdt-0.6b-v3 שנבנה על ספריית NeMo. זהו מודל זיהוי דיבור רב לשוני שמבוסס על ארכיטקטורת TDT עם 600 מיליון פרמטרים, שנועדה לייצר פענוח מהיר לצד חותמות זמן. הממשק כולל דוגמאות שמע מוכנות מראש שמאפשרות לבדוק את מהירות הפיענוח ודיוק הזמנים בלחיצת כפתור.

מתאים ל

  • יצירת כתוביות לסרטונים

    מעלים קובץ קול של סרטון ומקבלים קובץ SRT מוכן עם תזמונים מדויקים לסנכרון.

  • בדיקת איכות של המודל

    טוענים את דוגמאות השמע המובנות כדי לבחון את רמת הדיוק של המודל של אנבידיה.

  • תמלול הקלטות מהמיקרופון

    מקליטים סיכום קולי קצר ישירות מהדפדפן ומורידים את הטקסט המפוענח כקובץ CSV.

איפה זה נופל

אם הקובץ שלכם מכיל יותר משני ערוצי שמע, הפעולה תיכשל מיד בהודעת שגיאה כי המערכת תומכת במונו ובסטריאו בלבד. מעבר לזה, הממשק לא מציע אפשרויות עריכה של הטקסט לפני ההורדה, אלא רק השמעה של הקטעים והורדה של הקבצים הגולמיים. הקוד מתריע לפעמים על תקלות בהפעלת ההגדרות של קבצים ארוכים משמונה דקות, ולכן כדאי לבדוק היטב את התוצאה בהקלטות ממושכות.

אותה משפחה

parakeet-tdt יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם השימוש באפליקציה כרוך בתשלום?

לא, השימוש בדפדפן פתוח וחינמי לחלוטין. הוא רץ על גבי חומרת ענן מוקצית בלי צורך בחשבון בתשלום.

מה קורה עם קובצי השמע שאני מעלה?

הקוד מנהל תיקיית הפעלה זמנית לצורך המרת השמע, חיתוך הקטעים והפקת קובצי הייצוא. העיבוד מתבצע על שרתי הענן שמארחים את הממשק.

כמה זמן לוקח התמלול בפועל?

העיבוד נשען על חומרת A10G ועל מודל קל יחסית של 0.6 מיליארד פרמטרים, ולכן הוא עובד מהר. קטעים קצרים מתומללים תוך שניות בודדות, וקבצים ארוכים משמונה דקות דורשים עיבוד נוסף.

איך מורידים את התוצאות מהממשק?

בסיום התמלול נחשפים שני כפתורי הורדה מתחת לטבלה. אפשר להוריד את המלל בפורמט טבלאי של CSV או בפורמט כתוביות של SRT.

איך מריצים

בוחרים בלשונית של העלאת קובץ או בלשונית המיקרופון, טוענים את ההקלטה ולוחצים על כפתור התמלול הראשי. העיבוד רץ על מאיץ גרפי ייעודי מסוג A10G שמוקצה לפי דרישה דרך תשתית אפליקציות הרשת, כך שהביצועים מהירים מאוד. כשהקובץ ארוך משמונה דקות, הקוד מפעיל אוטומטית הגדרות מותאמות לתמלול ארוך. בסיום הפעולה מופיעים כפתורי הורדה לשמירת התוצאה כקובץ CSV או כקובץ כתוביות SRT.

ollama run hf.co/nvidia/parakeet-tdt-0.6b-v3:Q8_0

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

האפליקציה מפורסמת תחת רישיון cc-by-4.0. הרישיון הזה מתיר שימוש חופשי ושיתוף, כולל למטרות מסחריות, כל עוד נותנים קרדיט מתאים ליוצרים המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא בעמוד המודל ↗