GPT
W

sanchit-gandhi/whisper-large-v2

רץ בדפדפן

sanchit-gandhiרישיון לא דווח2022-12-07

  • gradio
  • whisper-event

הדגמה שממירה דיבור לטקסט מקבצים, מהקלטה חיה או מיוטיוב. היא מיועדת למי שרוצה לבדוק את הביצועים של המודל ישירות בדפדפן בלי לכתוב שורת קוד.

  • הורדות בחודש
  • 187לייקים

מה זה

מכניסים קול באחת משלוש דרכים: מדברים לתוך המיקרופון, מעלים קובץ אודיו קיים, או מדביקים קישור לסרטון יוטיוב. בוחרים בפעולה הרצויה, תמלול בשפת המקור או תרגום לאנגלית, ומקבלים פלט טקסטואלי.

מאחורי הקלעים רץ המודל openai/whisper-large-v2 דרך ספריית transformers של Hugging Face. הקוד נעזר בכלי yt-dlp כדי למשוך את האודיו מיוטיוב וב־ffmpeg כדי לפענח אותו לפני העיבוד.

הממשק מחולק לשלוש לשוניות נפרדות לפי מקור השמע, אך לפי הקוד אין בו דוגמאות מוכנות מראש ללחיצה מהירה. צריך להזין תוכן משלכם כדי לראות את התוצאות.

מתאים ל

  • תמלול קבצי שמע קצרים

    מעלים קובץ קול מהמחשב ומקבלים את הטקסט המלא בשפת המקור.

  • הקלטה ישירה מהדפדפן

    מדברים אל המיקרופון כדי לבדוק דיוק של משפטים קצרים בזמן אמת.

  • תרגום קטעי יוטיוב לאנגלית

    מדביקים קישור לסרטון קצר ומקבלים תרגום טקסטואלי ישיר לאנגלית.

איפה זה נופל

הבעיה המיידית היא שהאפליקציה נמצאת במצב שגיאת ריצה, ולכן אי אפשר להריץ אותה כרגע בדפדפן בכלל. בנוסף, הקוד כולל הגבלת אורך על סרטוני יוטיוב שמפסיקה את התהליך עם שגיאה, כך שאי אפשר להשתמש בה לפודקאסטים או להרצאות ארוכות. מבחינת יכולות, האפליקציה תומכת רק בתמלול ותרגום פשוטים לאנגלית. היא אינה מציגה חלוקה לדוברים, חותמות זמן מדויקות, או אפשרויות עריכה של הפלט.

שאלות
נפוצות

האם השימוש באפליקציה עולה כסף?

לא, הממשק פתוח לשימוש חופשי בדפדפן ללא תשלום. עם זאת, הוא רץ על חומרה ציבורית שיתופית וכרגע נמצא במצב של שגיאת ריצה שמונעת עבודה איתו.

מה קורה עם הקבצים שמעלים?

הקוד שומר את האודיו בקבצים זמניים בשרת כדי לעבד אותם עם ffmpeg. אין התחייבות לפרטיות או שמירת נתונים, ולכן לא מומלץ להעלות חומר רגיש.

האם אפשר להריץ את זה מקומית?

כן, הקוד מבוסס על ספריות פתוחות כמו transformers ו־gradio, והמודל זמין להורדה. תצטרכו מחשב עם מעבד גרפי מתאים כדי להחזיק את המודל בגודל הזה.

במה זה שונה משימוש ישיר במודל?

הממשק עוטף את המודל בפונקציות בסיסיות של קליטת אודיו והצגת טקסט. הוא לא חושף פרמטרים מתקדמים של המודל כמו כוונון שפות, חותמות זמן או שליטה בפורמט הפלט.

איך משתמשים

בוחרים בלשונית המתאימה, מעלים קובץ, מקליטים או מדביקים קישור, ואז לוחצים על שליחה. האפליקציה מוגדרת לרוץ על חומרת t4-small, שמספקת האצת מעבד גרפי בסיסית אך אינה המהירה ביותר לעיבוד מודל גדול כזה. מעבר לכך, יש מגבלת אורך על סרטוני יוטיוב והקוד זורק שגיאה אם הסרטון חורג מהזמן המוגדר. לא נדרשת הרשמה כדי להשתמש בממשק, אך כרגע העמוד כולו מדווח על תקלת ריצה ולא מגיב.

הרישיון

הרישיון של המרחב עצמו לא דווח בעמוד. המשמעות היא שאין תנאי שימוש ברורים לשימוש חוזר בקוד או בהגדרות. לגבי המודל עצמו, openai/whisper-large-v2, יש לבדוק בנפרד את תנאי הרישיון המקוריים שלו.

הרישיון המלא ב־Hugging Face ↗