GPT
V

voxceleb2

קוד פתוח

Reverbmit2025-08-14

מאגר קול מיוטיוב שמיועד לזיהוי ואימות דוברים באנגלית. הוא מתאים למי שבונה מודלים ביומטריים קוליים וצריך המון הקלטות של אותם אנשים בתנאי שטח אמיתיים.

  • 10,326הורדות בחודש
  • 21לייקים

מה זה

המאגר כולל מעל מיליון קטעי דיבור של 6,112 ידוענים, שנחתכו מתוך סרטונים שהועלו ליוטיוב. המטרה המקורית שלו היא זיהוי דוברים, ולכן כל דגימה מגיעה עם מזהה דובר מוגדר, מזהה של סרטון המקור ורצועת השמע עצמה. מעבר לקבצי האודיו, המאגר מספק קובצי מטא דאטה בפורמט טקסט וטבלת מידע מרכזית שמקשרת בין המזהים השונים לקטעים.

המבנה של המאגר מחולק לקבצי ארכיון מרובים שכוללים קטעי וידאו בפורמט MP4 לצד קובצי השמע. החלוקה הזו מיועדת לאפשר עבודה עם סרטוני הפיתוח של המאגר, כאשר הדגש הוא על קולות בתנאי רעש טבעיים ולא על הקלטות אולפן נקיות. המקורות נאספו כולם מהרשת, כך שהאיכות והמאפיינים האקוסטיים משתנים מאוד בין דובר לדובר ובין סרטון לסרטון.

מתאים ל

  • אימות דוברים

    אימון רשתות לזיהוי קול של משתמשים ספציפיים מתוך אלפי דוגמאות שונות.

  • סיווג שמע

    בניית מודלים שמבדילים בין קולות אנושיים שונים על רקע רעשי סביבה מגוונים.

  • זיהוי דיבור בסיסי

    בדיקת ביצועים של מערכות תמלול באנגלית בתנאי שמע מאתגרים ולא מקצועיים.

איפה זה נופל

המאגר כולו באנגלית ומבוסס על סלבריטאים ביוטיוב, כך שאין כאן ייצוג לעברית או למבטאים ישראליים. ההקלטות כוללות רעשי רקע, מוזיקה ומחיאות כפיים מהסרטונים המקוריים, מה שיכול להכשיל מודל שזקוק לדיבור נקי בלבד. בנוסף, חלוקת הקבצים מסורבלת מאוד ודורשת עבודת הכנה ידנית של איחוד ופריסה לפני שאפשר להתחיל לאמן.

שאלות
נפוצות

האם הדאטהסט כולל שמע בעברית?

לא, המאגר מוגדר ומכיל תוכן באנגלית בלבד. אם אתם צריכים לאמן מודלים לעברית, תצטרכו לחפש מקורות נתונים אחרים.

מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הכרטיס מציג רישיון MIT שמאפשר שימוש מסחרי, אך בגוף הכרטיס נכתב שיש להתייחס לתנאי הרישיון המקוריים של הפרויקט. מכיוון שמדובר בהקלטות של ידוענים מיוטיוב, שימוש מסחרי דורש זהירות ובדיקה מעמיקה של הזכויות במקור.

איך המידע נאסף בפועל?

הקטעים חולצו מתוך סרטוני יוטיוב שבהם מופיעים מעל 6,000 סלבריטאים שונים. הדבר מייצר تنوع גדול באיכות השמע, אך גם מכניס רעשי רקע רבים שלא קיימים בהקלטות מעבדה.

איך טוענים

הקבצים מחולקים לארכיונים מפוצלים של שבעה זיפ וקבצי טאר, כך שאי אפשר פשוט לטעון אותם בשורה אחת של קוד בלי לפתוח אותם קודם. תצטרכו להוריד את כל החלקים, לאחד אותם עם פקודת שרשור או 7z, ולחלץ את המדיה למחשב או לשרת. המאגר מוגדר ציבורי ולא דורש אישור גישה מיוחד, אבל הוא שוקל המון ומכיל עשרות אלפי קבצים. השדות העיקריים שתעבדו איתם הם מזהה הדובר, מזהה הווידאו ונתוני האודיו הגולמיים.

from datasets import load_dataset

ds = load_dataset("Reverb/voxceleb2")

הרישיון

העמוד מציג רישיון מסוג MIT, שעל פניו מתיר שימוש חופשי כולל מטרות מסחריות, כל עוד מצרפים את תנאי הרישיון המקורי. יחד עם זאת, הטקסט עצמו מפנה לתנאי הרישיון המקוריים של הפרויקט, וההקלטות לקוחות מסרטוני יוטיוב של אנשים מוכרים. מומלץ לבדוק היטב את המקור לפני שמכניסים מודל כזה למוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗