GPT
F

fleurs

קוד פתוח

googlecc-by-4.02022-04-19

  • speech-recognition

המאגר מרכז הקלטות קול מתומללות ב־102 שפות עבור משימות דיבור שונות. הוא מיועד למי שמחפש בנצ'מרק רב-לשוני מגוון הכולל עברית ושפות דלות משאבים.

  • 106,496הורדות בחודש
  • 463לייקים

מה זה

גוגל בנו את המאגר במסגרת פרויקט XTREME-S כדי לבחון מודלים של זיהוי דיבור ותרגום על פני משפחות שפות מגוונות. הרשומות מבוססות על הקלטות קוליות שנדגמו בתדר של 16000 הרץ, כשלכל הקלטה מוצמד תמלול נקי, תמלול גולמי, תיוג מגדר של הדובר ושיוך לשפה ולקבוצת שפות גיאוגרפית. המידע נאסף בעזרת מומחים, מיקור המונים וכלים אוטומטיים.

המאגר מחולק לקונפיגורציות לפי שפות ספציפיות, לצד תצורה כוללת שמכילה את כל השפות יחד. כל שפה מחולקת מראש לקבוצות אימון, ולידציה ובדיקה. גודל הפיצול משתנה משמעותית בין השפות, כאשר שפות מסוימות מכילות אלפי דוגמאות אימון ואחרות כאלף בלבד.

מתאים ל

  • הערכת מודלי ASR

    בדיקת ביצועים והשוואת מודלים לזיהוי דיבור על פני 102 שפות שונות בתנאים זהים.

  • זיהוי שפה מדיבור

    אימון מודלים לסיווג שפת הדיבור מתוך האודיו בעזרת תיוגי השפות וקבוצות השפות המובנים.

  • כוונון מודלים בעברית

    התאמת מודלי דיבור קיימים לעברית בעזרת סט הנתונים המקומי והמתומלל he_il.

איפה זה נופל

כמות הנתונים לכל שפה קטנה יחסית, לעיתים כמה מאות בודדות או אלפים ספורים של דגימות, מה שלא יספיק לאימון מודל ייצור מאפס אלא בעיקר לכוונון עדין או הערכת ביצועים. חלק מהתיוגים הופקו אוטומטית, כך שייתכנו שגיאות בתמלול הגולמי. בנוסף, חלוקת המגדר מסווגת לשלוש קטגוריות בלבד ואינה מאוזנת בהכרח בין השפות השונות.

שאלות
נפוצות

האם המאגר כולל עברית?

כן, המאגר כולל תת-מאגר ייעודי לעברית תחת המזהה he_il. הוא מכיל קובצי שמע מתומללים שחולקו מראש לקבוצות אימון, בדיקה ואימות.

מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, רישיון CC-BY-4.0 מאפשר שימוש מסחרי מלא. הדרישה העיקרית היא מתן קרדיט נאות ליוצרי המאגר בכל הפצה או תוצר רלוונטי.

כמה מקום בדיסק צריך כדי להוריד את הכל?

ההורדה של כל השפות יחד דורשת כ־315 גיגה-בייט, והקבצים הפרוסים תופסים כ־320 גיגה-בייט. ניתן לחסוך מקום רב על ידי טעינת שפה ספציפית בלבד, השוקלת בדרך כלל בין גיגה-בייט לשלושה גיגה-בייט.

האם הדאטהסט מתאים לאימון מודל דיבור מלא מאפס?

לא מומלץ. מספר הדגימות לכל שפה נע סביב אלפים בודדים, היקף שמתאים לבדיקות ביצועים, בנצ'מרק או כוונון עדין של מודל קיים ולא לאימון תשתיתי מאפס.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים. הטעינה נעשית לפי שפה ספציפית דרך הגדרת התצורה המתאימה, למשל he_il לעברית, או בבת אחת עבור כל השפות. אם תבחרו להוריד את המאגר המלא, קחו בחשבון שמדובר בהורדה של כ־315 גיגה-בייט ונפח של כ־320 גיגה-בייט בדיסק. השדות המרכזיים לעבודה הם audio, transcription והמזהים הלשוניים.

from datasets import load_dataset

ds = load_dataset("google/fleurs")

הרישיון

המאגר מופץ תחת רישיון CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה של הנתונים, בתנאי שניתן קרדיט מתאים ליוצרים המקוריים בגוגל. הוא אינו כופה שיתוף של מודלים או נגזרות תחת אותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗