GPT
G

GigaVerbo

קוד פתוח

TucanoBRother2024-06-26

  • portuguese
  • language-modeling

מאגר ענק של טקסט בפורטוגזית שמאחד מקורות רשת, שיחות ומסמכים משפטיים. הוא נבנה עבור אימון מודלי שפה וכולל סיווג איכות מוכן לכל דגימה.

  • 4,719הורדות בחודש
  • 40לייקים

מה זה

המאגר מכיל 145,300,844 רשומות טקסט בפורטוגזית שמגיעות מאיחוד של מגוון מקורות פתוחים. תמצאו כאן סריקות רשת כמו Common Crawl ו־CrawlPT, ערכי ויקיפדיה, פוסטים מבלוגים, מסמכים משפטיים ותרגומי שיחות והוראות. כל רשומה כוללת את הטקסט עצמו, מחרוזת מקור בשדה המטא-דאטה, תווית איכות בינארית שנקבעה באמצעות מסווג מבוסס BERTimbau, וציון ביטחון של המודל.

היוצרים ביצעו סינון כפילויות מדויק באמצעות גיבוב, אבל בחרו להשאיר את כל הדגימות במאגר. מתוך כלל הרשומות, 94,974,954 סווגו כאיכות גבוהה ו־50,325,890 סווגו כאיכות נמוכה. המאגר כולל פיצול אימון בלבד, ומאפשר לכם להחליט בעצמכם איך לחתוך את הנתונים לפי הציונים.

מתאים ל

  • אימון מקדים של מודלי שפה

    הזנה של מעל 200 מיליארד טוקנים בפורטוגזית לבניית מודלי בסיס ייעודיים לשפה.

  • אימון מודלי הוראות

    שימוש בתת-המאגרים של שיחות והוראות מתורגמות לכוונון מודלים בפורטוגזית.

  • מחקר על סינון איכות

    בחינת אלגוריתמים לניקוי דאטה על בסיס התוויות וההסתברויות של מסווג הטקסט.

איפה זה נופל

חלק ניכר מהנתונים עבר תרגום מכונה, מה שמייצר שגיאות תחביר, פגיעה בהקשר ותרגום קלוקל של קטעי קוד שעשוי להכיל פרצות או מבנה שבור. המאגר כולו בפורטוגזית, בלי שום ייצוג לעברית, ומכיל שאריות של שפות אחרות. הכרטיס מציין במפורש שהטקסט מכיל שפה רעילה, פוגענית ותוכן רגיש או אישי. 50,325,890 רשומות הוגדרו כאיכות נמוכה ונמצאות בפנים, כך שחובה להפעיל סינון לפני שמאמנים מודל שמיועד להפקה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא מומלץ להשתמש בו למוצר מסחרי כפי שהוא. המאגר מכיל תתי-מאגרים תחת רישיונות CC BY-NC שאוסרים פעילות מסחרית, לצד רישיונות נגזרים כמו CC BY-SA שמחייבים שיתוף תחת אותו רישיון. שימוש מסחרי ידרוש מכם לנפות החוצה את כל המקורות המגבילים.

כמה נפח אחסון צריך בשבילו?

המאגר שוקל 780 גיגה-בייט ומכיל מעל 200 מיליארד טוקנים. אם אין לכם מקום פנוי בתחנת העבודה, תוכלו לטעון אותו בעזרת הזרמה ישירה בלי להוריד את כל הקבצים מראש.

האם יש במאגר טקסטים בעברית?

לא. המאגר מיועד כולו לפורטוגזית ונאסף ממקורות מקומיים או מתורגמים לפורטוגזית. ייתכנו זליגות קטנות של שפות אחרות, אך אין בו תוכן בעברית.

האם הטקסטים ברמת איכות גבוהה?

לא כולם. המאגר כולל 50,325,890 רשומות שסווגו כאיכות נמוכה על ידי מסווג BERTimbau. היוצרים בחרו להשאיר אותן בפנים כדי שתוכלו לסנן לפי שדות התווית וציון הביטחון בהתאם לצורך שלכם.

איך טוענים

טוענים את המאגר דרך ספריית datasets עם השם TucanoBR/GigaVerbo עבור חלוקת train. הוא שוקל 780 גיגה-בייט ומורכב מקובצי parquet, לכן הורדה מלאה דורשת נפח אחסון משמעותי ורוחב פס רחב. אין צורך באישור גישה מיוחד. מומלץ מאוד לעבוד במצב streaming כדי לעבד את הנתונים ברצף, ולסנן את הדגימות בזמן אמת לפי השדות label ו־probs בהתאם לסף הרצוי.

from datasets import load_dataset

ds = load_dataset("TucanoBR/GigaVerbo")

הרישיון

הרישיון הכללי מוגדר other, מפני שהמאגר מחבר מקורות שונים עם תנאים סותרים. חלק מהמקורות חופשיים כמו cc0-1.0 ו־Apache 2.0, אבל אחרים משתמשים ברישיונות כמו CC BY-NC-SA 4.0, CC BY-NC 4.0 ותנאי השימוש של LLaMA 2. השילוב הזה אוסר שימוש מסחרי בחלקים נרחבים ומחייב שיתוף זהה באחרים, כך שמודל שמאומן על המאגר בשלמותו מוגבל מאוד מבחינה משפטית.

הרישיון המלא ב־Hugging Face ↗