GPT
V

VeraCruz_PT-BR

קוד פתוח

bastaoרישיון לא דווח2024-03-13

  • pt
  • br
  • portuguese
  • brazilian
  • portugal

מאגר ענק של טקסט בפורטוגזית שממיין את התוכן לפי הדיאלקט הברזילאי או הפורטוגלי. הוא מיועד למי שרוצה לאמן מודל שפה שמבדיל בין הגרסאות של השפה.

  • 24,380הורדות בחודש
  • 17לייקים

מה זה

המאגר מכיל כ־190 מיליון רשומות טקסט שמקורן בחלק הפורטוגזי של MyCulturaX, מאגר רשת רחב שלא הבדיל במקור בין הניבים השונים. הנתונים מחולקים לפי המקור הגיאוגרפי שלהם, כפי שזוהה מתוך כתובות האתרים שמהם נאסף התוכן. יש בו חלוקה לתוכן שמקורו בוודאות בפורטוגל, תוכן שמקורו בברזיל, וחלק שלישי של מקורות לא מזוהים.

עבור החלק שבו כתובת האתר לא הסגירה את המדינה, הטקסטים סווגו באמצעות מודל ייעודי בשם PeroVaz_PT-BR_Classifier. ברשומות האלה תמצאו שתי עמודות נוספות: תווית שמציינת את הניב הנבחר, ועמודת ציון שמציגה את רמת הוודאות של המודל בסיווג.

מתאים ל

  • אימון מודלי שפה בפורטוגזית

    אימון מודלי בסיס או המשך אימון תוך סינון מדויק לפי הניב הברזילאי או הפורטוגלי.

  • סיווג ניבים אוטומטי

    שימוש ברשומות המתויגות והמנוקדות כבסיס לאימון והערכה של מסווגי שפה אזוריים.

  • יצירת טקסט מותאם גיאוגרפית

    התאמת סגנון הכתיבה של מודל יצירת טקסט לקהל יעד בברזיל או בפורטוגל בלבד.

איפה זה נופל

יוצרי המאגר מציינים במפורש שהוא עלול להכיל מידע אישי ורגיש שנאסף מהרשת, כך שאין כאן ניקוי פרטיות מלא ותצטרכו לבצע אנונימיזציה בעצמכם. בנוסף, חלק מהחלוקה לניבים מתבסס על סיווג אוטומטי של מודל ולא על בדיקה אנושית, מה שעלול להכניס שגיאות תיוג. המאגר כולל פורטוגזית בלבד, ללא ייצוג לשפות אחרות או לעברית.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

המאגר עצמו אינו מציין רישיון אחיד ומפנה לתנאים של mC4 ו־OSCAR. המשמעות היא שאין היתר מסחרי ברור ומוגדר מראש בכרטיס המאגר. אם אתם מתכננים מוצר מסחרי, תצטרכו לבדוק את התנאים של שני מאגרי המקור ולוודא שהם מתאימים לצרכים שלכם.

האם המאגר כולל תוכן בעברית?

לא, המאגר מוקדש כולו לשפה הפורטוגזית. הוא נועד במיוחד להפרדה בין פורטוגזית אירופית לפורטוגזית ברזילאית. אין בו שום טקסטים בעברית או התאמה למשימות בשפות שאינן פורטוגזית.

איך נאסף המידע ואיך הוא סווג?

הנתונים נלקחו מהחלק הפורטוגזי של מאגר MyCulturaX ומכילים כ־190 מיליון רשומות. החלוקה הראשונית התבססה על כתובות האתרים שמהן הגיע התוכן כדי לזהות שיוך לברזיל או לפורטוגל. טקסטים ללא שיוך ברור בכתובת עברו סיווג ממוחשב שקבע את הניב והוסיף ציון ודאות.

במה המאגר הזה שונה מ־MyCulturaX הרגיל?

מאגר MyCulturaX המקורי כלל טקסטים בפורטוגזית כגוש אחד, בלי הבחנה בין אזורים בעולם. המאגר הנוכחי לקח את אותו החלק וביצע עליו הפרדה לניבים שונים. בזכות זה אפשר לבודד רק את הדיאלקט הברזילאי או הפורטוגלי לפי הצורך שלכם.

איך טוענים

הנתונים מחולקים לאלפי קבצי parquet, עם מעל 5,700 קבצים במאגר הכולל, מסודרים לפי תיקיות אזוריות כמו br. אין צורך באישור גישה כדי להוריד אותו, אבל בגלל סדר הגודל של מאות מיליוני רשומות, טעינה מלאה דורשת אחסון משמעותי וכוח מחשוב מתאים. ברשומות המסווגות כדאי לשים לב לשדות label ו־score כדי לסנן רשומות לפי רמת הביטחון של הזיהוי.

from datasets import load_dataset

ds = load_dataset("bastao/VeraCruz_PT-BR")

הרישיון

הרישיון של המאגר מוגדר כלא דווח, והיוצרים מפנים לתנאי השימוש של מקורות המידע המקוריים, mC4 ו־OSCAR. זה אומר שאין כאן רישיון אחיד וברור. אתם תלויים במגבלות של שני המאגרים האלה, מה שיוצר סיכון משפטי לפרויקטים מסחריים ומחייב בדיקה מעמיקה של תנאי המקור לפני אימון מודל שיופץ החוצה.

הרישיון המלא ב־Hugging Face ↗