GPT
F

fineweb-c

קוד פתוח

data-is-better-togetherרישיון לא דווח2024-12-20

  • argilla
  • data-is-better-together

אפשר גם להריץ אותו בדפדפן בלי להתקין דבר.

מאגר סיווג רב לשוני שכולל דירוגי איכות חינוכית ותיוג תוכן בעייתי. הוא נועד למי שבונה מסנני איכות למאגרי אימון בשפות שונות.

  • 3,395הורדות בחודש
  • 60לייקים

מה זה

המאגר מציע טקסטים בשפות ואלפביתים שונים עם תיוגים ידניים של מתייגים אנושיים. כל שפה ואלפבית מיוצגים בתצורה נפרדת, לצד תצורת ברירת מחדל שמאגדת 45,160 דוגמאות אימון. ברשומות מופיעים מזהה, הטקסט המקורי, שמות וקודי השפה הרלוונטיים.

לצד הטקסט נשמרים תיוגים עבור ערך חינוכי, מזהי המתייגים, חיווי על נוכחות תוכן בעייתי ומידת ההסכמה בין המתייגים באותו חיווי. החלוקה הפנימית מפרידה ניבים ושפות שונות, מחלקים קטנים מאוד של עשרות דוגמאות ועד חלוקות שמגיעות ל־1,000 דוגמאות לקונפיגורציה. הכרטיס אינו מפרט תהליכי איסוף או סינון מוקדמים של הטקסטים עצמם מעבר לתיוגים הללו.

מתאים ל

  • אימון מסנן איכות

    אימון מודל קל לזיהוי ערך חינוכי בטקסטים לפני הכנסתם למאגר אימון.

  • סינון תוכן בעייתי

    בניית מסווג שמזהה תוכן בעייתי בשפות מרובות לפי תיוגי הסכמה.

  • הערכת עקביות מתייגים

    מחקר על מידת ההסכמה בין מעריכים שונים לגבי איכות טקסט.

איפה זה נופל

גודל המדגמים אינו אחיד, וחלק מהשפות כוללות עשרות בודדות של רשומות, מה שלא מספיק לאימון רציני. עברית אינה מופיעה ברשימת השפות של המאגר. בנוסף, הכרטיס לא מדווח מה מקור הטקסטים הגולמיים ומה טווח התאריכים שבהם הם נכתבו. כדאי לבדוק את התפלגות ההסכמה בין המתייגים, כי מדובר בהערכות סובייקטיביות של ערך לימודי ותוכן בעייתי.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

לא מומלץ לעשות בו שימוש מסחרי כרגע. בדף המאגר לא דווח רישיון כלל, מה שאומר שאין הרשאה חוקית ברורה לשימוש כזה. שימוש ללא רישיון מוגדר חושף אתכם לתביעות זכויות יוצרים.

האם המאגר כולל טקסטים בעברית?

לא, עברית לא מופיעה ברשימת השפות והתצורות של המאגר. יש בו שפות כמו ערבית, פרסית, דנית וצרפתית. מי שמחפש נתונים עבור עברית יצטרך לפנות למקורות אחרים.

כמה נפח דרוש כדי להוריד את המאגר?

תצורת ברירת המחדל דורשת הורדה של כ־116 מגה בייט בלבד. כשהנתונים נפרסים בזיכרון, הנפח מגיע לכ־210 מגה בייט. מדובר במאגר קומפקטי מאוד שמתאים לעבודה על מחשב נייד פשוט.

איך נאספו הטקסטים והתיוגים?

הכרטיס מציג רק את התוצרים הסופיים עם מזהי מתייגים ותוויות, בלי לפרט את מקור הטקסטים המקורי. לא ידוע מאיזה אתרים או מאגרים נלקח התוכן הגולמי. ידוע רק שהמתייגים האנושיים בחנו את התוכן החינוכי והבעייתי בכל רשומה.

איך טוענים

הטעינה מתבצעת ישירות מול המאגר לפי תצורה ספציפית של שפה או בתצורת ברירת המחדל. הקבצים שמורים בפורמט פרקט, והורדת ברירת המחדל שוקלת סביב 116 מגה בייט כך שאין צורך בחומרה כבדה. אין דרישה לאישור גישה מוקדם. בעבודה עם הנתונים חשוב לבדוק את עמודת ההסכמה על תוכן בעייתי ואת רשימת התוויות החינוכיות לכל שורה.

from datasets import load_dataset

ds = load_dataset("data-is-better-together/fineweb-c")

הרישיון

היוצרים לא דיווחו על רישיון עבור המאגר. מבחינה משפטית, היעדר רישיון אומר שאין לכם הרשאה מפורשת להשתמש בטקסטים, להפיץ אותם או לאמן עליהם מודלים מסחריים. שימוש בו כרוך בסיכון של הפרת זכויות יוצרים עד שהמפרסמים יבהירו את תנאי הרישוי.

הרישיון המלא ב־Hugging Face ↗