GPT
E

embeddings-pre-training

קוד פתוח

lightonaiרישיון לא דווח2025-08-18

אוסף ענק של זוגות שאילתה ומסמך לאימון מקדים של מודלי שיכוך טקסט, שנבנה כדי לשחזר את מתכון הנתונים החסר של mGTE. הוא חוסך איסוף ידני מעשרות מקורות פתוחים במקום אחד.

  • 4,225הורדות בחודש
  • 51לייקים

מה זה

הרשומות בנויות כזוגות טקסט של שאילתה ומסמך תואם, לצד שדות בקרה טכניים. המבנה כולל מזהה ייחודי, דגל בוליאני שמסמן אם כדאי להחריג את השורה, ושדה שרושם מזהה כפילות כאשר הטקסטים חוזרים על עצמם. הנתונים מגיעים משני ערוצים עיקריים: איחוד של עשרות מאגרי שיכוך מוכרים כמו ויקיפדיה, רדיט, פלטפורמות שאלות ותשובות ומאמרים מדעיים, לצד קבוצת תתי-מאגרים שנוצרו מתוך FineWeb-Edu ו־FineWeb2 ועברו עיבוד ייעודי לאחזור מידע.

האוסף מחולק לתצורות נפרדות לפי מקור הנתונים. חלק משמעותי מבוסס על אנגלית, כולל מקורות מגוונים של חדשות, דיונים וקוד. במקביל, הנגזרות מ־FineWeb2 מרחיבות את הכיסוי לשפות נוספות, בהן צרפתית, ערבית, סינית, רוסית וגרמנית, ומאפשרות אימון ממוקד לפי שפה או שילוב מבוקר ביניהן.

מתאים ל

  • אימון מקדים של מודלי שיכוך

    אימון של שלבי הבסיס במודלי ייצוג וקטורי יחיד או מרובה באמצעות זוגות שאילתה ומסמך.

  • מחקר על הרכב נתונים באחזור

    בדיקת ההשפעה של שילובי מקורות שונים על ביצועי אחזור מידע והשוואה מול מתכון mGTE.

  • ניתוח תהליכי ניקוי דאטה

    בחינת שיטות דה-דופליקציה וסינון רעשים בעזרת שדות ההחרגה והכפילויות שמגיעים מובנים במאגר.

איפה זה נופל

הבעיה הבולטת ביותר לקורא המקומי היא היעדר עברית. יש מבחר שפות אירופיות ואסייתיות מ־FineWeb2, לצד ערבית, אבל עברית לא קיימת ברשימת המקורות. בנוסף, המאגר הוא עבודת הרכבה בתהליך ולא מוצר מוגמר שעבר ניקוי מלא. היוצרים מודים שהנתונים כוללים כפילויות ורעש ומגלגלים את משימת הסינון והניפוי אליכם דרך שדות הבקרה. יש פה גם הטיה כבדה לאנגלית ולסגנונות כתיבה ספציפיים שמגיעים מפורומים כמו רדיט ופלטפורמות שאלות ותשובות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מודל מסחרי?

אין תשובה אחת כי המאגר כולו לא מגיע תחת רישיון אחיד. כל תת-אוסף שומר על תנאי השימוש המקוריים שלו מפלטפורמות כמו רדיט, מיקרוסופט או ויקיפדיה. תצטרכו לבדוק את הרישיון של כל מקור בנפרד לפני השימוש.

האם יש במאגר נתונים בעברית?

לא. המאגר מציע כיסוי רחב באנגלית, לצד שפות מתוך FineWeb2 כמו ערבית, סינית, צרפתית, רוסית וגרמנית, אך עברית אינה נכללת באף אחת מהתצורות המפורטות.

איך מחלצים רק את המידע הנקי לאימון?

צריך לסנן את הנתונים בעזרת שדות הבקרה המובנים. שומרים רק שורות שבהן העמודה drop מוגדרת כ־False והעמודה duplicate היא ערך ריק. אם לא תסננו, המודל יתאמן על כפילויות ומידע שסומן כלא רצוי.

איך טוענים את הנתונים בלי להוריד את כל המאגר?

הדאטהסט מחולק לתצורות נפרדות לפי שם המקור המקורי. בקריאה לפונקציית הטעינה מגדירים את התצורה הרצויה, למשל wikihow, וכך מורידים רק את החלקים שרלוונטיים לפרויקט שלכם מתוך 1,732 הקבצים.

איך טוענים

המאגר מכיל 1,732 קבצים בפורמט פרקט ופתוח לגישה ישירה בלי צורך בטופס הרשאה. בעבודה מעשית לא מורידים את הכל בבת אחת, אלא טוענים תצורה וחלוקה ספציפיות לפי שם המקור בספריית הדאטהסטים. לפני שמזרימים את השורות לאימון, צריך לסנן את הנתונים באופן יזום: לקחת רק שורות שבהן דגל ההחרגה מסומן כשקר ושדה הכפילויות ריק. זה קריטי כי המאגר משאיר בכוונה רשומות כפולות ומלוכלכות לצורכי מחקר על תהליכי ניקוי.

from datasets import load_dataset

ds = load_dataset("lightonai/embeddings-pre-training")

הרישיון

המאגר מוגדר ללא רישיון אחיד. היוצרים מצהירים בפירוש שכל מקור שומר על הרישיון המקורי שלו ושאין רישוי מחדש של המידע. המשמעות המשפטית היא שאי אפשר להניח שימוש מסחרי מותר על הכל כמקשה אחת. אם אתם מאמנים מודל שמיועד למוצר מסחרי, תצטרכו לעבור מקור אחר מקור, לבדוק את תנאי הרישוי המקוריים של כל תת-מאגר ולוודא שאין ביניהם דרישות שיתוף זהה או איסור מסחרי.

הרישיון המלא ב־Hugging Face ↗