GPT
E

embedding-training-data

קוד פתוח

sentence-transformersרישיון לא דווח2022-03-02

אוסף קבצים גולמיים שמיועד לאימון מודלי שיכוך טקסט באנגלית. הוא מאגד מקורות מוכרים כמו שאלות ותשובות, ביקורות ומאמרים מדעיים במבנה אחיד שמתאים ישירות לספריות דמיון סמנטי.

  • 1,842הורדות בחודש
  • 144לייקים

מה זה

המאגר מכיל 38 קבצים שונים שכוללים מיליוני רשומות טקסט באנגלית. הנתונים נלקחו מעשרות מקורות ציבוריים מוכרים, ביניהם שאילתות חיפוש, שאלות ותשובות מפורומים, תקצירי מאמרים מדעיים, ביקורות מוצרים מאמזון וחדשות. המפרסמים לא ביצעו סינון תוכן או ניקוי מיוחד משלהם, אלא רק המירו את המקורות למבנה אחיד.

המבנה הפנימי מחולק לכמה תצורות עיקריות שנועדו לפונקציות הפסד שונות. ישנם זוגות של טקסטים דומים כמו שאלה ותשובה, שלשות שכוללות עוגן, דוגמה חיובית ודוגמה שלילית, וקבוצות של ניסוחים מחדש לאותו רעיון. חלק מהקבצים מכילים גם שליליים קשים שחולצו מראש כדי להקשות על המודל ולשפר את ההפרדה במרחב הווקטורי.

מתאים ל

  • אימון מודלי שיכוך באנגלית

    אימון ראשוני של מודל וקטורי על זוגות טקסט ושאלות ותשובות ממגוון תחומים רחב.

  • הפרדה סמנטית עם שלשות

    שימוש בקבצים שמכילים דוגמאות שליליות כדי לחדד את יכולת ההפרדה של המודל.

  • התאמה למאמרים מדעיים

    אימון ייעודי על נתוני מאמרים ותקצירים ממאגרי מחקר שכלולים באוסף.

איפה זה נופל

הנתונים כולם באנגלית ואין כאן ייצוג לעברית כלל. מעבר לזה, המפרסמים מצהירים במפורש שהם לא בדקו את איכות התוכן, ההטיות או ההוגנות בטקסטים, והאחריות על בדיקת החומרים נופלת עליכם. המקורות נאספו לפני שנת 2022 מחברות מסחריות, אתרי חדשות וקהילות רשת, כך שהטקסטים עשויים לכלול ביטויים לא הולמים, שגיאות או מידע מיושן. מי שבונה מודל ייעודי לעולם תוכן ספציפי כמו רפואה או משפטים יגלה שרוב המאגר מכיל שיחות כלליות, תקצירי ויקיפדיה ושאלות גולשים שלא בהכרח מייצגים את הטרמינולוגיה הנדרשת.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

אין רישיון אחד שמכסה את כל המאגר, והמפרסמים מדגישים שאינם מעניקים זכויות שימוש. כל קובץ מקור הגיע מפרויקט אחר עם תנאים משלו, מחופשיים לגמרי ועד הגבלות לאקדמיה בלבד. אם אתם בונים מוצר מסחרי, תצטרכו לבדוק את הרישיון של כל קובץ ספציפי שאתם מחליטים להכניס לאימון.

האם יש כאן נתונים בעברית?

לא, המאגר כולו מתועד ומתוייג באנגלית בלבד. כל הטקסטים מגיעים ממקורות דוברי אנגלית כמו ויקיפדיה האנגלית, פורומים וחדשות מקומיות. מפתח ישראלי שצריך לאמן מודל שיבין עברית לא ימצא כאן תועלת ישירה לחילוץ ייצוגים בשפה.

איך הטקסטים נאספו והוכנו לעבודה?

המפרסמים אספו מאגרי מידע קיימים ממחקרים ומאתרי אינטרנט והמירו אותם לפורמט אחיד של שורות JSON. לא בוצע ניקוי ידני מיוחד של התוכן מעבר להתאמתו למבנה של זוגות, שלשות או קבוצות טקסטים דומים. המטרה הייתה לספק קבצים שמתאימים ישירות לפונקציות אימון של ספריות וקטוריות בלי צורך בעיבוד נוסף.

מה ההבדל בין המאגר הזה לגרסאות חדשות יותר?

זהו אוסף של קבצים גולמיים כפי שפורסמו במרץ 2022. בדף המאגר מופיעה הערה שממליצה לגשת לאוסף המעודכן יותר של יוצרי הספרייה, שם הנתונים עברו עיבוד והתאמה נוחה יותר לאימון מודרני. אם אתם מתחילים פרויקט חדש, שווה לבדוק קודם את האוסף המעודכן שהם מקשרים אליו.

איך טוענים

כל קובץ שמור בנפרד כקובץ דחוס מסוג jsonl.gz ואין צורך בבקשת גישה מיוחדת כדי להוריד אותו. קוראים שורה אחר שורה בכל קובץ, כאשר כל שורה היא אובייקט JSON פשוט. בחלק מהקבצים תמצאו מערך פשוט של שניים או שלושה מחרוזות טקסט, ובקבצים אחרים יש מפתחות מוגדרים כמו query, pos ו־neg שמכילים רשימות של דוגמאות חיוביות ושליליות. בגלל שהקבצים הגדולים מכילים עשרות מיליוני שורות, כדאי להוריד ולטעון רק את המקורות שרלוונטיים למשימה שלכם במקום למשוך את כל המאגר בבת אחת.

from datasets import load_dataset

ds = load_dataset("sentence-transformers/embedding-training-data")

הרישיון

למאגר הכללי לא הוגדר רישיון אחיד. המפרסמים מבהירים שהם רק ריכזו והמירו את הקבצים, ולכן עליכם לגשת לכל מקור מקורי ולבדוק את תנאי הרישיון שלו בנפרד. חלק מהנתונים חופשיים לשימוש, אך אחרים עשויים לאסור שימוש מסחרי או לדרוש ייחוס, ואימון מודל על כל הקבצים יחד יוצר סיכון משפטי ברור למוצר מסחרי.

הרישיון המלא ב־Hugging Face ↗