GPT
B

bge-m3-data

קוד פתוח

Shitaoרישיון לא דווח2024-03-02

אוסף נתוני אימון מגוון למודלי אחזור וטקסט שנועד לשחזר או לשפר את מודל bge-m3. הוא מאגד מאגרי שאלות, תשובות ודירוג בפורמט אחיד של שאילתה מול תוצאות חיוביות ושליליות.

  • 144הורדות בחודש
  • 55לייקים

מה זה

המאגר מרכז את כל המידע ששימש לכוונון עדין של מודל bge-m3. הוא כולל אוספים מוכרים באנגלית כמו MS MARCO, HotpotQA, SQuAD, PubMedQA ונתוני NLI מ־SimCSE, לצד מקורות נרחבים בסינית כמו DuReader, T2Ranking ונתונים משפטיים ורפואיים. בנוסף משולבים בו מאגרים רב לשוניים כמו Mr.TyDi ב־11 שפות, MIRACL ב־16 שפות וגרסת האימון המעובדת של MLDR ב־13 שפות.

כל שורה בקבצים היא אובייקט בפורמט jsonl שמכיל שלושה שדות: query עם מחרוזת השאילתה, pos עם רשימת תוצאות חיוביות, ו־neg עם רשימת תוצאות שליליות. החלוקה הפנימית של הקבצים נעשתה לפי אורך הטוקנים של הטקסט, שנמדד באמצעות הטוקנייזר של xlm-roberta-large. כך למשל, הנתונים של MS MARCO מחולקים לשמונה קבצים נפרדים לפי טווחי אורך, מטווח של אפס עד 500 טוקנים ועד לטקסטים ארוכים מעל 7000 טוקנים.

מתאים ל

  • אימון מודלי אחזור

    כוונון עדין למודלי חיפוש ודחיסת טקסטים באמצעות זוגות של שאילתה, תוצאה רלוונטית ותוצאות שליליות.

  • התמודדות עם טקסט ארוך

    אימון מודלים על קבצים שמקובצים מראש לפי אורכי טוקנים שונים, עד לטקסטים של מעל 7000 טוקנים.

  • בדיקת ביצועים רב לשונית

    הערכה ובחינה של מנועי חיפוש על נתוני מבחן מתוך מאגרים כמו MKQA במגוון שפות נתמכות.

איפה זה נופל

הכרטיס לא מציין תמיכה בעברית, ולפי רשימת השפות והמקורות המאגר מתמקד בעיקר באנגלית, סינית ובקבוצות שפות ספציפיות מתוך פרויקטים רב לשוניים מוגדרים. אין בכרטיס פירוט לגבי סינון רעשים, תוכן פוגעני, או כיצד בדיוק נבחרו הדוגמאות השליליות. בנוסף, חלוקת האורכים נשענת בלעדית על הטוקנייזר של xlm-roberta-large, כך שאם אתם עובדים עם ארכיטקטורה אחרת, חלוקת האורכים המוכנה בקבצים לא בהכרח תתאים לחלונות ההקשר שלכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

לא מומלץ בכלל. במאגר לא מוגדר שום רישיון, ומכיוון שמדובר באוסף של מקורות חיצוניים רבים, אין ערובה משפטית לזכויות השימוש בהם. שימוש מסחרי עלול לחשוף אתכם להפרת זכויות יוצרים.

האם יש במאגר נתונים בעברית?

הכרטיס לא מדווח על תמיכה בעברית. המקורות המרכזיים מתמקדים באנגלית ובסינית, לצד סטים רב לשוניים כמו MIRACL ו־Mr.TyDi שכוללים מספר שפות מוגדר בלבד ללא עברית.

איך הנתונים מאורגנים בתוך הקבצים?

כל המאגרים הומרו למבנה אחיד של קובצי jsonl שבהם כל רשומה כוללת שאילתה, תוכן חיובי ותוכן שלילי. בנוסף, הנתונים פוצלו לקבצים נפרדים לפי אורך הטוקנים שחושב באמצעות הטוקנייזר של xlm-roberta-large.

איך מושכים את הנתונים לעבודה בפועל?

במקום קריאה רגילה בספריית datasets, מורידים את קובצי הארכיון הדחוסים bge-m3-data.tar.gz או MKQA_test-data.zip ישירות מהמאגר. לאחר החילוץ טוענים את קובצי ה־jsonl שמעניינים אתכם ישירות לקוד.

איך טוענים

המאגר מגיע כארכיון מכווץ ולא בטעינה ישירה של שורה אחת מקוד. תמצאו שם קובץ ארכיון מרכזי בשם bge-m3-data.tar.gz וקובץ MKQA_test-data.zip, כך שתצטרכו להוריד אותם, לפתוח מקומית ולקרוא את קובצי ה־jsonl בעצמכם. אין צורך באישור גישה מיוחד כדי להוריד. בכל קובץ תעבדו ישירות מול המפתחות query, pos ו־neg, כאשר הקבצים כבר מופרדים מראש לפי אורך הטקסט.

from datasets import load_dataset

ds = load_dataset("Shitao/bge-m3-data")

הרישיון

בעמוד המאגר לא דווח רישיון כלל. זה אומר שמבחינה משפטית אין לכם הרשאה מפורשת להשתמש בנתונים, לא לצרכים מסחריים וספק אם למחקר חופשי. אימון מודל על מאגר ללא רישיון מסכן את היכולת להפיץ או למסחר את המשקולות שנוצרו, במיוחד כשהוא מאגד בתוכו מקורות שונים שלכל אחד מהם עשויים להיות תנאי שימוש מקוריים משלו.

הרישיון המלא ב־Hugging Face ↗