GPT
W

wiki_dpr

קוד פתוח

facebookcc-by-nc-4.02022-03-02

  • text-search

המאגר מכיל 21 מיליון פסקאות מוויקיפדיה יחד עם וקטורים מוכנים שחושבו מראש. הוא מיועד למי שבונה או בודק מערכות אחזור צפוף לחיפוש תשובות ולא רוצה להשקיע שבועות של חישוב על כל הטקסט.

  • 50,113הורדות בחודש
  • 45לייקים

מה זה

כל רשומה מייצגת פסקה של עד 100 מילים מתוך דאמפ של ויקיפדיה באנגלית מ־20 בדצמבר 2018. המבנה כולל מזהה טקסטואלי, כותרת הערך, תוכן הפסקה, ווקטור הטמעה מסוג float32 באורך 768 ממדים שנוצר על ידי מודל DPR.

המאגר מציע שתי משפחות וקטורים לפי האימון של המודל, האחת אומנה על Natural Questions והשנייה על שילוב של כמה מאגרים שנקרא multiset. מעבר לסוג המודל, יש תצורות שמגיעות עם אינדקס FAISS מדויק, אינדקס דחוס לחיסכון בזיכרון, ללא אינדקס כלל, או אפשרות להוריד את הטקסטים ללא וקטורים.

מתאים ל

  • הערכת מנועי אחזור

    מדידת ביצועים של אחזור פסקאות צפוף מול 21 מיליון רשומות ויקיפדיה עם וקטורים מוכנים.

  • אימון מודלים למענה לשאלות

    שליפת מידע תומך עבור מודלים של open-domain question answering באנגלית.

  • בדיקת אינדקסים של FAISS

    השוואת מהירות ודיוק בין אינדקס מדויק לאינדקס דחוס על וקטורים בגודל 768 ממדים.

איפה זה נופל

הטקסטים מבוססים על דאמפ משנת 2018 ובשפה האנגלית בלבד, כך שאין כאן עברית והמידע אינו מעודכן לאירועים מהשנים האחרונות. כרטיס הדאטסט לא מפרט סינון של מידע רגיש או הטיות חברתיות, ומסמן חוסר במידע סביב תהליך הניקוי. החלוקה הקשיחה לבלוקים שרירותיים של 100 מילים קוטעת לעיתים הקשר של משפטים, ומי שמחפש מידע עדכני יקבל תשובות שגויות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון שדווח הוא cc-by-nc-4.0, ולכן השימוש מוגבל למטרות לא מסחריות בלבד. כל שימוש בתוך מוצר מניב הכנסה או מערכת מסחרית מפר את תנאי הרישיון.

כמה שטח דיסק וזיכרון צריך להכין לפני ההורדה?

הקבצים להורדה שוקלים בין 70 ל־85 גיגה בייט, והדאטסט שנפרס בדיסק מגיע ל־78.42 גיגה בייט, כך שהשטח הכולל מגיע ל־163.71 גיגה בייט. מעבר לדיסק, שימוש בגרסת האינדקס המדויקת דורש כמות גדולה מאוד של זיכרון עבודה.

האם המאגר כולל ערכים בעברית?

לא. המאגר נבנה על בסיס דאמפ של ויקיפדיה באנגלית בלבד. אין בו ייצוג לשפות אחרות או טקסטים מקומיים.

איך הטקסט נאסף ועובד?

יוצרי המאגר לקחו עותק של ויקיפדיה באנגלית מ־20 בדצמבר 2018 וחילקו אותו לפסקאות בדידות של עד 100 מילים. עבור כל פסקה הם חישבו וקטור באורך 768 באמצעות מודל DPR שאימנו מראש.

איך טוענים

הנתונים שמורים בקובצי Parquet ואינם דורשים הרשאת גישה מיוחדת, אבל תצטרכו להכין המון מקום בדיסק. הורדת הקבצים דורשת בין 70.97 ל־85.23 גיגה בייט, והנתונים שנוצרים מגיעים ל־78.42 גיגה בייט, כך שסך השטח הנדרש מגיע ל־163.71 גיגה בייט. השדות המרכזיים בקריאה הם text, title, ו־embeddings. אם תבחרו בתצורת exact עם אינדקס מלא, קחו בחשבון צריכת זיכרון RAM עצומה בזמן הטעינה.

from datasets import load_dataset

ds = load_dataset("facebook/wiki_dpr")

הרישיון

הרישיון של המאגר הוא cc-by-nc-4.0. המשמעות היא שהשימוש מותר למטרות מחקר ולא למטרות מסחריות, תוך מתן קרדיט מתאים. אם אתם מתכננים לאמן מודל לצורך מוצר מסחרי, הרישיון הזה חוסם אתכם.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗