GPT
D

dbpedia-entities-openai-1M

קוד פתוח

KShivendumit2023-06-20

מיליון וקטורים מוכנים שנוצרו עם המודל של OpenAI מתוך ישויות דיביפידיה. חוסך זמן וכסף על קריאות ל־API כשבודקים מסדי נתונים וקטוריים.

  • 3,381הורדות בחודש
  • 26לייקים

מה זה

המאגר מכיל מיליון רשומות שנלקחו ישירות מתוך הדאטהסט של BeIR על ישויות דיביפידיה. היוצרים לקחו את מיליון הרשומות הראשונות בלבד מתוך המאגר המקורי ההוא, חיברו את שדות הכותרת והטקסט של כל ערך, והעבירו את המחרוזת המאוחדת הזו דרך מודל ההטמעה text-embedding-ada-002 של OpenAI.

התוצאה היא אוסף של וקטורים צפופים באורך 1536 ממדים יחד עם המידע הטקסטואלי שממנו הם נוצרו. המטרה הראשונית של הפרויקט הייתה להריץ מבחן ביצועים שהישווה בין pgvector לבין Qdrant, כך שהנתונים מותאמים במיוחד למדידת מהירויות חיפוש וביצועי שליפה של תשתיות וקטוריות שונות.

מתאים ל

  • מבחני ביצועים ל־Vector DB

    בדיקת זמני תגובה ויציבות של מסדי נתונים וקטוריים תחת עומס של מיליון רשומות.

  • בדיקות אינדוקס וקטורי

    מדידת זמני בנייה של אינדקסים כמו HNSW בלי להוציא כסף על הפקת אמבדינגס.

  • הערכת אחזור מידע באנגלית

    בחינת דיוק שליפה סמנטית על נתוני ויקיפדיה מובנים באנגלית בלבד.

איפה זה נופל

הטקסט כולו באנגלית בלבד ואין כאן עברית כלל. הנתונים נשענים על מודל ada-002 מיוני 2023, שהוא מודל סגור של OpenAI, כך שאי אפשר לשחזר בדיוק את המשקלים או להבין את אופן יצירת הייצוג מעבר לקריאה לשירות שלהם. בנוסף, מדובר רק במיליון הרשומות הראשונות של BeIR ולא במדגם אקראי, מה שעלול לייצר הטיה בחלוקת הנושאים. אם המערכת שלכם עובדת בשפה אחרת או דורשת מודל הטמעה פתוח, הנתונים האלה פשוט לא רלוונטיים עבורכם.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, המאגר פורסם תחת רישיון MIT שמתיר שימוש מסחרי מלא ללא תשלום. אתם יכולים להוריד את הנתונים, להטמיע אותם בשרתים שלכם ולבנות עליהם שירותים פנימיים או חיצוניים. התנאי היחיד הוא שמירת הייחוס וטקסט הרישיון המקורי.

האם יש בדאטהסט תמיכה בעברית?

לא, הנתונים הם כולם באנגלית ומבוססים על ערכי דיביפידיה בשפה זו. מודל ההטמעה אמנם מכיר שפות נוספות, אך הטקסטים שהוזנו אליו בפרויקט הזה אינם מכילים עברית. לצורך עבודה מול קורפוס מקומי תצטרכו להפיק וקטורים בעצמכם.

איך המידע נאסף ומאיפה הגיעו הווקטורים?

היוצרים לקחו את מיליון הפריטים הראשונים מתוך הדאטהסט BeIR dbpedia-entity. הם שרשרו את הכותרת והטקסט של כל ישות למחרוזת אחת. את המחרוזת הזו הם שלחו למודל text-embedding-ada-002 של חברת OpenAI ושמרו את התוצאות בקובצי parquet.

מה ההבדל בין המאגר הזה למאגר BeIR המקורי?

המאגר המקורי של BeIR מכיל טקסטים בלבד לצורכי מחקר ואחזור מידע. המאגר הזה לקח חלק מהטקסטים האלה וכבר הריץ עליהם מודל אמבדינג של OpenAI. היתרון כאן הוא שאתם מקבלים את הווקטורים מוכנים וחוסכים את עלויות החישוב וה־API.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets של Hugging Face בלי צורך באישור גישה או מפתח פרטי. המאגר מחולק לעשרים ושישה קובצי parquet שונים בתוך תיקיית המידע. הרשומות כוללות את הטקסט המקורי, הכותרת, ואת הווקטורים המחושבים. בגלל שמדובר במיליון וקטורים של 1536 מספרים עשרוניים, צריך להביא בחשבון צריכת זיכרון משמעותית בעת הפריסה.

from datasets import load_dataset

ds = load_dataset("KShivendu/dbpedia-entities-openai-1M")

הרישיון

המאגר מופץ תחת רישיון MIT. המשמעות היא שמותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במוצרים פרטיים בלי חובה לחשוף את הקוד שלכם או לשתף באותו רישיון. החובה היחידה היא לשמור על הודעת זכויות היוצרים והרישיון המקורי בתוך הפרויקט. לגבי המודל שאומן או נבדק עליו, הרישיון לא מטיל שום מגבלה נוספת.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗