GPT
W

wikipedia-2024-06-bge-m3

קוד פתוח

Upstashapache-2.02024-08-09

מאגר ענק של וקטורים מוכנים מפסקאות ויקיפדיה ב־11 שפות, שחושבו ישירות עם מודל BGE-M3. הוא חוסך שבועות של חישוב אם אתם מקימים חיפוש סמנטי גלובלי.

  • 2,490הורדות בחודש
  • 41לייקים

מה זה

המאגר כולל פסקאות מתוך דאמפ ויקיפדיה של יוני 2024, שעברו המרה לוקטורים. הטקסט חולק לפסקאות, ולפני יצירת הוקטור הצמידו לכל פסקה את כותרת הערך כדי לשפר את תוצאות החיפוש. פסקאות קצרות עם פחות מ־100 תווים סוננו החוצה בגלל דחיסות מידע נמוכה.

בסך הכל יש כאן כ־144 מיליון וקטורים שמחולקים לפי שפות. החלק האנגלי הוא הגדול ביותר עם מעל 47 מיליון רשומות, ואחריו גרמנית, צרפתית, רוסית, ספרדית, איטלקית, יפנית, פורטוגזית, פרסית, סינית וטורקית. כל שפה מוגדרת כקונפיגורציה נפרדת, כך שלא צריך להוריד את כל העולם אם צריך רק שפה אחת.

מתאים ל

  • אינדוקס מנוע חיפוש סמנטי

    הזנה ישירה של הווקטורים לבסיס נתונים וקטורי ללא צורך לשלם על שעות חישוב של BGE-M3.

  • תשתית אחזור ל־RAG רב-לשוני

    שליפת פסקאות רקע מדויקות מויקיפדיה עבור צ'אטבוטים ב־11 שפות נתמכות.

  • בנצ'מרק למסדי נתונים

    בדיקת עומסים וביצועי חיפוש על סדרי גודל של עשרות מיליוני וקטורים אמיתיים.

איפה זה נופל

אם אתם בונים מוצר לשוק המקומי בישראל, אין כאן עברית בכלל. המאגר מוגבל ל־11 שפות בלבד, והתוכן קפוא על יוני 2024, כך שכל אירוע או ערך שהשתנה מאז פשוט לא קיים. בנוסף, אתם כבולים ספציפית למודל BGE-M3. אם תרצו להשתמש במודל וקטורי אחר, המאגר הזה מאבד את כל היתרון שלו ותצטרכו לחשב הכל מאפס.

שאלות
נפוצות

האם הדאטהסט כולל עברית?

לא. המאגר מוגבל ל־11 שפות בלבד: אנגלית, גרמנית, צרפתית, רוסית, ספרדית, איטלקית, יפנית, פורטוגזית, פרסית, סינית וטורקית. עברית לא נכללה בעיבוד של יוני 2024.

האם מותר להשתמש במידע הזה במוצר מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי חופשי למדי. יש לוודא שאתם עומדים בדרישות הרישיון לגבי ייחוס והשארת הודעות זכויות היוצרים.

האם חייבים להוריד את כל המאגר בבת אחת?

ממש לא. אפשר לטעון רק שפה מסוימת באמצעות הקונפיגורציה שלה, ומומלץ להשתמש בטעינה רציפה (streaming) כדי לא להעמיס על נפח האחסון המקומי.

האם המאגר שמיש אם אני לא עובד עם BGE-M3?

לא ממש. היתרון העיקרי כאן הוא 144 מיליון הווקטורים המוכנים שנבנו ספציפית עם BGE-M3. אם אתם משתמשים במודל אחר, תצטרכו להפיק וקטורים מחדש מטקסט המקור.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון שם המאגר והשפה הרצויה, למשל en או de, כשהפיצול הוא train. בגלל שמדובר ב־1,449 קובצי parquet ונפח אדיר, עדיף להפעיל streaming במקום להוריד הכל לדיסק. הרשומות כוללות את השדות id, url, title, text, ואת וקטור ה־embedding המוכן. אין צורך באישור גישה מיוחד.

from datasets import load_dataset

ds = load_dataset("Upstash/wikipedia-2024-06-bge-m3")

הרישיון

המאגר מפורסם תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו ולהפיץ אותו הלאה, כל עוד שומרים על הודעת הרישיון וציון המקור. אין חובה לשתף פרויקטים נגזרים באותו הרישיון, מה שמאפשר שימוש גמיש בפיתוח מערכות פנימיות ומוצרים מסחריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗