GPT
W

wikipedia-2023-11-embed-multilingual-v3-int8-binary

קוד פתוח

CohereLabsרישיון לא דווח2024-03-18

ויקיפדיה כולה מנובמבר 2023 חתוכה לפסקאות ומקודדת לווקטורים מכווצים. מי שבונה חיפוש סמנטי או RAG חוסך פה את שלב החישוב הכבד והיקר.

  • 1,942הורדות בחודש
  • 49לייקים

מה זה

המאגר הזה לוקח את הדאמפ של ויקיפדיה מתחילת נובמבר 2023, בכל 300 השפות שנתמכות בפרויקט, ומפרק את הערכים לפסקאות בודדות. מדובר בכמעט 250 מיליון פסקאות, כשכל אחת מהן כבר עברה דרך מודל ההטמעות הרב-לשוני של Cohere בגרסה שלוש. במקום לשמור וקטורים מלאים וכבדים, הם קידדו את התוצאות מראש בשני פורמטים מכווצים, מספרים שלמים של שמונה ביט ובינארי ללא סימן, כדי לצמצם את אינדקס הווקטורים בעד פי 32 בלי למחוק את הטקסט המקורי.

המבנה הפנימי מחולק לתת מאגרים לפי קודי שפות, כמו af לאפריקאנס או simple לאנגלית פשוטה, עם אלפי קובצי פארקט בסך הכל. כל רשומה כוללת את המזהה הייחודי שלה, כותרת הערך שממנו היא נלקחה, הטקסט המלא של הפסקה, ושני הווקטורים המוכנים לחיפוש. לא נעשה כאן סינון תוכן מיוחד מעבר לחיתוך הטבעי של ויקיפדיה, כך שהטקסט משקף בדיוק את מה שהיה באנציקלופדיה באותו יום.

מתאים ל

  • אינדקס RAG מהיר

    בניית שליפת מידע מויקיפדיה בלי להשקיע שבועות בריצה של מודלי הטמעה.

  • חיפוש חוצה שפות

    הרצת שאילתות בשפה אחת וקבלת פסקאות רלוונטיות מויקיפדיה בשפות אחרות.

  • בדיקת ביצועי וקטורים

    הערכת מהירות ודיוק של אינדקסים דחוסים בגודל שמונה ביט ובינארי מול טקסט אמיתי.

איפה זה נופל

הנתונים קפואים בנובמבר 2023. כל מה שקרה, התעדכן או נמחק מאז בויקיפדיה פשוט לא קיים פה, כך שאם המוצר שלכם דורש עובדות עדכניות, תצטרכו להשלים אותן לבד. מעבר לזה, המאגר מציג רק וקטורים מכווצים של אינט שמונה ובינארי. לפי הכרטיס הם שומרים על רוב איכות החיפוש, אבל הם לא וקטורים מלאים במקרה שאתם צריכים דיוק מתמטי מוחלט. אין כאן שום סינון של שגיאות, הטעיות או השחתות שהיו קיימות בויקיפדיה בזמן הדאמפ, וההטיות המובנות של כותבי האנציקלופדיה בכל שפה מגיעות ישירות לתוך התוצאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

לא ברור. בכרטיס המאגר לא צוין רישיון כלל, למרות שטקסט המקור מגיע מויקיפדיה. כל עוד אין הבהרה מפורשת מיוצרי המאגר, שימוש מסחרי חושף אתכם לסיכון משפטי.

כמה המאגר הזה שוקל?

המשקל הכולל לא צוין, אבל המאגר מכיל 2,709 קובצי פארקט וקרוב ל־250 מיליון פסקאות עם וקטורים כפולים. שפות גדולות ידרשו עשרות ג'יגה בייטים לפחות, ולכן עדיף להוריד רק את השפה הרלוונטית או לעבוד בהזרמה.

האם יש במאגר פסקאות בעברית?

הכרטיס מציין שהמאגר כולל את כל 300 השפות של ויקיפדיה מאותו תאריך, ולכן ויקיפדיה העברית אמורה להיכלל תחת הקוד שלה. עם זאת, רשימת הקבצים המלאה לא מפרטת את כל השמות בעמוד הראשי וכדאי לבדוק את התקייה הייעודית.

במה הוא שונה מסתם הורדה של ויקיפדיה?

ההבדל הוא שכל עבודת החיתוך לפסקאות והרצת מודל השפה כבר נעשתה כאן מראש. בנוסף, הווקטורים שמורים בפורמט בינארי ואינט שמונה, מה שמקטין את נפח האינדקס בעד פי 32 לעומת וקטורים רגילים.

איך טוענים

טוענים את הנתונים דרך ספריית datasets הרגילה של פייתון, אבל חייבים להגדיר תת מאגר לפי שפה, למשל simple, ולא לנסות להוריד הכל בבת אחת. יש במאגר 2,709 קבצים בפורמט פארקט, כך שהורדה מלאה של שפות גדולות תדרוש נפח אחסון משמעותי ורוחב פס רציני. אם רוצים רק לדגום או לחסוך מקום, מומלץ להפעיל את מצב הזרמת הנתונים streaming שמושך רשומות בזמן אמת. השדות המרכזיים בכל איטרציה הם text, כותרת הערך title, והווקטורים emb_int8 או emb_ubinary, בהתאם למנוע האינדוקס שבו אתם משתמשים. אין צורך באישור גישה מיוחד.

from datasets import load_dataset

ds = load_dataset("CohereLabs/wikipedia-2023-11-embed-multilingual-v3-int8-binary")

הרישיון

היוצרים לא דיווחו על רישיון בכרטיס המאגר. ויקיפדיה עצמה מופצת תחת רישיון חופשי שדורש ייחוס ושיתוף זהה, אבל כשהטקסט ארוז יחד עם הטמעות של מודל קנייני בלי הגדרה משפטית ברורה, אי אפשר לדעת אם מותר להשתמש בזה במוצר מסחרי. לפני שמשלבים את המאגר במערכת שלכם, חובה להתייעץ עם גורם משפטי.

הרישיון המלא ב־Hugging Face ↗