GPT
W

wikipedia-2023-11-embed-multilingual-v3

קוד פתוח

CohereLabsרישיון לא דווח2024-01-11

מדובר בכל ויקיפדיה ביותר מ־300 שפות כשהיא כבר מחולקת לפסקאות ומומרת לווקטורים. מי שבונה מנוע חיפוש או מערכת RAG רב-לשונית חוסך פה חישוב יקר על 250 מיליון קטעים.

  • 13,974הורדות בחודש
  • 249לייקים

מה זה

הבסיס כאן הוא תצלום מלא של ויקיפדיה מנובמבר 2023 דרך ויקימדיה. החומר כולל יותר מ־300 שפות, כשהטקסטים בכל שפה פורקו לפסקאות וקודדו לווקטורים באמצעות מודל ההטבעה של Cohere בגרסה 3. בסך הכל המאגר מקיף קרוב ל־250 מיליון פסקאות עם וקטור תואם לכל אחת.

המבנה מחולק לפי קודי שפות בפורמט פרקט, כמו שרואים בחלוקה לתיקיות עם אלפי קבצים. כל רשומה כוללת מזהה ייחודי, כותרת הערך, תוכן הפסקה ומערך הווקטור עצמו. החומר לא עבר סינון ידני או עריכה מעבר לחיתוך הפסקאות והרצת מודל ההטבעה, כך שהאיכות והתוכן נשענים ישירות על מה שהיה כתוב בוויקיפדיה באותו תאריך.

מתאים ל

  • שליפת מידע למערכות RAG

    חיבור פסקאות מוויקיפדיה כבסיס עובדתי מהיר למודלי שפה, בלי צורך להריץ מודל הטמעה על הטקסטים מראש.

  • חיפוש סמנטי חוצה שפות

    איתור פסקאות רלוונטיות ביותר מ־300 שפות על ידי שליחת שאילתה בשפה אחת וקבלת תוצאות בשפות אחרות.

  • בדיקת איכות למנועי חיפוש

    הרצת מבחני ביצועים והשוואת שליפה וקטורית מול בסיס ידע עצום ורב-לשוני של 250 מיליון פסקאות.

איפה זה נופל

הנתונים משקפים את ויקיפדיה מתחילת נובמבר 2023, ולכן כל אירוע או עדכון שהתרחש מאז פשוט לא מופיע. הווקטורים חושבו עם מודל סגור של חברה מסחרית, מה שמחייב שימוש באותו מודל בדיוק כדי להטמיע שאילתות חדשות לחיפוש. בנוסף, רמת הכיסוי והדיוק של ערכים משתנה מאוד בין שפות מרכזיות לשפות קטנות.

שאלות
נפוצות

האם יש במאגר ערכים בעברית?

כן, המאגר מכסה מעל 300 שפות מוויקיפדיה וכולל חלוקה לפי קוד השפה. אפשר לטעון ישירות את החלק הרלוונטי על ידי ציון קוד השפה בעת הטעינה.

האם מותר להשתמש בדאטהסט לפיתוח מסחרי?

בעמוד הדאטהסט לא מופיע רישיון. מצב כזה משאיר את השימוש המסחרי בערפל משפטי, ולכן לחברות מומלץ לבדוק את תנאי המקור של ויקימדיה ושל יוצרי המאגר לפני שימוש כזה.

איך מחפשים מול הווקטורים שבמאגר?

כדי למצוא התאמות צריך להמיר את שאילתת החיפוש לווקטור באמצעות אותו מודל הטמעה של Cohere. לאחר מכן מחשבים דמיון וקטורי בין וקטור השאילתה לפסקאות השמורות.

עד כמה הנתונים מעודכנים?

הנתונים נלקחו מעותק ויקיפדיה מתאריך 1 בנובמבר 2023. כל מידע שנערך, נמחק או נוסף מאז אינו קיים במאגר.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות ציון קוד השפה המבוקש. אין צורך באישור גישה מיוחד, אבל מומלץ להשתמש בהזרמה במקום להוריד הכל בבת אחת. המאגר עצום ומכיל 2,709 קבצים, כך שהורדה מלאה של שפות גדולות תדרוש נפח אחסון כבד וזיכרון עבודה משמעותי. השדות המרכזיים שמושכים מכל פריט הם הטקסט, הכותרת והווקטור תחת השם emb.

from datasets import load_dataset

ds = load_dataset("CohereLabs/wikipedia-2023-11-embed-multilingual-v3")

הרישיון

הרישיון לא דווח בעמוד המאגר. מבחינה משפטית זו בעיה, כי אי אפשר לדעת בוודאות אם מותר לשלב את הנתונים במוצר מסחרי, לאמן מודלים נגזרים או לחלק אותם מחדש. כל עוד אין הצהרת רישיון מפורשת, הכנסת החומר לקוד ארגוני כרוכה בסיכון משפטי לא מבוטל.

הרישיון המלא ב־Hugging Face ↗