GPT
F

FineWeb-10B

קוד פתוח

Qdrantodc-by2026-08-25

יש כאן גם סקירה על Qdrant עצמו.

מאגר ענק של עשרה מיליארד מסמכים עם וקטורים צפופים ודלילים מוכנים. הוא נבנה כדי לבחון מנועי חיפוש וקטורי בקנה מידה אמיתי שלא רואים במבחנים רגילים.

  • 11,008הורדות בחודש
  • 18לייקים

מה זה

המאגר מכיל חתך של 10,074,324,060 מסמכים מתוך FineWeb של האגינג פייס. כל שורה כוללת את הטקסט המקורי, כתובת הרשת, מזהה הסריקה של Common Crawl, תאריך הסריקה, ציון זיהוי שפה, ספירת טוקנים, וקטור צפוף בן 768 ממדים ווקטור דליל שמבוססים שניהם על מודל gte-multilingual-base של עליבאבא. כל המסמכים שנצפו מסווגים באנגלית עם ציון מהימנות שווה או גבוה מ־0.65.

לצד המסמכים עצמם, המאגר מספק קובצי תוצאות אמת מדויקות, brute-force ground truth, עבור 119,953 שאילתות שמבוססות על MS MARCO. הקבצים האלה מחולקים למאה אלף שאילתות צפופות, עשרת אלפים דלילות, ועוד כעשרת אלפים שאילתות שכוללות סינונים מובנים לפי שפה ותאריכים או סינוני טקסט לפי דומיינים ומילות מפתח.

מתאים ל

  • בנצ'מרק למסדי נתונים

    בדיקת ביצועים, זמני תגובה וזיכרון בחיפוש וקטורי צפוף ודליל על עשרה מיליארד רשומות.

  • מדידת אלגוריתמי קירוב

    הערכת שיטות קידוד, קוונטיזציה ואלגוריתמי ANN מול תוצאות אמת מלאות של top-1000.

  • בדיקת סינון משולב

    מדידת דיוק ומהירות בשאילתות וקטוריות שמשלבות תנאי טקסט, תאריכים ומטא-דאטה מובנה.

איפה זה נופל

הנתונים כוללים אנגלית בלבד, כך שהוא לא יעזור למי שבונה חיפוש בעברית. טקסט השאילתות לא נמצא במאגר אלא דורש שחזור עצמאי. יש פער חישובי קל, תוצאות האמת המקוריות חושבו בחומרת bfloat16 בעוד שסקריפטי השחזור מייצרים float32, מה שעלול לשנות את סדר התוצאות הצמודות סביב סף אלף התוצאות הראשונות. בנוסף, 47 שאילתות סינון טקסט הוסרו לחלוטין כי הן לא החזירו אף מסמך תואם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

חלקי הדאטהסט והווקטורים של המסמכים מותרים בשימוש מסחרי תחת רישיון ODC-BY בכפוף לתנאי האתרים שנסרקו. לעומת זאת, מערך השאילתות של MS MARCO מוגבל לשימוש מחקרי לא-מסחרי בלבד לפי מיקרוסופט, ולכן לא תוכלו להריץ בדיקות מסחריות שמסתמכות עליהן.

האם המאגר כולל תכנים או שאילתות בעברית?

לא. המסמכים שנבדקו וסוננו במאגר סווגו כולם באנגלית בלבד עם ציון זיהוי שפה גבוה מ־0.65, וגם שאילתות MS MARCO הן באנגלית. הוא אינו מתאים למי שרוצה לבדוק התנהגות של מודלים או איחזור בעברית.

איך המאגר נבנה ומאיפה הגיעו הווקטורים?

הטקסטים נלקחו מתוך המאגר FineWeb של האגינג פייס, שמקורו בסריקות רשת של Common Crawl. חברת Qdrant ייצרה את הווקטורים הצפופים והדלילים לכל מסמך באמצעות מודל gte-multilingual-base של עליבאבא, וחישבה את תוצאות האמת המדויקות במנוע שלהם.

מדוע טקסט השאילתות לא מופיע בקובצי תוצאות האמת?

בגלל מגבלות הרישיון של מיקרוסופט, יוצרי המאגר לא הפיצו את הטקסטים והווקטורים של MS MARCO ישירות. במקום זה הם מפיקים מזהים בלבד, ומספקים סקריפטים שמורידים את השאילתות מהמקור ומייצרים את הווקטורים מקומית על המחשב שלכם.

איך טוענים

הנתונים מפוצלים ליותר מעשרת אלפים קובצי Parquet שונים תחת data, והגישה אליהם פתוחה ללא צורך באישור מיוחד. שאילתות המבחן אינן כוללות את הטקסט או הווקטור של השאילתה עצמה, אלא רק מזהים וציוני התאמה למסמכים. כדי להריץ בדיקות מלאות מול השאילתות צריך להשתמש בסקריפטים של המאגר שמורידים את הטקסט של MS MARCO ישירות ומייצרים את הווקטורים מחדש.

from datasets import load_dataset

ds = load_dataset("Qdrant/FineWeb-10B")

הרישיון

המסמכים, הווקטורים ותוצאות האמת מופצים תחת רישיון ODC-BY 1.0 שדורש ייחוס, אך הטקסטים עצמם כפופים לתנאי האתרים המקוריים ולתנאי Common Crawl. נקודה קריטית נוספת היא שאילתות MS MARCO שמיועדות למחקר לא-מסחרי בלבד לפי תנאי מיקרוסופט. מי שמוריד ומייצר את הווקטורים של השאילתות כפוף למגבלה הלא-מסחרית הזו, ולכן אי אפשר להשתמש בשאילתות האלה לבחינה מסחרית של מוצר.

הרישיון המלא ב־Hugging Face ↗