GPT
M

marqo-GS-10M

קוד פתוח

Marqoapache-2.02024-10-15

  • multimodal
  • GCL

מאגר נתוני מסחר מרובה אופנויות מבית גוגל שופינג עם ציוני רלוונטיות רציפים. הוא נבנה עבור מי שרוצה לאמן מודלי חיפוש ודירוג מוצרים מעבר להתאמה בינארית פשוטה.

  • 3,397הורדות בחודש
  • 54לייקים

מה זה

המאגר כולל בין מיליון לעשרה מיליון רשומות המבוססות על תוצאות מתוך גוגל שופינג באנגלית. כל דגימה בנויה ממבנה של שלשות הכולל שאילתת חיפוש, מסמך מוצר המכיל טקסט כמו כותרת ותמונה, וציון רלוונטיות מספרי. הציונים הללו אינם בינאריים, אלא מחושבים בירידה ליניארית לפי מיקום המוצר בתוצאות החיפוש המקוריות שנאספו.

המבנה הפנימי מחולק לארבעה פיצולים עיקריים שנועדו לבדוק ביצועים בתרחישים שונים. החלוקה כוללת סט אימון רגיל, סט עם שאילתות חדשות על מוצרים מוכרים, סט עם מוצרים חדשים לשאילתות מוכרות, וסט לאימון אפס שבו גם השאילתות וגם המוצרים לא נראו קודם לכן. בנוסף, המידע מחולק לתתי מאגרים לפי תחומים, כמו מאגר מלא של עשרה מיליון פריטים, מאגר אופנה של חמישה מיליון, ומאגר אופנת נשים של מיליון פריטים.

מתאים ל

  • אימון מודלי דירוג מוצרים

    לימוד מודלי שלשות לשקלול התאמה מדויקת בין שאילתת טקסט לתמונת מוצר.

  • בדיקת הכללה של חיפוש

    בחינת מנועי חיפוש על שאילתות ומוצרים חדשים שלא נראו כלל באימון.

  • אימון מקודדי טקסט ותמונה

    שיפור מודלים כמו CLIP או E5 על משימות אחזור רב אופנויות באיקומרס.

איפה זה נופל

כל הנתונים נאספו באנגלית בלבד ומבוססים על גוגל שופינג, כך שאין כאן תמיכה בעברית או התאמה לדפוסי מסחר מקומיים. ציוני הרלוונטיות מבוססים על הנחה שמיקום התוצאה במנוע החיפוש משקף ציון מדויק שיורד ליניארית, מה שמכניס רעש והטיות מובנות של האלגוריתם המסחרי שאסף אותם. בנוסף, ההפרדה בין קובצי הנתונים לקובצי התמונות דורשת הורדות כבדות של ארכיונים חיצוניים וסנכרון ידני של נתיבים במחשב.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון של המאגר הוא apache-2.0 ומאפשר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים ולהטמיע אותם במערכות פנימיות או במוצרים ללקוחות. החובה היחידה היא שמירה על הודעות זכויות היוצרים והייחוס ליוצרים המקוריים.

האם יש במאגר נתונים בעברית?

לא, המאגר כולו מוגדר ומתועד באנגלית בלבד. כל השאילתות, הכותרות ותיאורי המוצרים נאספו באנגלית ללא תרגום או מקבילות מקומיות. כדי להשתמש בו למוצרים בשוק הישראלי תצטרכו לתרגם את הטקסטים או לאמן התאמה לשפה המקומית.

איך הופקו ציוני הרלוונטיות בדאטהסט?

הציונים לא נמדדו על ידי בני אדם שדרגו ידנית כל מוצר. הם חושבו באופן אוטומטי על בסיס מיקום התוצאה שהוחזרה במקור בגוגל שופינג. החוקרים השתמשו בפונקציה ליניארית יורדת שמורידה את הציון ככל שהמוצר הופיע נמוך יותר ברשימה.

האם הורדת המאגר דרך האגינג פייס כוללת את כל התמונות?

לא, הקבצים בהאגינג פייס כוללים בעיקר את קובצי הנתונים בפורמט Parquet וטקסטים. קובצי התמונות המלאים שמורים בארכיונים חיצוניים בשרתי S3 של אמזון. תצטרכו להוריד אותם בנפרד ולעדכן את הנתיבים שלהם בקבצים כדי להתחיל לאמן מודלים על התמונות.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets באמצעות הפקודה load_dataset ללא צורך באישור גישה מוקדם. המאגר מכיל 986 קבצי Parquet שמחולקים לפי קטגוריות ופיצולים, ופורסם באוקטובר 2024. נקודה קריטית לעבודה שוטפת היא שהתמונות עצמן אינן מגיעות כחלק מקובצי הטקסט בהאגינג פייס. יש להוריד ארכיוני תמונות חיצוניים משרתי S3, ולאחר מכן להריץ סקריפט פייתון שממפה מחדש את נתיבי התמונות בקובצי הנתונים אל התיקייה המקומית.

from datasets import load_dataset

ds = load_dataset("Marqo/marqo-GS-10M")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מתיר שימוש מסחרי, שינוי של המידע והפצה מחדש ללא צורך בשיתוף תחת אותו רישיון בדיוק. מותר לאמן עליו מודלים למוצרים מסחריים ובלבד ששומרים על תנאי הייחוס של יוצרי המאגר ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗