GPT
T

TencentGR-1M

קוד פתוח

TAAC2025cc-by-4.02026-03-28

מיליון רצפי משתמשים אמיתיים מפרסומות של טנסנט עם אותות חשיפה והקלקה. המאגר מציע וקטורים מולטי-מודאליים מוכנים בנפח כבד לצד נתונים טבלאיים מוצפנים למערכות המלצה.

  • 5,882הורדות בחודש
  • 22לייקים

מה זה

המאגר מבוסס על לוגים אמיתיים ומותממים של מערכת הפרסום בטנסנט עבור תחרות האלגוריתמים TAAC2025. הנתונים כוללים מיליון משתמשים עם היסטוריה של עד מאה פריטים לכל אחד, כאשר כל אינטראקציה מסומנת במפורש כחשיפה בלבד עם הערך אפס או כהקלקה עם הערך אחת. לצד הרצפים תמצאו מאגר של שש מאות אלף פריטים מועמדים, מאפייני פריטים ומאפייני משתמשים.

המבנה מחולק למספר תצורות נפרדות של קבצים. רצפי הפעולות בטבלת הרצפים כוללים מזהה פריט, סוג פעולה וחותמת זמן. טבלאות מאפייני הפריטים והמשתמשים מציגות עשרות שדות מספריים מוצפנים, ללא שמות עמודות בעלי משמעות עסקית גלויה. בנוסף ישנן שש תצורות שונות של שיכונים מולטי-מודאליים עבור טקסט ותמונה, שחולצו ממודלים מתקדמים ומגיעים בממדים שנעים בין שלושים ושניים ועד ארבעת אלפים תשעים ושש. המעבר בין המזהים המקוריים של השיכונים למזהים הממופים במודל מתבצע בעזרת קובץ מיפוי ייעודי.

מתאים ל

  • המלצה מבוססת רצפים

    אימון מודלים שמנבאים את ההקלקה הבאה על בסיס היסטוריית חשיפות ופעולות של עד מאה פריטים למשתמש.

  • שילוב שיכונים רב-ממדיים

    מחקר על שילוב וקטורים מולטי-מודאליים בגדלים שונים, משלושים ושניים ועד ארבעת אלפים ממדים, במערכות המלצה.

  • איחזור מועמדים לקמפיינים

    פיתוח שלבי סינון ראשוניים וחיפוש וקטורי מהיר באמצעות מזהי retrieval ייעודיים על מאגר של שש מאות אלף פריטים.

איפה זה נופל

הטקסט והתמונות המקוריים חסומים לחלוטין. במקומם מקבלים וקטורים מוכנים ומאפיינים מוצפנים תחת שמות מספריים, כך שאי אפשר לחקור את השפה, לאתר הטיות תוכן או לבדוק תאימות לעברית ולמוצרים מקומיים. מדובר בדאטהסט תחרותי שמבוסס כולו על פלטפורמת פרסום סינית, ולכן התפלגות החשיפות וההקלקות משקפת את הממשק והקהל של טנסנט בלבד, בלי יכולת להבין מה המשמעות של השדות הטבלאיים במציאות.

אותה משפחה

TencentGR יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא CC-BY 4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור למפרסמים וציון שינויים שנעשו.

כמה מקום בדיסק צריך כדי להוריד את כל הדאטהסט?

הנתונים הטבלאיים והרצפים שוקלים יחד קצת יותר מגיגה-בייט בודד. לעומת זאת, כל קובצי השיכונים המולטי-מודאליים דורשים מעל מאה ועשרים גיגה-בייט, כך שעדיף להוריד רק את ממדי הווקטורים הנחוצים.

האם יש בדאטהסט תמיכה בטקסט בעברית?

אין במאגר טקסט גלוי בכלל, לא בעברית ולא באף שפה אחרת. המאגר מציג רק מזהים מוצפנים ווקטורים מספריים שחולצו מראש מתוכן המודעות המקוריות בטנסנט.

מה מייחד אותו מדאטהסטים סטנדרטיים של מערכות המלצה?

הוא כולל מידע מפורש על חשיפות שלא הובילו להקלקה לצד הקלקות בפועל מתוך שירות פרסום אמיתי. בנוסף, הוא מספק וקטורים מולטי-מודאליים מובנים במספר רזולוציות במקום מזהי פריט בלבד.

איך טוענים

טוענים תצורות ספציפיות בעזרת ספריית datasets לפי שם ההגדרה, למשל candidate או seq. כל הקבצים שמורים בפורמט Parquet דחוס ב־Snappy, ללא צורך באישור גישה מיוחד. שימו לב לנפח האחסון, טבלאות המשתמשים והפריטים שוקלות כמה מאות מגה-בייט, אך תיקיות השיכונים המולטי-מודאליים מגיעות יחד ליותר ממאה ועשרים ג'יגה-בייט. תצטרכו להשתמש בקובץ indexer.pkl כדי לתרגם בין מזהי OID המקוריים מהשיכונים לבין מזהי RID שמופיעים ברצפי האימון.

from datasets import load_dataset

ds = load_dataset("TAAC2025/TencentGR-1M")

הרישיון

הרישיון הוא CC-BY 4.0 שמתיר שימוש מסחרי, שינוי והפצה של הנתונים, כל עוד אתם מעניקים ייחוס מתאים למפרסמים ומציינים שינויים שביצעתם. אין כאן חובת שיתוף באותו רישיון, כך שמודלים שאומנו על הנתונים אינם מחויבים להיפתח בקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗