GPT
I

IntTravel_dataset

קוד פתוח

GD-MLרישיון לא דווח2026-02-11

  • recommendation-system
  • poi-recommendation
  • mobility
  • travel

מאגר ענק של מסלולי נסיעה עירוניים עם 4.1 מיליארד אינטראקציות של משתמשים אמיתיים. הוא מיועד למי שרוצה לאמן מודלי המלצה למסלולים, תחבורה ונקודות עניין בקנה מידה עצום.

  • 3,312הורדות בחודש
  • 90לייקים

מה זה

הנתונים מתעדים התנהגות נסיעה מלאה של משתמשים בכמה ערים מרכזיות בסין. המאגר מורכב משלושה חלקים עיקריים: מידע על כ־7.3 מיליון נקודות עניין, פרופילים אנונימיים של כמעט 163 מיליון משתמשים, ולמעלה מארבעה מיליארד אירועי אינטראקציה.

קובצי נקודות העניין מכילים מזהה, ציון פופולריות מנורמל בין אפס לאחד, שיוך גיאוגרפי, קטגוריית יעד ומחוז מנהלי. בטבלת המשתמשים יש מזהה ייחודי ושישה מאפייני פרופיל ממוספרים. קובצי האינטראקציה מתעדים פעולות משתמש עם חותמת זמן במילישניות, אופן התחבורה, מזג אוויר, נקודת עניין בדרך ומיקום גיאוגרפי.

כל המידע מבוסס על ערכים מספריים מקודדים. הכרטיס אינו מפרט תהליכי סינון מיוחדים או טקסטים גולמיים, ומחלק את נתוני האינטראקציות למאה קבצים נפרדים לצורך פיזור הנפח.

מתאים ל

  • מערכות המלצה לנסיעות

    אימון מודלים שממליצים על יעדי ביניים, זמני יציאה ונקודות עניין לאורך מסלול המשתמש.

  • חיזוי אופן תחבורה

    למידת הקשר בין מזג אוויר, שעת הפעילות וסוג היעד לבין בחירת כלי התחבורה של הנוסע.

  • דגימה שלילית גיאוגרפית

    בניית אלגוריתמים מבוססי קרבה מרחבית בעזרת קובץ החלוקה לגושים גיאוגרפיים.

איפה זה נופל

היוצרים מזהירים מראש שקואורדינטות המיקום של נקודות העניין עדיין אינן כלולות בקובץ הנוכחי, מה שמגביל מודלים שדורשים מיקום מדויק על מפה. בנוסף, כל המאגר מקודד במספרים ללא שמות, טקסט חופשי, קואורדינטות אמיתיות או שפה, כולל עברית. כל הנתונים מגיעים מערים בסין, כך שדפוסי התחבורה וההתנהגות תלויי אזור גיאוגרפי ספציפי ולא בהכרח רלוונטיים לישראל.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הכרטיס לא מציין רישיון שימוש כלל. ללא רישיון מוגדר, אין היתר חוקי לשימוש מסחרי או לשימוש בתוצרי המודל. מומלץ להמתין להסדרה או לפנות ישירות לצוות המחקר.

האם הנתונים כוללים עברית או טקסט כלשהו?

לא, אין במאגר טקסט כלל. כל הנתונים, כולל קטגוריות, מזג אוויר, פעולות ומאפייני משתמש, מיוצגים באמצעות מזהים מספריים מקודדים בלבד.

האם יש במאגר קואורדינטות מדויקות של המקומות?

נכון לעכשיו לא. היוצרים ציינו במפורש שקובץ נקודות העניין הועלה ללא נתוני הקואורדינטות וכי הם מתכננים לעדכן זאת בעתיד.

מה הגודל של המאגר ואיך הוא בנוי?

המאגר מכיל מעל 4.1 מיליארד שורות אינטראקציה המחולקות למאה קובצי סי אס וי, ועוד קבצים ייעודיים לפרטי נקודות העניין והמשתמשים. מדובר בהיקף גדול מאוד שמחייב סביבת עבודה מתאימה לנתוני עתק.

איך טוענים

המאגר ציבורי ואינו דורש אישור גישה מראש. הוא כולל 104 קבצים, כאשר האינטראקציות מפוצלות לפורמט סי אס וי במאה קבצים שמכילים כ־40 מיליון שורות כל אחד. תצטרכו תשתית אחסון ועיבוד מתאימה לעבודה עם מיליארדי שורות. קובצי הנתונים המרכזיים לטעינה הם טבלאות האינטראקציה, קובץ נקודות העניין poi_info.csv וקובץ הפרופילים user_info.csv. המפתחות המקשרים הם מזהי המשתמשים ונקודות העניין.

from datasets import load_dataset

ds = load_dataset("GD-ML/IntTravel_dataset")

הרישיון

היוצרים לא ציינו רישיון שימוש במאגר. מבחינה משפטית, היעדר רישיון אומר שכל הזכויות שמורות ואין אישור מפורש לשימוש מסחרי או לאימון מודלים להפצה חיצונית. לא הייתי בונה עליו מוצר מסחרי לפני פנייה ישירה למחברים או עדכון תנאי השימוש.

הרישיון המלא ב־Hugging Face ↗