GPT
T

TransitLM

קוד פתוח

GD-MLcc-by-nc-4.02026-05-03

  • transportation
  • route-planning
  • public-transit
  • mobility
  • instruction-tuning

מאגר מסלולי תחבורה ציבורית בערים מרכזיות בסין, שנועד לאימון והערכה של מודלי שפה לתכנון נסיעות. הוא כולל נתוני קואורדינטות, רצפי תחנות, קווי מעבר וזמני הגעה.

  • 822הורדות בחודש
  • 82לייקים

מה זה

המאגר מציג בקשות תכנון נסיעה מנקודת מוצא ליעד בארבע ערים בסין: בייג'ינג, שנגחאי, שנג'ן וצ'נגדו. הנתונים מתחלקים לשני עולמות מקבילים. החלק הראשון מכיל קורפוס אימון מקדים של 13.9 מיליון רשומות וקורפוס כוונון עדין של 90 אלף דוגמאות אימון ועוד 30 אלף דוגמאות בדיקה. בכל נתוני האימון האלה שמות התחנות הוסרו והוחלפו במזהים מספריים, והקואורדינטות עברו שיבוש מכוון של עד מאה מטרים כדי למנוע שימוש מסחרי לא מורשה וזיהוי משתמשים.

החלק השני כולל מבחן ביצועים נפרד של 30 אלף דוגמאות לבדיקת מודלים כלליים. במבחן הזה מופיעים שמות תחנות אמיתיים וקואורדינטות מדויקות, לצד מידע מלא על מרחקים, תעריפים וזמני נסיעה. בנוסף מצורפים קובצי עזר של מזהי תחנות, רשימת תחנות סמוכות וטבלאות מיפוי סטטיות.

מתאים ל

  • אימון מודל לתכנון נתיבים

    אימון מקדים של מודלי שפה על רשתות תחבורה עירוניות גדולות ופתרון בעיות מעבר בין קווים.

  • בדיקת יכולת ניווט טקסטואלית

    הערכת מודלים כלליים על 30 אלף שאילתות אמת עם שמות תחנות וקואורדינטות מדויקות בסין.

  • מחקר אנונימיזציה מרחבית

    בחינת השפעת שיבוש קואורדינטות והסרת שמות תחנות על איכות הפלט של מודלי שפה.

איפה זה נופל

המאגר כולו בסינית ומוגבל לארבע ערים בלבד בסין. הוא לא יעזור לתכנון תחבורה בישראל או בכל אזור אחר בעולם. נתוני האימון מכילים תחנות מוסוות וקואורדינטות משובשות, כך שמודל שמאומן עליהם לומד טופולוגיה ולא שמות אמיתיים. בנוסף, הנתונים מתבססים על יום דגימה בודד ללא חותמות זמן, ולכן אין בהם שונות לפי ימי השבוע, שעות עומס או שינויים עונתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

לא. הרישיון הוא רישיון לא מסחרי בלבד. כל שימוש בנתונים או במודלים שאומנו עליהם חייב להישאר במסגרת מחקרית.

האם יש במאגר תמיכה בעברית או באנגלית?

אין שום תמיכה בעברית או באנגלית. הטקסט, שמות התחנות, השאילתות והקווים כתובים כולם בסינית.

למה חלק מהנתונים מכילים מזהים במקום שמות תחנות?

החוקרים שיבשו את הקואורדינטות והחליפו שמות תחנות במזהים בקורפוס האימון כדי להגן על פרטיות מסלולי המשתמשים ולמנוע שאיבה מסחרית. נתוני האמת המלאים קיימים רק במבחן הביצועים המיועד להשוואת מודלים.

האם המאגר מתאים לחיזוי זמני נסיעה בזמן אמת?

לא. הנתונים מגיעים מדגימה של יום בודד ללא חותמות זמן וללא מידע על עומסים שמשתנים לאורך היום. המטרה כאן היא הבנת מבנה המסלול והרצף, לא חיזוי דינמי בזמן אמת.

איך טוענים

המאגר מחולק ל־133 קבצים, רובם בפורמט CSV לצד קובץ JSON למזהי התחנות. חלקי האימון המקדים מפוצלים לעשרות קבצי משנה תחת תיקיית קורפוס ייעודית. אין צורך בבקשת גישה מיוחדת להורדה. בריצת העבודה תשתמשו בעיקר בעמודות ההנחיות והתוויות בטבלאות הכוונון העדין, שמכילות מילוני JSON פנימיים עם שאילתת המשתמש, קואורדינטות המוצא והיעד, ורצף התחנות והקווים המלא.

from datasets import load_dataset

ds = load_dataset("GD-ML/TransitLM")

הרישיון

הרישיון הוא CC BY-NC 4.0. המשמעות ברורה וחד משמעית: השימוש מותר אך ורק למחקר ולמטרות לא מסחריות, תוך מתן קרדיט מתאים. אי אפשר לקחת את הנתונים, ולא מודל שאומן עליהם ישירות, ולשלב אותם במוצר מסחרי או בשירות בתשלום.

  • שינוי הקוד
  • חובת ייחוס
  • שימוש מסחרי: לא

הרישיון המלא ב־Hugging Face ↗