GPT
T

TravelPlanner

קוד פתוח

osunlpcc-by-4.02024-01-11

מאגר לבדיקת סוכני שפה בתכנון מסלולי טיול מורכבים תחת אילוצים קשיחים. תרצו אותו כדי לבחון יכולות שימוש בכלים, עמידה בתקציב או שילוב תחבורה ומלונות.

  • 16,687הורדות בחודש
  • 86לייקים

מה זה

המאגר כולל 1,225 שאילתות שמאתגרות מודלים להרכיב תוכנית טיול מלאה, כולל טיסות, נסיעות, מסעדות, אטרקציות ולינה לכל יום. המטרה היא לבדוק תכנון מורכב ברמות קושי שונות, שנקבעות לפי כמות האילוצים המקומיים כמו סוגי חדרים, סגנון אוכל או כללי אירוח.

הרשומות מחולקות לשלושה חלקים ברורים. אימון מכיל 45 צמדים בלבד של שאילתות ותוכניות שנוצרו על ידי בני אדם, ומיועד להדגמות בהקשר. חלק האימות כולל 180 שאילתות ללא תוכניות פתורות, ומבחן מכיל 1,000 שאילתות שנועדו למנוע זיהום נתונים, ולכן כוללות רק את רמת הקושי, מספר הימים וטקסט השאילתה.

כל רשומה מכילה עיר מוצא ויעד, תאריך, מספר ימים ואנשים, ואת האילוצים הספציפיים. בנוסף יש קובצי מידע ייעוציים למצב תכנון בודד.

מתאים ל

  • הערכת סוכני שפה

    בדיקת יכולת המודל לייצר מסלול שעומד בכל האילוצים והימים.

  • בחינת שימוש בכלים

    מדידת הדיוק של סוכן כשהוא משלב טיסות, מלונות ואטרקציות.

  • דוגמאות לפרומפטים

    שימוש ב־45 התוכניות המאומתות לצורך למידה מהקשר.

איפה זה נופל

אם אתם בונים שירות שצריך לפעול בעברית, המאגר לא יעזור לכם ישירות כי כולו באנגלית. הוא מיועד להערכה ולא לאימון רחב, 45 דוגמאות פתורות לא יספיקו לכוונון עדין של מודל גדול. מעבר לזה, קובצי המבחן חסומים ומכילים רק חלק מהשדות כדי למנוע דליפות, ואין פירוט על מקור הנתונים הראשוני של המלונות או הטיסות.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון הוא cc-by-4.0 ומאפשר שימוש מסחרי חופשי. התנאי היחיד הוא מתן קרדיט ברור ליוצרים של המאגר לפי ההנחיות שלהם.

האם יש במאגר תמיכה בעברית או תוכניות בישראל?

לא. השפה המוגדרת במאגר היא אנגלית בלבד, וכל השאילתות כתובות באנגלית. אם תרצו לתמוך בעברית, תצטרכו לתרגם את השאילתות והאילוצים בעצמכם.

האם המאגר מתאים לאימון מודל מאפס או לכוונון עדין?

הוא לא מתאים לאימון רחב. יש בו רק 45 דוגמאות פתורות עם תוכנית מלאה בחלק האימון, והוא נבנה כבנצ'מרק להערכת ביצועים של סוכנים ולא כמאגר אימון ענק.

איך טוענים

אין כאן תהליך אישור מיוחד, מורידים ישירות דרך הספרייה הרגילה או מורידים את קובצי ה־CSV וה־JSONL מהמאגר. יש תשעה קבצים בסך הכל. כדאי לשים לב שרוב הנתונים מרוכזים בטבלאות כמו train.csv ו־test.csv לצד קובצי מידע נלווים, ושדות המפתח הם השאילתה, רמת הקושי והאילוצים המקומיים.

from datasets import load_dataset

ds = load_dataset("osunlp/TravelPlanner")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו ולשלב אותו במערכות שלכם, כל עוד אתם נותנים קרדיט מתאים ליוצרים מאוניברסיטת אוהיו סטייט ומציינים שינויים אם נעשו.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗