GPT
S

spider

קוד פתוח

xlangaicc-by-sa-4.02022-03-02

  • text-to-sql

מאגר לאימון מודלים של Text-to-SQL על פני מסדי נתונים מגוונים. הוא כולל שאלות בשפה טבעית מול שאילתות תואמות, ומתאים למי שבונה ממשק שיחה לבסיסי נתונים.

  • 14,268הורדות בחודש
  • 178לייקים

מה זה

המאגר מכיל זוגות של שאלות באנגלית ושאילתות SQL מורכבות, שמיועדות לעבודה מול סכמות שונות של בסיסי נתונים. המטרה שלו היא לאפשר פירוש סמנטי שאינו מוגבל לתחום יחיד. 11 סטודנטים מאוניברסיטת ייל תייגו וכתבו את הנתונים, אך הכרטיס אינו מפרט מעבר לכך על מקורות המידע הגולמיים או על שיטות הסינון.

מבחינת חלוקה, יש כאן שני חלקים מוגדרים: סט אימון הכולל 7,000 זוגות של שאלות ושאילתות, וסט בדיקה הכולל 1,034 זוגות כאלה. כל רשומה כוללת את מזהה בסיס הנתונים המתאים, את השאלה המקורית, שאילתת היעד, וייצוגים מפורקים לטוקנים של שני הצדדים, כולל גרסה של השאילתה ללא ערכים ספציפיים.

מתאים ל

  • אימון מודלי Text-to-SQL

    לימוד מודלים לתרגם שאלות מילוליות לשאילתות SQL מורכבות על בסיסי נתונים שונים.

  • הערכת ביצועי שאילתות

    בדיקת הדיוק של מודלים קיימים מול סט בדיקה שכולל מעל אלף דוגמאות מגוונות.

  • מחקר בפירוש סמנטי

    ניתוח יכולת ההכללה של מודלי שפה על סכמות משתנות וטבלאות שאינן מוכרות מראש.

איפה זה נופל

הנתונים כולם באנגלית בלבד, כך שאם המטרה היא מערכת בעברית, המאגר הזה ידרוש תרגום מסיבי או התאמות ולא יעבוד ישר מהקופסה. הכרטיס הרשמי דל מאוד ולא חושף הטיות מוכרות, הגבלות פרטיות או מידע על איסוף הנתונים המקורי. בנוסף, מדובר בדאטהסט שנבנה סביב תיוג של סטודנטים בודדים, כך שיש לוודא שהשאילתות משקפות את מורכבות ה־SQL שנחוצה לכם בפועל ולא רק ניסוחים אקדמיים.

שאלות
נפוצות

האם המאגר תומך בעברית?

לא. כל השאלות והטקסטים במאגר נכתבו באנגלית בלבד. אם המוצר שלכם פונה למשתמשים בעברית, תצטרכו לתרגם את השאלות או לאמן על מידע מקומי נוסף.

האם מותר להשתמש בו לצרכים מסחריים?

רישיון CC BY-SA 4.0 מתיר שימוש מסחרי, אך כולל דרישת שיתוף זהה. אם יצרתם נגזרת של הנתונים, תצטרכו להפיץ אותה תחת אותו הרישיון, ויש לבחון היטב את ההשפעה על המודל המאומן.

מי יצר את הנתונים ומאיפה הם הגיעו?

הנתונים תוייגו ונבנו על ידי 11 סטודנטים מאוניברסיטת ייל. כרטיס המאגר לא מפרט מעבר לכך לגבי המקורות שמהם נלקחו בסיסי הנתונים המקוריים.

איזה סדר גודל של נתונים יש כאן?

מדובר במאגר קטן יחסית של כ־8,000 רשומות בסך הכל, מתוכן 7,000 לאימון ו־1,034 לאימות. הקבצים שמורים בפורמט parquet וניתנים לטעינה מהירה.

איך טוענים

הנתונים שמורים בקובצי parquet סטנדרטיים, בחלוקה לתיקיית train ואימות. אין צורך בבקשת גישה מיוחדת, המאגר פתוח להורדה ישירה. בעבודה מול הרשומות, השדות המרכזיים שמעניינים אתכם הם db_id כדי לדעת לאיזו סכמה מתייחסים, question שכולל את הטקסט החופשי, ו־query שמכיל את שאילתת ה־SQL המלאה. אם אתם עובדים על שלב הטוקניזציה בעצמכם, השדות של הטוקנים המוכנים עשויים לחסוך עבודה.

from datasets import load_dataset

ds = load_dataset("xlangai/spider")

הרישיון

המאגר מופץ תחת רישיון CC BY-SA 4.0. הרישיון מתיר שימוש מסחרי, אך הוא מחייב מתן קרדיט מתאים, והחשוב מכל, שיתוף זהה. כלומר, אם אתם משנים את המאגר או בונים עליו נגזרת, עליכם לשחרר אותה תחת אותו הרישיון בדיוק. כדאי לבדוק היטב עם ייעוץ משפטי כיצד חובת השיתוף הזו חלה על משקלי מודל שאומנו עליו לפני שמשלבים אותו במוצר סגור.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗