GPT
W

wikisql

קוד פתוח

Salesforceunknown2022-03-02

  • text-to-sql

תרגום שאלות באנגלית לשאילתות SQL מול טבלאות מבוססות ויקיפדיה. מתאים בעיקר לאימון והערכה של מודלים לממשקי שיחה עם מסדי נתונים פשוטים.

  • 2,104הורדות בחודש
  • 125לייקים

מה זה

המאגר מכיל 80,654 דוגמאות מתויגות ידנית של שאלות בשפה טבעית לצד שאילתות SQL תואמות. כל הדוגמאות מבוססות על 24,241 טבלאות שנלקחו מתוך ויקיפדיה באנגלית. כל רשומה כוללת שאלה, את מבנה הטבלה עם שמות העמודות והשורות, וייצוג מפורט של השאילתה הן בפורמט מובנה והן כמחרוזת טקסט קריאה.

הנתונים מחולקים לשלושה חלקים ברורים. יש 56,355 רשומות בחלק האימון, 8,421 רשומות בערכת האימות, ו־15,878 רשומות המיועדות לבדיקה סופית. מעבר לטבלאות עצמן, המאגר שומר מידע נוסף כמו כותרת הדף המקורי, כותרת המקטע וסוגי הנתונים של העמודות. הכרטיס המקורי לא מפרט כיצד סוננו הטבלאות בפועל או מי ביצע את התיוג, אך מציין שהמידע נאסף במיקור המונים עבור מאמר המחקר המקורי.

מתאים ל

  • המרת שפה לשאילתות

    אימון מודלים שמקבלים שאלה באנגלית ומייצרים ממנה פקודת SQL לטבלה בודדת.

  • הערכת ביצועי מודלים

    בדיקת הדיוק של מודלי שפה על סט נתונים תקני של מעל 15 אלף דוגמאות בחינה.

  • מחקר ממשקי נתונים

    פיתוח אלגוריתמים לחיבור בין שפה טבעית למבני נתונים טבלאיים פשוטים.

איפה זה נופל

הנתונים כולם באנגלית ומבוססים על טבלאות ויקיפדיה, כך שאין כאן תמיכה בעברית או במבנים מורכבים של מסדי נתונים עסקיים. השאילתות פשוטות יחסית ופועלות מול טבלה בודדת, בלי חיבורי טבלאות מורכבים או פקודות SQL מתקדמות. כרטיס המידע לא כולל פרטים על הטיות, סינון שגיאות או מידע אישי, ולכן לא מומלץ להסתמך עליו כמייצג יחיד לבניית מוצר אמיתי.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

הרישיון המדווח במאגר אינו ידוע, ולכן אין אישור מפורש לעשות בו שימוש מסחרי. במצב כזה, שימוש בנתונים או הפצת מודל שאומן עליהם עלולים לחשוף אתכם לסיכונים משפטיים. מומלץ לבדוק את הרישיון במאגר הגיטהאב המקורי לפני שמשלבים אותו בפיתוח מוצר.

כמה מקום בדיסק המאגר דורש?

קובץ ההורדה הראשוני שוקל 26.16 מגה בייט בלבד. לאחר החילוץ והיצירה של הנתונים, המאגר תופס 154.74 מגה בייט. בסך הכל נדרשים כ־180.9 מגה בייט של שטח אחסון פנוי בדיסק כדי לעבוד איתו.

האם יש תמיכה בשפה העברית?

המאגר כולו נבנה על בסיס טקסטים באנגלית בלבד. השאלות נוסחו באנגלית, והטבלאות נלקחו מתוך הוויקיפדיה האנגלית. כדי לעבוד בעברית תצטרכו לתרגם את הנתונים באופן עצמאי או לחפש מקורות נתונים אחרים.

מאיפה הגיעו הנתונים ואיך אספו אותם?

הטבלאות נשלפו מתוך עמודים שונים בוויקיפדיה, והתיוגים של השאלות והשאילתות נעשו במיקור המונים. כל שאלה הוצמדה לשאילתת SQL מותאמת אישית מול הטבלה הספציפית שלה. כרטיס הדאטהסט אינו מפרט את הליך הסינון המדויק או את זהות המתייגים.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה, באמצעות הסקריפט wikisql.py שמגיע במאגר. קובץ ההורדה שוקל 26.16 מגה בייט, ובדיסק הוא תופס כ־181 מגה בייט בסך הכל. אין צורך באישור גישה מיוחד. השדות המרכזיים לעבודה הם question שמכיל את השאלה, sql שמחזיק את השאילתה בפורמט קריא ומובנה, והטבלה שמכילה את שמות העמודות והשורות הרלוונטיות.

from datasets import load_dataset

ds = load_dataset("Salesforce/wikisql")

הרישיון

הרישיון הרשום בעמוד המאגר מוגדר כלא ידוע. המשמעות היא שאין הרשאה ברורה להשתמש בו לצרכים מסחריים או לשלב אותו במוצר ללא בדיקה מעמיקה של תנאי השימוש במאגר המקורי. מי שמאמן עליו מודל למטרות מסחריות לוקח סיכון משפטי, ועדיף להגביל את השימוש בו למחקר והערכה בלבד.

הרישיון המלא ב־Hugging Face ↗