GPT
S

sql-create-context

קוד פתוח

b-mc2cc-by-4.02023-04-21

  • SQL
  • code
  • NLP
  • text-to-sql
  • context-sql

המאגר מחבר שאילתות באנגלית לפקודות יצירת טבלה, כדי ללמד מודלים לכתוב קוד שלא ממציא שדות. הוא מיועד למי שבונה מודל בסיס או התאמה להמרת שפה טבעית לשאילתות בלי לחשוף שורות אמיתיות.

  • 9,690הורדות בחודש
  • 506לייקים

מה זה

הנתונים נשענים על חיבור ועיבוד מחדש של שני מאגרים קיימים, WikiSQL ו־Spider. המטרה כאן היא לפתור בעיה ידועה של הזיות בשמות עמודות וטבלאות, ולכן כל רשומה מציגה את הסכמה המלאה דרך משפט יצירה כהקשר מקדים.

יש כאן 78,577 דוגמאות שכוללות שאלה, הקשר בדמות פקודת יצירת טבלה, והשאילתה המתאימה. המחבר השתמש בספריית SQLGlot כדי לפרק את השאילתות המקוריות, לזהות טבלאות ולנחש את סוגי הנתונים לפי שימוש באופרטורים כמו גדול וקטן או פונקציות צבירה. עמודה שלא זוהתה קיבלה ברירת מחדל של מחרוזת, ושאילתות ללא שמות מוגדרים עברו שינוי לשמות גנריים ממוספרים או שנוסף להן מזהה.

מתאים ל

  • אימון מודלי שפה לשאילתות

    מלמד מודל לחבר שאילתות על בסיס סכמה נתונה בלי להמציא שמות של עמודות.

  • הערכת ביצועי של מודל קיים

    בדיקת הדיוק של מודל בהבנת הקשר של סכמת נתונים ותרגומה לפקודת שליפה.

  • יצירת פרומפטים מבוססי סכמה

    חילוץ דוגמאות להקשר של פקודות יצירת טבלה לצורך מתן דוגמאות בזמן אמת.

איפה זה נופל

ההסקה של סוגי הנתונים חלקית בלבד. היוצר מודה שחלק מסוגי העמודות הוגדרו כמחרוזות כברירת מחדל, וקיימים מקרים של מספרים שהפכו למחרוזות או מספרים שמשמשים כשמות עמודות. בנוסף, כל השאלות וההקשרים כתובים באנגלית בלבד. המאגר נשען כולו על תחביר כללי אחד בלי תמיכה בדיאלקטים ספציפיים של מנועי בסיסי נתונים, וללא הקשרים רחבים יותר מעבר להגדרת הטבלה הבסיסית.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא CC-BY-4.0, שמאפשר שימוש מסחרי מלא ואימון מודלים לצרכים עסקיים. החובה היחידה היא מתן קרדיט ברור למחבר ולמקורות הנתונים שעליהם הוא הסתמך. המודל שאתם מאמנים לא מחויב להיפתח ברישיון זהה.

האם המאגר כולל שאילתות או שאלות בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד, וכל 78,577 הדוגמאות נשענות על שאלות באנגלית מתוך Spider ו־WikiSQL. אם המטרה היא עבודה עם שאלות בעברית, תצטרכו לתרגם את השאלות או לאסוף דוגמאות מקומיות.

מאיפה הנתונים הגיעו ואיך הם נבנו?

המאגר מבוסס על שילוב של המאגרים Spider ו־WikiSQL. היוצר עיבד את השאילתות באמצעות ספריית SQLGlot, זיהה את הטבלאות והעמודות, ובנה מתוכן פקודות יצירת טבלה כדי לספק הקשר מלא לכל שאלה. סוגי הנתונים נוחשו לפי פעולות כמו גדול, קטן ופונקציות ממוצע או סיכום.

מה ההבדל בין המאגר הזה ל־Spider המקורי?

המאגר המקורי סיפק מבנה רחב יותר של בסיסי נתונים, בעוד שהעיבוד הזה מצמצם את ההקשר לפקודת יצירת טבלה בלבד. המטרה בשינוי היא לאפשר אימון מודלים ממוקדים שמתבססים על הגדרת סכמה סטנדרטית, תוך חיסכון במספר האסימונים ומניעת חשיפה של שורות נתונים אמיתיות.

איך טוענים

טוענים את המאגר ישירות מתוך Hugging Face לפי המזהה b-mc2/sql-create-context. הגישה פתוחה ואינה דורשת אישור מוקדם או מפתח פרטי. הקובץ המרכזי שמכיל את הדגימות שמור בפורמט JSON בשם sql_create_context_v4.json, לצד קובץ התיעוד. בכל רשומה יש שלושה מפתחות טקסט בלבד שצריך למפות בעת האימון: question עבור שאלת המשתמש, context עבור פקודת ה־CREATE TABLE, ו־answer עבור שאילתת היעד.

from datasets import load_dataset

ds = load_dataset("b-mc2/sql-create-context")

הרישיון

הרישיון המדווח הוא רישיון חופשי מסוג CC-BY-4.0. הרישיון מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב שיתוף באותו רישיון עבור המודל שאימנתם. הדרישה המשפטית היחידה היא מתן קרדיט וייחוס נאות ליוצר המאגר ולמקורות שעליהם הוא מבוסס.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗