GPT
S

synthetic_text_to_sql

קוד פתוח

gretelaiapache-2.02024-03-21

  • synthetic
  • SQL
  • text-to-SQL
  • code
  • datadesigner

מעל 105 אלף זוגות סינתטיים של שאלות ושאילתות SQL ברמות מורכבות שונות. הוא מציע סכמות בסיס נתונים מלאות והסברים מילוליים שמקלים על אימון מודלים לתחקור נתונים.

  • 2,853הורדות בחודש
  • 695לייקים

מה זה

כל רשומה במאגר כוללת שאילתה באנגלית, הקשר מלא של בסיס הנתונים כמו פקודות יצירת טבלאות ותצוגות, קוד ה־SQL המתאים והסבר מילולי על פעולת השאילתה. הנתונים מחולקים ל־11 שדות שונים ומכסים כ־100 תחומים עסקיים שונים, עם מגוון רחב של משימות הכוללות שליפה, הגדרת נתונים, אגרגציות, חלונות ואיחודים. סך הכל יש כאן כ־23 מיליון טוקנים, מתוכם כ־12 מיליון טוקנים של קוד SQL.

התוכן כולו נוצר באופן סינתטי באמצעות הכלי Gretel Navigator ולא נאסף מבסיסי נתונים חיים בארגונים. כדי להבטיח איכות, Gretel העבירו את השאילתות אימות תחבירי באמצעות ספריות הפארסינג sqlglot ו־sqlvalidator, ובדקו מדגם של אלף רשומות בעזרת GPT-4 כשופט מול מאגר Spider הוותיק. החלוקה הפנימית מפרידה מראש 100,000 רשומות לאימון ו־5,851 רשומות לבדיקה.

מתאים ל

  • אימון מודלי Text-to-SQL

    כיוונון מודלי שפה להמרת שאלות עסקיות לשאילתות SQL תקינות על בסיס סכמות טבלאות קיימות.

  • הסבר שאילתות קיימות

    שימוש בזוגות השאילתות וההסברים כדי ללמד מודל לתאר למשתמש מה קוד מסובך מבצע בפועל.

  • בדיקת איכות למודלי קוד

    הערכת היכולת של מודל קיים להתמודד עם שאילתות מורכבות כמו פונקציות חלון ואיחודים באמצעות סט הבדיקה המובנה.

איפה זה נופל

המאגר כולו סינתטי, מה שאומר שהוא עלול לפספס הרגלי כתיבה מרושלים ושאילתות עקומות של משתמשים אמיתיים. הטקסט כולו באנגלית בלבד, כך שאם המערכת שלכם צריכה להבין שאלות בעברית, תצטרכו לתרגם את הפרומפטים או לאמן שכבה נוספת. בנוסף, למרות בדיקות התקינות האוטומטיות, מודלים שופטים יכולים לאשר שאילתות שנראות נכונות מבחינה תחבירית אך מחזירות תוצאה לא יעילה על נפחי מידע אמיתיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, רישיון Apache 2.0 מאפשר שימוש מסחרי ללא תשלום תמלוגים. אתם יכולים לאמן עליו מודלים פנימיים או מודלים שנמכרים ללקוחות, בתנאי שאתם שומרים על תנאי הייחוס של הרישיון המקורי.

האם הדאטהסט תומך בעברית?

לא. כל הפרומפטים, הסכמות וההסברים כתובים באנגלית בלבד. כדי להשתמש בו למוצר ישראלי שמקבל שאלות בעברית, תצטרכו לתרגם את נתוני האימון.

איך המאגר הזה שונה מ־Spider או מ־sql-create-context?

הוא גדול יותר ומכיל מעל 105 אלף דוגמאות שנוצרו כולן על ידי בינה מלאכותית, להבדיל מאיסוף ידני. בנוסף לזוג השאילתה והקוד, הוא כולל מראש את פקודות יצירת הטבלאות והסבר טקסטואלי שמפרט מה השאילתה מנסה להשיג.

איך טוענים

טוענים את הקבצים ישירות מספריות Parquet דחוסות בפורמט snappy, ללא צורך באישור גישה או הרשמה מיוחדת מול Hugging Face. השדות המרכזיים לעבודה הם הוראת הטקסט הטבעית, שדה הסכמה שמכיל את פקודות היצירה, וה־SQL עצמו. מי שרוצה לכוונן מודלים מתקדמים יכול להשתמש גם בשדה ההסברים ובשדות התגיות שהוצמדו לרשומות.

from datasets import load_dataset

ds = load_dataset("gretelai/synthetic_text_to_sql")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון מתיר שימוש מסחרי מלא, שינוי של הנתונים ושילוב שלהם במוצרים סגורים. אתם נדרשים לשמור על הקרדיט והודעת הרישיון המקורית. מודלים שתאמנו על הדאטהסט הזה אינם מחויבים להיפתח בקוד פתוח.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗