GPT
I

ifstruct-v1.0

קוד פתוח

LiquidAIapache-2.02026-06-24

  • structured-output
  • json
  • yaml
  • instruction-following
  • schema-following

המאגר מכיל אלפיים הנחיות לבדיקת היכולת של מודל לייצר פלט במבנה תקין של ג'ייסון או יאמל לפי סכמה מוגדרת. הוא בוחן עמידה בכללי תחביר נוקשים ללא מנגנוני אכיפה חיצוניים.

  • 465הורדות בחודש
  • 76לייקים

מה זה

מדובר בסט מבחן ציבורי שכולל אלפיים רשומות, ללא תשובות מוכנות מראש. כל רשומה כוללת הנחיה למודל ולצידה את מפרט הבדיקה המלא, כולל סכמת היעד, הפורמט המבוקש בין ג'ייסון ליאמל, כמות הפריטים הנדרשת, והגדרות לגבי עטיפה במפתח עליון, שימוש בבלוק קוד ואיסור על טקסט חופשי סביב המידע.

הסכמות נדגמו מתוך טקסונומיות מוגדרות והוצגו במגוון סגנונות, כמו בקשות צ'אט טבעיות, סכמות גולמיות, טבלאות ושדות מוערים. כמחצית מההנחיות נוסחו מחדש על ידי מודל שפה כדי לחקות ניסוח אנושי לא מהוקצע, כולל שינוי דרישות תוך כדי כתיבה. חלק מהמקרים כוללים בכוונה תווים מיוחדים ומחרוזות מורכבות שמאתגרות מנגנוני בריחה של תווים בפורמטים מובנים.

מתאים ל

  • הערכת עמידה בסכמות

    בדיקת היכולת של מודלים להחזיר מבנה נתונים תקין בפורמט מבוקש ללא שימוש בכלים לאכיפת פלט.

  • תגמול באימון מודלים

    שימוש בבודק האוטומטי כחלק מתהליך למידה מחיזוקים לצורך שיפור עמידה בהוראות מבניות.

  • בדיקת חסינות תווים

    מדידת יכולת המודל להתמודד עם מירכאות, נתיבי קבצים וקטעי קוד בתוך ערכי מחרוזת מובנים.

איפה זה נופל

הבדיקה כאן בוחנת אך ורק את המבנה והתחביר, ולא מעריכה איכות תוכן, נכונות עובדתית או יכולת הסקה. מודל שימציא מתכון מופרך או טקסט חסר פשר יעבור את המבחן בהצלחה, כל עוד הוא עומד במדויק בשדות ובמגבלות הסכמה. הדאטהסט בנוי כולו באנגלית, ולכן אינו מספק מידע על היכולת של המודל לעמוד במבנים מורכבים סביב טקסט בעברית או שפות אחרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מסחרי?

כן, רישיון אפאצ'י שתיים אפס מתיר שימוש מסחרי מלא ללא הגבלה כזו. עליכם רק לשמור על תנאי הייחוס ועותק הרישיון המקורי של ליקוויד איי איי.

האם הדאטהסט כולל שאלות או דרישות בעברית?

לא, כל ההנחיות והטקסונומיות במאגר מנוסחות באנגלית בלבד. אם המוצר שלכם מיועד לעבד קלטים בעברית או להחזיר ערכים בעברית בתוך הסכמה, תצטרכו לבצע בדיקות ייעודיות בנפרד.

איפה נמצאות התשובות הנכונות של המבחן?

המאגר אינו מכיל תשובות מוכנות להשוואה. כל רשומה מספקת את מפרט הבדיקה המלא, והתשובה של המודל שלכם נבדקת בזמן ריצה באמצעות קוד הבדיקה הייעודי של הפרויקט.

איך נוצרו הפניות למודל?

הסכמות נדגמו מטקסונומיות מובנות והולבשו על סגנונות פנייה שונים. כמחצית מהן עברו שכתוב על ידי מודל שפה כדי לדמות ניסוחים אנושיים מחוספסים ולא סכמה נקייה.

איך טוענים

טוענים את הנתונים דרך ספריית הדאטהסטס הרגילה של פייתון ישירות מהמאגר, עם חלוקת המבחן test. אין צורך לבקש אישור גישה מיוחד, והקבצים כוללים קובץ פארקט בודד שנפחו קטן מאוד. השדות json_schema ו־top_level_count מגיעים כמחרוזות מקודדות, ולכן חובה להמיר אותן באמצעות פונקציית הטעינה של ספריית ג'ייסון לפני שמתחילים להריץ את הבדיקות מול המודל שלכם.

from datasets import load_dataset

ds = load_dataset("LiquidAI/ifstruct-v1.0")

הרישיון

המאגר מופץ תחת רישיון אפאצ'י שתיים אפס. הרישיון מאפשר שימוש מסחרי, שינוי והפצה של המידע, ומחייב מתן ייחוס למפתחים וצירוף עותק מהרישיון. הוא אינו כופה רישיון זהה על תוצרים נגזרים או על מודלים שהוערכו ואומנו על גביו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗