GPT
F

folio

קוד פתוח

tasksourcecc2023-02-21

מאגר שמכוון לבדיקת יכולות הסקת מסקנות בשפה טבעית מבוססת לוגיקה מסדר ראשון. הוא נועד למי שרוצה לאמן או להעריך מודל על סיווג טקסט והסקה לוגית מובנית.

  • 7,788הורדות בחודש
  • 19לייקים

מה זה

הנתונים במאגר מיועדים למשימת סיווג טקסט בתחום של הסקה לוגית מסדר ראשון. המאגר מקושר למחקר של מעבדת LILY מאוניברסיטת ייל ומכיל קבצים בפורמט jsonl שמחולקים מראש לסט אימון ולסט וולידציה, תחת השמות folio v2 train ו־folio v2 validation.

כרטיס הנתונים עצמו לא מפרט את תוכן השדות המדויק, את מספר הדוגמאות המלא או את הדרך שבה נאספו וסוננו המשפטים במקור. כל המידע המתודולוגי המלא נמצא במאמר המדעי שפורסם ב־arXiv ובמאגר הגיטהאב המקושר, כך שמי שרוצה להבין את מבנה ההיסקים וההנחות צריך לגשת למקורות הללו ישירות.

מתאים ל

  • הערכת הסקה לוגית

    בדיקת היכולת של מודלי שפה להגיע למסקנה נכונה על בסיס הנחות מוגדרות בלוגיקה מסדר ראשון.

  • אימון מסווגי טקסט

    כוונון עדין של מודלים למשימות של סיווג טקסט המבוסס על קשרים לוגיים בין משפטים באנגלית.

  • מחקר אקדמי בלוגיקה

    השוואת ביצועים בין ארכיטקטורות שונות מול סט המבחן של המחקר המקורי מאוניברסיטת ייל.

איפה זה נופל

המאגר כולל נתונים בשפה האנגלית בלבד, כך שהוא לא יעזור למי שמפתח פתרונות בעברית בלי תרגום או התאמה. מעבר לכך, הכרטיס דל מאוד ולא מפרט הטיות מוכרות, מגבלות ייצוג או את אופן יצירת הנתונים. המאמר המקורי פורסם ב־2022, והמאגר הועלה בתחילת 2023. אם אתם בונים מוצר שמסתמך על לוגיקה חסינה, תצטרכו לבדוק בעצמכם את איכות הדוגמאות בקבצים כדי לוודא שאין בהן כשלים לוגיים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקט מסחרי?

הרישיון המדווח הוא cc ללא ציון תנאים ספציפיים כמו ייחוס או הגבלת מסחריות. בגלל חוסר הבהירות הזה, אסור להניח שמותר להשתמש בו למוצר מסחרי. כדאי להיכנס לקישור הגיטהאב המצורף ולבדוק מה הרישיון המדויק שהחוקרים קבעו שם.

האם יש במאגר דוגמאות בעברית?

לא. המאגר מוגדר לשפה האנגלית בלבד. אם המטרה שלכם היא מודל שמטפל בלוגיקה בעברית, תצטרכו לתרגם את הנתונים או לבנות מאגר ייעודי.

איך הדאטהסט נאסף?

דף המאגר בהאגינג פייס לא מספק מידע על תהליך האיסוף או הסינון. כל המידע על אופן יצירת הנתונים נמצא במאמר האקדמי שפורסם ב־arXiv תחת הכותרת FOLIO. מומלץ לקרוא את המאמר כדי להבין כיצד נוסחו ההיסקים.

האם נדרש אישור גישה כדי להוריד את הקבצים?

לא. המאגר פתוח לחלוטין לציבור וניתן למשוך את הקבצים ישירות באמצעות ספריות קוד או בהורדה ידנית. אין צורך בחשבון מאושר או בחתימה על הסכמים מיוחדים בעמוד.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה של Hugging Face באמצעות המזהה tasksource/folio. אין צורך לבקש אישור גישה מראש או להמתין לאישור ידני, והמאגר פתוח להורדה מיידית. סך הכל יש חמישה קבצים במאגר, כולל קובצי ה־jsonl של האימון והוולידציה וקובץ טקסט. לפני שמתחילים להריץ אימון, צריך לפתוח את קובצי ה־jsonl ולבדוק את שמות המפתחות והמבנה הפנימי של הדוגמאות, מכיוון שהכרטיס לא מציג סכמה מוגדרת מראש.

from datasets import load_dataset

ds = load_dataset("tasksource/folio")

הרישיון

הרישיון המדווח במאגר הוא cc כללי. הסימון הזה לא מציין איזו גרסה של Creative Commons חלה כאן, כמו למשל האם מדובר בשימוש לא מסחרי בלבד או שיש דרישה לשיתוף זהה. במצב כזה, אי אפשר לדעת בוודאות אם מותר להשתמש בנתונים לאימון מודל מסחרי. מומלץ לבדוק את הרישיון המפורט בקוד המקור בגיטהאב של הפרויקט לפני שמשלבים אותו בפיתוח מסחרי.

הרישיון המלא ב־Hugging Face ↗