GPT
W

WebInstruct-CFT

קוד פתוח

TIGER-Labapache-2.02025-01-30

  • tigerlab
  • math
  • cft

מאגר נתונים לאימון מודלים על מתן ביקורת וניתוח שגיאות במקום חיקוי תשובות נכונות. הוא מבוסס על שאלות ופתרונות קיימים שאליהם הוצמדו ביקורות מפורטות שנכתבו על ידי מודל שפה.

  • 367הורדות בחודש
  • 59לייקים

מה זה

הרשומות בנויות במבנה קבוע של הוראה לבקר פתרון, קלט שמכיל שאלה מקורית ותשובה לבדיקה, ופלט שכולל ביקורת מפורטת שנוצרה באמצעות GPT-4o. המקור הוא מאגר WebInstruct, שחלק הארי שבו, כשישים וחמישה אחוזים, מוקדש למתמטיקה. שאר התוכן מתחלק בין עסקים, פיזיקה, כימיה, מדעי הרוח ותחומים נוספים.

היוצרים חילקו את המאגר לשלושה גדלים שונים. הגרסה המלאה כוללת שש מאות אלף דוגמאות ומחולקת לארבעה קבצים, גרסת ביניים כוללת חמישים אלף דוגמאות, וגרסה מצומצמת כוללת ארבעת אלפים דוגמאות בלבד. הגרסאות הקטנות יותר שימשו במחקר לאימון מודלים ממשפחת Qwen.

מתאים ל

  • אימון מודלים לביקורת

    לימוד מודל שפה לאתר שגיאות בפתרונות מתמטיים ולהסביר מדוע התשובה שגויה.

  • אימות ציוני דרך בחשיבה

    בניית מנגנון שבוחן צעדי ביניים של מודל אחר כדי לשפר דיוק בפתרון בעיות.

  • הערכת פתרונות אוטומטית

    יצירת כלי עזר למתן משוב מפורט על תשובות של סטודנטים בתחומי המדעים.

איפה זה נופל

הנתונים קיימים באנגלית בלבד ואין בהם תוכן בעברית. רוב החומר נוטה בכבדות למתמטיקה ולמדעים מדויקים, מה שהופך אותו לפחות רלוונטי למי שמחפש יכולות ביקורת טקסטואלית כללית או כתיבה יוצרת. הביקורות עצמן נוצרו במלואן על ידי GPT-4o ולא נבדקו ידנית על ידי בני אדם, מה שעלול לייצר הזיות מובנות או שגיאות לוגיות סמויות בביקורת עצמה. אם אתם מכניסים את זה למוצר, תצטרכו לוודא שהמודל שלכם לא לומד להמציא פגמים איפה שאין כאלה.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

מבחינת הרישיון המוצהר מסוג apache-2.0, השימוש המסחרי מותר לחלוטין ללא דרישה לשיתוף קוד. יחד עם זאת, הפלטים בדאטהסט נוצרו בעזרת GPT-4o של חברת OpenAI. תנאי השימוש של מודלים כאלה עשויים להגביל אימון של מודלים מסחריים שמתחרים ישירות בחברה, ולכן כדאי לבדוק את הנקודה הזו מול הייעוץ המשפטי שלכם.

האם יש בדאטהסט תמיכה בעברית?

לא, המאגר כולו מוגדר וכתוב באנגלית בלבד. אם אתם זקוקים ליכולת ביקורת בעברית, תצטרכו לתרגם את החומר או להשתמש בו לאימון מודל שמחזיק כבר ביכולות רב לשוניות חזקות. גם במקרה כזה, הטרמינולוגיה המדעית תהיה מותאמת לסגנון הלימוד באנגלית.

מה ההבדל בין שלוש הגרסאות שנמצאות במאגר?

ההבדל היחיד הוא כמות הדוגמאות שנבחרה לצורך אימון. הגרסה המלאה כוללת שש מאות אלף רשומות ומיועדת לאימון מקיף, בעוד גרסאות החמישים אלף והארבעת אלפים נועדו לשחזר את הניסויים מהמאמר על מודלי Qwen שונים. מומלץ להתחיל בגרסה הקטנה כדי לוודא שפורמט האימון מתאים לצרכים שלכם לפני שמורידים את כל הנפח.

מאיפה הגיעו השאלות והתשובות שנמצאות בבסיס המאגר?

השאלות והפתרונות המקוריים נלקחו ממאגר קודם שנקרא WebInstruct, שמרכז בעיות מתחומי דעת שונים מהרשת. על גבי הנתונים האלה, החוקרים הריצו את GPT-4o עם בקשה מפורשת לבקר את הפתרון הקיים. התוצאה היא מאגר שמתמקד בזיהוי שגיאות וניתוחן ולא רק בהצגת הדרך הנכונה לפתרון.

איך טוענים

המאגר שמור בפורמט Parquet ופתוח להורדה ישירה דרך Hugging Face ללא צורך באישור גישה מוקדם. יש בו שמונה קבצים בסך הכל, כשהגרסה הגדולה תופסת ארבעה מהם והגרסאות הקטנות קובץ יחיד כל אחת. המבנה פשוט מאוד ומכיל שלושה שדות טקסט בלבד: instruction, input ו־output, כך שאין צורך בעיבוד מקדים מסובך מעבר לטעינת הטקסט.

from datasets import load_dataset

ds = load_dataset("TIGER-Lab/WebInstruct-CFT")

הרישיון

המאגר פורסם תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי, שינוי והפצה, ואינו מחייב אתכם לשחרר את המודלים שלכם תחת אותו רישיון, כל עוד אתם שומרים על הודעות זכויות היוצרים והרישיון המקורי. עם זאת, מכיוון שהפלטים נוצרו על ידי GPT-4o, כדאי להביא בחשבון את תנאי השימוש של OpenAI בנוגע לאימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗