GPT
L

LMSYS-Chat-GPT-5-Chat-Response

קוד פתוח

ytz20cc-by-4.02025-11-16

שאלות אמיתיות ממשתמשי זירה מול תשובות סינתטיות ממודל מתקדם, ללא סירובים. המאגר נבנה ישירות למשימות זיקוק ידע כשרוצים לחסוך קריאות API יקרות.

  • 165הורדות בחודש
  • 93לייקים

מה זה

המאגר מבוסס על שאילתות משתמשים אמיתיות שנלקחו מתוך LMSYS Chat 1M Clean, כלומר פרומפטים חיים מ Chatbot Arena במגוון רחב של כוונות. עבור השאלות האלו נאספו תשובות ישירות מתוך ה API של מודל המכונה GPT-5-Chat, תוך סינון מכוון שהשאיר רק פלטים באיכות גבוהה וללא הודעות סירוב מצד המודל.

המבנה הפנימי פשוט מאוד ומכיל שני שדות טקסט בלבד, השאילתה המקורית תחת content ותשובת המודל המורה תחת teacher_response. הנתונים מחולקים לשני ספליטים, אימון שכולל סביב 200,000 דוגמאות, וספליט בדיקה קטן שמכיל סביב 500 דוגמאות.

מתאים ל

  • זיקוק מודלים

    אימון מודל קטן על בסיס תשובות של מודל מורה חזק בלי צורך לייצר פלטים חדשים מאפס.

  • הערכת ביצועים

    בדיקת איכות תשובות מול פרומפטים אמיתיים של משתמשים על גבי 500 דוגמאות הבדיקה.

  • אימון הוראות כללי

    כוונון עדין למענה על משימות מגוונות של כתיבה, קידוד וניתוח ללא צורך במענה לסירובים.

איפה זה נופל

הכרטיס מציין במפורש שאין בתשובות שום קריאות לכלים או שרשראות מחשבה של ממש, כך שלא תמצאו פה נתוני reasoning עמוקים. מעבר לזה, אין פירוט לגבי התפלגות השפות ואי אפשר לדעת מראש כמה עברית קיימת בפועל מתוך השאילתות של משתמשי הזירה. מאחר שהתשובות מגיעות ישירות ממודל סגור, צריך לקחת בחשבון הטיות וטעויות עובדתיות מובנות של מודל המקור.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה למוצר מסחרי?

הרישיון של המאגר עצמו הוא cc-by-4.0 ומאפשר זאת תחת מתן קרדיט. הבעיה היא שהתשובות מגיעות מ API של מודל מסחרי, ותנאי השירות של ספקי מודלים סגורים בדרך כלל אוסרים לאמן מודלים מתחרים על הפלטים שלהם. מומלץ לבדוק את הסיכון המשפטי מול תנאי המקור לפני אימון מודל מסחרי.

האם המאגר כולל עברית?

כרטיס הדאטהסט לא מפרט חלוקה לפי שפות. המקור הוא שאילתות משתמשים אמיתיות מ Chatbot Arena, שרובן המכריע באנגלית לצד אחוזים בודדים של שפות אחרות. אם אתם בונים מודל שמיועד ספציפית לעברית, כנראה שזה לא המאגר הנכון להסתמך עליו.

האם המודל כולל הסברים ושלבי מחשבה?

לא, הכרטיס מצהיר מפורשות שאין בתשובות tool calls או reasoning. מדובר בטקסט ישיר של תשובות לשאלות, בלי תיעוד של תהליכי חשיבה פנימיים. אם המטרה שלכם היא לאמן מודל חשיבה עם שלבי ביניים, הנתונים האלה לא יספיקו.

איך סיננו את התשובות במאגר?

לפי הכרטיס, החוקרים בחרו מתוך LMSYS Chat 1M Clean רק תשובות שהוגדרו באיכות גבוהה ואינן כוללות סירובים של המודל. זה משאיר פרומפטים שימושיים נטו ומסיר מצבים שבהם המודל מתנצל או מסרב לענות לבקשת המשתמש.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות המזהה של המאגר, ללא צורך באישור גישה מיוחד. הקבצים שמורים בפורמט Parquet פשוט, אחד לכל ספליט, מה שמבטיח קריאה מהירה ויעילה לתוך הזיכרון. השדות היחידים שמעניינים אתכם בקוד הם content שלתוכו נכנס הפרומפט ו teacher_response שמכיל את התשובה לאימון.

from datasets import load_dataset

ds = load_dataset("ytz20/LMSYS-Chat-GPT-5-Chat-Response")

הרישיון

המאגר פורסם תחת רישיון cc-by-4.0 שמתיר עקרונית שימוש מסחרי, שינוי והפצה, כל עוד נותנים קרדיט מתאים ליוצרים. עם זאת, התשובות נוצרו באמצעות API מסחרי וסגור, מה שעלול לייצר התנגשות מול תנאי השימוש של ספק המודל המקורי בכל הנוגע לאימון מודלים מתחרים.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗