GPT
R

ruozhiba_gpt4

קוד פתוח

hflapache-2.02024-04-28

המאגר כולל 2,449 שאלות בסגנון קהילת ruozhiba הסינית עם תשובות משני מודלים של GPT-4. הוא מיועד לבדיקת יכולת התמודדות של מודלי שפה עם שאלות היגיון מעוותות וחידודים מורכבים.

  • 514הורדות בחודש
  • 93לייקים

מה זה

הנתונים במאגר נשענים על תופעת הרשת הסינית ruozhiba, קהילה שידועה בשאלות מתחכמות, אבסורדיות ומבלבלות שמאתגרות חשיבה לוגית. הצוות לקח 2,449 שאלות כאלה ויצר להן תשובות סינתטיות באמצעות גרסאות של GPT-4, במטרה לבחון איך מודל שפה מפרק חידות היגיון לא שגרתיות ואיך הוא מגיב לשאלות מלכודת.

התוכן מחולק בדיוק לשני קבצים נפרדים, כשבכל אחד מהם נמצאות אותן 2,449 שאלות בדיוק. ההבדל היחיד בין הקבצים הוא המודל שייצר את התשובות: הקובץ הראשון נשען על gpt-4-turbo בגרסת אפריל 2024, והקובץ השני נוצר בעזרת gpt-4o בגרסת מאי 2024. הנתונים נבנו כחלק מפרויקט Chinese-LLaMA-Alpaca-3 ומתבססים על מחקר ודאטהסטים קודמים ברשת, ללא פירוט נוסף לגבי שלבי סינון ידניים.

מתאים ל

  • הערכת היגיון ושאלות מלכודת

    בדיקת יכולת המודל להתמודד עם שאלות אבסורד ושנינויות שמכשילות אלגוריתמים.

  • השוואת ביצועי GPT-4

    השוואה ישירה בין התשובות של gpt-4-turbo לאלו של gpt-4o על אותן שאלות בדיוק.

  • אימון הוראות בסינית

    כוונון עדין של מודלי שפה סיניים על משימות הבנה של שאלות מורכבות.

איפה זה נופל

הטקסט כולו בסינית בלבד, בלי שום תרגום או נתונים בעברית, כך שהוא חסר תועלת ישירה למודל שמיועד לשוק המקומי אלא אם כן אתם בוחנים התנהגות רב-לשונית כללית. היוצרים מציינים במפורש שהנתונים עלולים להכיל שפה פוגענית שמקורה בשאלות מהרשת. בנוסף, מדובר בתשובות סינתטיות בלבד ללא בדיקה אנושית מתועדת, והמדגם קטן מאוד ולא מכסה משימות שיחה כלליות.

שאלות
נפוצות

האם הדאטהסט כולל שאלות בעברית?

לא. כל הנתונים כתובים בסינית ומבוססים על תרבות הרשת המקומית של קהילת ruozhiba. אין בו שום תרגום או תוכן בשפות אחרות.

האם מותר להשתמש בו לאימון מודל מסחרי?

הרישיון המדווח במאגר הוא apache-2.0, שמאפשר שימוש מסחרי מלא. עם זאת, מכיוון שהתשובות יוצרו על ידי GPT-4, יש לקחת בחשבון את תנאי השימוש של OpenAI בנוגע לאימון מודלים מתחרים.

מה ההבדל בין שני קובצי הנתונים במאגר?

שני הקבצים מכילים את אותן 2,449 שאלות בדיוק. ההבדל הוא שבקובץ אחד התשובות נוצרו באמצעות gpt-4-turbo ובשני הן נוצרו באמצעות gpt-4o.

איך טוענים

אין צורך לבקש אישור גישה מיוחד, מורידים ישירות את הקבצים ruozhiba_qa2449_gpt4t.json או ruozhiba_qa2449_gpt4o.json לפי המודל שמעניין אתכם. הפורמט הוא JSON פשוט שמכיל את צמדי השאלות והתשובות, כך שטעינה בספריית datasets או ישירות בקוד פייתון רגיל לוקחת שניות ספורות. נפח הקבצים קטן מאוד בגלל שמדובר באלפיים וארבע מאות רשומות בלבד. לפני שמתחילים להריץ אימון, כדאי לשים לב שההבדל המרכזי בין שני הקבצים הוא אופי התשובות של שני המודלים השונים.

from datasets import load_dataset

ds = load_dataset("hfl/ruozhiba_gpt4")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש מסחרי, שינוי והפצה, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. הוא לא מחייב שיתוף של מודל שאומן עליו תחת אותו הרישיון, אך יש לוודא שהתשובות שנוצרו על ידי מודלי OpenAI תואמות לתנאי השימוש החיצוניים שלהם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗