GPT
1

10k_prompts_ranked

קוד פתוח

data-is-better-togetherother2024-02-22

  • preference
  • prompts
  • argilla
  • synthetic

עשרת אלפים פרומפטים באנגלית עם דירוגי איכות של קהילת הקוד הפתוח. מתאים למי שרוצה לסנן פרומפטים מובילים או לנתח הסכמה בין מתייגים.

  • 1,796הורדות בחודש
  • 170לייקים

מה זה

המאגר כולל 10,331 רשומות המכילות פרומפט, דירוגי איכות ממתייגים שונים בסולם של 1 עד 5, ציון ממוצע, יחס הסכמה ומטא-דאטה על מקור הטקסט. הנתונים נאספו ממאגרים מוכרים קיימים, ביניהם נתח מרכזי מתוך מאגר שר-ג'י-פי-טי לצד דגימות מאולטרה-צ'אט, אבול-אינסטרוקט, אופן-אסיסטנט ואחרים. חלק מהפרומפטים נכתבו במקור על ידי בני אדם וחלקם נוצרו באופן סינתטי.

דירוג האיכות בוצע בהתנדבות על ידי 314 חברי קהילה דרך ממשק ייעודי ברשת, בתהליך שנמשך שבועיים. המבנה כולל קובץ אימון יחיד שבו מרוכזים כל הפרומפטים לצד רשימת המדרגים והציונים הגולמיים שלהם.

מתאים ל

  • סינון זרעי פרומפטים

    שליפת פרומפטים בעלי ממוצע דירוג גבוה ליצירת נתונים סינתטיים חדשים.

  • מחקר על הסכמת מתייגים

    ניתוח הפערים בין ציוני איכות שונים שנתנו משתמשים לאותו הטקסט בדיוק.

  • אימון מודל דירוג טקסט

    לימוד מודלים לחיזוי ציון איכות לפרומפט קלט על בסיס ציוני הקהילה.

איפה זה נופל

הנתונים כולם באנגלית בלבד ואין כאן עברית כלל. מעבר לכך, 6,730 מתוך הפרומפטים קיבלו דירוג יחיד בלבד, מה שהופך את מדד ההסכמה לחסר משמעות עבור רוב המאגר. המתייגים הם מתנדבים אנונימיים מהקהילה ללא מידע דמוגרפי או רקע מקצועי, והמקורות נשענים בכבדות על נתוני עבר מסוימים. הכי חשוב, המאגר כולל רק פרומפטים בלי תשובות, כך שאי אפשר לאמן עליו מודל שיחה ישירות.

שאלות
נפוצות

האם אפשר להשתמש במאגר לפיתוח מסחרי?

הכרטיס מגדיר את הרישיון כ־other ומציין שחסר מידע. בנוסף הטקסטים מגיעים ממאגרים שונים עם רישיונות משלהם, ולכן לא בטוח להשתמש בו למוצר מסחרי.

האם הדאטהסט מתאים לאימון מודל שיחה?

לא. המאגר מכיל פרומפטים בלבד ואין בו תשובות של מודל או של בני אדם. הוא מיועד לדירוג פרומפטים ולא לכוונון מודלי שיחה.

האם יש במאגר טקסטים בעברית?

הנתונים כולם באנגלית בלבד. כל המקורות ששימשו להרכבת המאגר מבוססים על הנחיות בשפה האנגלית.

כמה מדרגים בדקו כל פרומפט?

רוב הרשומות, 6,730 מתוכן, קיבלו דירוג אחד בלבד ממשתמש בודד. רק 2,600 פרומפטים נבדקו על ידי שני אנשים, ומעטים קיבלו יותר מכך.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets בפייתון בעזרת הפקודה load_dataset עם המזהה הרשמי שלו. אין צורך באישור גישה מוקדם או במפתח מיוחד כדי להוריד את הקבצים. כל המידע שמור בקובץ parquet יחיד בתיקיית הנתונים, בנפח של כמה מגה-בייטים בודדים, כך שההורדה והטעינה לזיכרון מתבצעות תוך שניות ספורות גם על מחשב אישי רגיל. בעת עיבוד הנתונים כדאי לשים לב לשדות prompt, avg_rating, agreement_ratio וכן למערך הדירוגים המקורי בתוך quality כדי לסנן רעש.

from datasets import load_dataset

ds = load_dataset("data-is-better-together/10k_prompts_ranked")

הרישיון

הרישיון הרשמי מוגדר כ־other ובכרטיס המקורי מופיע שנדרש מידע נוסף. הפרומפטים נאספו משלל מקורות חיצוניים עם תנאי שימוש שונים. במצב הזה אין היתר מסחרי ברור ולא ברור מה ההשלכות על מודל שמתבסס עליהם, לכן מומלץ להגביל את השימוש למחקר בלבד.

הרישיון המלא ב־Hugging Face ↗