GPT
P

prompt-perfect

קוד פתוח

0-heroרישיון לא דווח2023-10-08

  • synthetic
  • distillation
  • GPT-4
  • GPT-3.5

אוסף של 35 מאגרי הוראות מוכרים שעברו ניקוד איכות אוטומטי באמצעות מודלים של OpenAI. זה כלי סינון למי שרוצה לאמן מודל רק על הדוגמאות הטובות ביותר מתוך סטים קיימים.

  • 7,081הורדות בחודש
  • 29לייקים

מה זה

המאגר מאגד 35 דאטהסטים נפוצים של כוונון עדין, בהם Capybara, MetaMathQA, ultrachat ו־alpaca-gpt4, שמקיפים מעל שישה מיליארד טוקנים. הנתונים המקוריים נלקחו מהפרסומים הפתוחים של הקהילה ברשת, ועברו הערכה לפי מתודולוגיית Self-Alignment with Instruction Backtranslation.

לכל רשומה במאגרים המקוריים נוספו שתי עמודות ייעודיות. עמודת score מכילה את תשובת מודל השפה המדרג יחד עם שרשרת המחשבה שלו, ועמודת extracted_score כוללת ציון מספרי מופשט שנע בין 0 ל־5. הדירוג עצמו בוצע באמצעות גרסאות שונות של gpt-3.5-turbo, כגון גרסת ה־16k והעדכונים מנובמבר וינואר.

המבנה הפנימי שומר על הפיצול המקורי, כאשר כל דאטהסט שמור בתיקייה נפרדת בקובצי json או jsonl מעובדים. חלק מהמאגרים דורגו באמצעות הפרומפט המקורי מהמאמר האקדמי, בעוד מאגרי שיחה כמו Capybara עברו ניקוד בעזרת פרומפט מותאם לשיחות מרובות שלבים.

מתאים ל

  • סינון איכות לאימון מודל

    שליפת הדוגמאות שקיבלו ציון 5 בלבד מתוך דאטהסטים כמו Capybara לטובת אימון מהיר וממוקד.

  • מחקר על הערכת LLM

    ניתוח שרשרת המחשבה בעמודת score כדי לחקור כיצד gpt-3.5 שופט איכות של הוראות.

  • אופטימיזציית גודל נתונים

    חיתוך דאטהסטים מנופחים כמו dolphin לגודל קומפקטי בלי לפגוע ברמת התוכן.

איפה זה נופל

הניקוד כולו נשען על שיפוט של gpt-3.5-turbo, ולכן הוא סוחב איתו את כל ההטיות הפנימיות של המודל הזה, כולל העדפה לטקסטים ארוכים, מנומסים ומובנים היטב על פני תשובות קצרות וישירות. הנתונים כולם באנגלית בלבד, ואין פה טיפול בעברית. בנוסף, חלוקת הציונים משתנה בצורה קיצונית בין סטים שונים, מה שאומר שציון 5 במאגר אחד לא בהכרח מייצג את אותה רמת איכות במאגר אחר.

אותה משפחה

prompt-perfect יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לפיתוח מסחרי?

לא מומלץ בלי בדיקה משפטית פרטנית. המאגר עצמו פורסם ללא רישיון מוגדר, וכל תת-תיקייה שבו מבוססת על דאטהסט מקור עם תנאי שימוש משלו, שחלקם עשויים להגביל שימוש מסחרי או להסתמך על פלטים של OpenAI.

האם יש במאגר דוגמאות בעברית?

לא. המאגר כולו מתועד ומוגדר באנגלית בלבד. אם אתם מחפשים לשפר ביצועים בעברית, הנתונים כאן לא יעזרו באופן ישיר.

איך נקבע הציון לכל רשומה?

היוצרים העבירו כל הוראה ותשובה דרך פרומפט ייעודי המבוסס על מאמר Backtranslation. מודל gpt-3.5 ניתח את הנתונים, החזיר הסבר ופלט ציון מספרי מ־0 עד 5 שחולץ לעמודה נפרדת.

מה ההבדל בין זה לבין הורדת הדאטהסטים המקוריים?

התוכן זהה למקורות כמו ultrachat או open-platypus, אבל חוסך לכם את עלויות ה־API וזמן הריצה של הניקוד. אתם מקבלים את הקבצים המוכרים כשהם כבר מתויגים עם ציוני איכות מוכנים לפילטור.

איך טוענים

אין צורך באישור גישה מיוחד כדי להוריד את הקבצים, והם פתוחים לחלוטין ברשת. המאגר מורכב מ־85 קבצים נפרדים בפורמטים json ו־jsonl שמחולקים לפי שמות המאגרים המקוריים, כך שעדיף למשוך ישירות רק את התיקייה שמעניינת אתכם במקום את כל הגיגה-בייטים. בשלב הטעינה, השדה הקריטי לעבודה הוא extracted_score, שמאפשר לכם לכתוב פילטר פשוט של שורה אחת ולהשאיר רק דוגמאות בציון 4 או 5.

from datasets import load_dataset

ds = load_dataset("0-hero/prompt-perfect")

הרישיון

היוצר לא הגדיר רישיון שימוש כולל לדאטהסט. חוסר ברישיון אומר שמבחינה משפטית אין הרשאה מפורשת להשתמש בתוצרים, ובנוסף כל תת-מאגר בפנים מגיע במקור ברישיון שונה לחלוטין. אם אתם מתכננים לאמן מודל לשימוש מסחרי, מדובר בסיכון משפטי לא מבוטל שמחייב בדיקה של תנאי השימוש בכל תיקייה בנפרד.

הרישיון המלא ב־Hugging Face ↗