GPT
P

parti-prompts

קוד פתוח

naterawapache-2.02022-06-22

אוסף של יותר מ־1600 פרומפטים באנגלית שמיועדים לבחינת מודלי תמונה. המטרה כאן היא לבדוק יכולות של מודל מול אתגרים מגוונים, מתיאורים פשוטים ועד מורכבים במיוחד.

  • 2,913הורדות בחודש
  • 73לייקים

מה זה

המאגר מכיל מעל 1600 פרומפטים טקסטואליים שנוצרו במקור כחלק מהמחקר על מודל Parti של גוגל. הרשומות מיועדות למדוד ביצועים של מודלים שמייצרים תמונות מטקסט, כשהן בוחנות קטגוריות שונות ורמות קושי משתנות. הקובץ המרכזי שמופיע במאגר שמור בפורמט PartiPrompts.tsv.

הטקסטים נעים בין פקודות קצרות ופשוטות שמטרתן לבדוק התנהגות בסיסית וסקיילינג, ועד תיאורים ארוכים ומורכבים של עשרות מילים, למשל שחזור מילוני מדויק של יצירות אמנות קלאסיות. מעבר לדוגמה הזו, הכרטיס לא מפרט את אופן איסוף הנתונים, מי ניסח אותם בפועל או אילו שדות מופיעים בטבלה.

מתאים ל

  • הערכת מודלי תמונה

    בדיקת איכות התוצרים של מודלים יוצרי תמונה על גבי טקסטים ברמות קושי שונות.

  • מדידת סקיילינג

    השוואת ביצועים בין גרסאות שונות של אותו מודל בעזרת פרומפטים פשוטים ומורכבים.

  • בחינת תיאורים מורכבים

    בדיקה אם המודל עוקב אחרי פקודות מפורטות וארוכות של עשרות מילים ברצף.

איפה זה נופל

כל הטקסטים במאגר כתובים באנגלית בלבד, כך שאין שום אפשרות להעריך באמצעותו יכולות בעברית או בשפות אחרות. הנתונים שוחררו ביוני 2022, והכרטיס משאיר כמעט את כל הסעיפים ריקים: אין מידע על הטיות אפשריות, אין פירוט על סינון תוכן רגיש ואין תיעוד של החלוקה הפנימית. לפני שמסתמכים עליו כמדד יחיד, חייבים לקחת בחשבון שמדובר בסט לא מתועד שדורש בדיקה ידנית של התכנים.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, הרישיון המדווח הוא apache-2.0. הוא מאפשר שימוש מסחרי מלא, בכפוף לשמירה על תנאי הרישיון ומתן ייחוס מתאים.

האם יש במאגר תמיכה בעברית?

לא. כל התיאורים והפרומפטים שמופיעים בו נכתבו באנגלית בלבד.

כמה המאגר שוקל ומה הפורמט שלו?

המאגר כולל שלושה קבצים, והנתונים עצמם שמורים בקובץ טקסט בפורמט TSV בשם PartiPrompts.tsv. המשקל הכולל קל מאוד וכולל קצת יותר מ־1600 שורות טקסט.

מי יצר את הנתונים ואיך אספו אותם?

הטקסטים מקושרים למאמר על מודל Parti של גוגל ופורסמו כאן על ידי המשתמש nateraw. מעבר לכך, הכרטיס אינו מפרט מי האנשים שכתבו את הפרומפטים או מה היו שיטות הסינון.

איך טוענים

הטעינה מתבצעת ישירות מול המאגר ב־Hugging Face דרך הספרייה הרגילה, בלי צורך באישור גישה מיוחד. הנתונים שמורים בקובץ TSV בודד בשם PartiPrompts.tsv, כך שהמשקל זניח וההורדה מיידית. שימו לב שהכרטיס לא מתעד את שמות העמודות בטבלה, אז תצטרכו להציץ בשורת הכותרת בקובץ כדי לראות מה המבנה המדויק.

from datasets import load_dataset

ds = load_dataset("nateraw/parti-prompts")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לשנות ולהפיץ את הנתונים, תחת חובת מתן קרדיט ושמירה על תנאי הרישיון המקורי. הוא לא מחייב אתכם לפתוח את הקוד או את המודל שלכם באותו רישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗