GPT
P

prompts.chat

קוד פתוח

fkacc0-1.02022-12-13

  • ChatGPT
  • prompts
  • AI
  • GPT
  • Claude

אוסף פרומפטים קהילתיים שנבנו כדי להפעיל מודלי שיחה בתפקידים שונים. מי שמחפש דוגמאות להנחיות מערכת וניסוח הוראות ימצא כאן בסיס רחב שנאסף מהשטח.

  • 24,769הורדות בחודש
  • 9,821לייקים

מה זה

המאגר מכיל שורות של פרומפטים שנוצרו על ידי משתמשים ושותפו במקור במסגרת הפרויקט המוכר Awesome ChatGPT Prompts. המטרה של הטקסטים האלה היא להגדיר למודל שפה פרסונה, מטרה התנהגותית או צורת מענה ספציפית למשימות שיחה ויצירת טקסט.

התוכן נאסף דרך פלטפורמה חברתית פתוחה שבה אנשים מעלים, עורכים ומשתפים ניסוחים שעבדו להם טוב מול צ'אטבוטים. הדף בהאגינג פייס מתפקד כמראה ישירה של המאגר הראשי מגיטהאב ומהאתר, כך שמדובר בתוכן קהילתי גולמי ללא חלוקה מורכבת של קבוצות אימון או בדיקה מוגדרות מראש, וללא תיעוד על סינון ידני קפדני.

מתאים ל

  • אימון מודל על הנחיות מערכת

    לימוד מודלים קטנים להתנהג לפי דמויות ותפקידים מוגדרים מראש.

  • בדיקת תגובות מודל

    הרצת מגוון רחב של הוראות כדי לבחון איך מודלים שונים מצייתים למשימות.

  • יצירת מאגר רעיונות לשיחה

    שילוב הנחיות מוכנות בממשקי צ'אט עבור משתמשי קצה.

איפה זה נופל

הנתונים פורסמו בדצמבר 2022, בתקופה שבה אנשים בעיקר חיפשו טריקים כדי להפעיל את הגרסאות הראשונות של מודלי השיחה. כרטיס המאגר לא מפרט שפות, ורוב התוכן באנגלית של משתמשי הרשת, כך שאין כאן התאמה לעברית או מנגנוני סינון להטיות, רעלים ואיכות ניסוח. אי אפשר לדעת אילו בדיקות עברו השורות, ונדרש ניקוי עצמאי לפני שמכניסים את הטקסטים לתהליך אימון רציני.

שאלות
נפוצות

האם מותר להשתמש בזה במוצר מסחרי?

כן, לחלוטין. הרישיון הוא נחלת הכלל, מה שאומר שאין מגבלות מסחריות ואין חובה לתת קרדיט או לשתף את התוצר באותו רישיון. אתם יכולים לקחת את הטקסטים ולשלב אותם בכל מערכת פנימית או מסחרית.

האם המאגר כולל טקסטים בעברית?

הכרטיס לא מדווח על תמיכה בעברית או על חלוקה לשפות. מדובר במאגר שנאסף מקהילת אינטרנט גלובלית שרובה המוחלט כותב באנגלית, ולכן לא הייתי בונה עליו לאימון מודל שצריך לתפקד בעברית.

איך נאספו הנתונים האלה?

הפרומפטים הגיעו משיתופים של משתמשים בפרויקט הקוד הפתוח ובאתר prompts.chat. הנתונים לא נוצרו במחקר מסודר, אלא נאספו כריכוז קהילתי של הנחיות שעבדו למשתמשים מול מודלי שיחה שונים.

האם המאגר הזה מעודכן?

הגרסה הזו עלתה להאגינג פייס בסוף שנת 2022. הדף מציין שהוא משמש כמראה, ומפנה לאתר ולגיטהאב עבור גרסאות חדשות יותר ותרומות קהילה עדכניות.

איך טוענים

אתם מושכים את הקובץ ישירות כקובץ prompts.csv פשוט או דרך ספריית datasets הרגילה עם המזהה fka/prompts.chat. אין כאן שום צורך באישור גישה מוקדם, הרשמה מיוחדת או מפתחות סודיים, כי הכל פתוח לחלוטין להורדה ישירה מהרגע הראשון.

המבנה של הנתונים קל ופשוט לעיבוד בכל סביבת פייתון בלי צורך במשאבי חישוב כבדים. לפני שמתחילים להזין את השורות לאימון, כדאי לחלץ את עמודות הטקסט של הפרומפטים ולבדוק את הפורמט, שכן מדובר בקובץ טבלאי פשוט שמכיל בעיקר את גוף ההנחיה.

from datasets import load_dataset

ds = load_dataset("fka/prompts.chat")

הרישיון

הרישיון הוא CC0 1.0 Universal, כלומר נחלת הכלל המלאה. מותר להעתיק, לשנות, להפיץ ולהשתמש בנתונים לכל צורך מסחרי בלי לבקש רשות ובלי חובת ייחוס. גם מודל שתאמנו על הטקסטים האלה חופשי מכל מגבלה משפטית של הפרויקט המקורי.

הרישיון המלא ב־Hugging Face ↗