GPT
E

everyday-conversations-llama3.1-2k

קוד פתוח

HuggingFaceTBapache-2.02024-08-12

שיחות יומיומיות קצרות וסינתטיות שנועדו ללמד מודלים קטנים איך להגיב לברכות בסיסיות בלי להשתגע. פתרון ממוקד לבעיה מוכרת שבה מודל קטן מתבלבל מברכת שלום פשוטה.

  • 2,321הורדות בחודש
  • 138לייקים

מה זה

המאגר מכיל 2,200 שיחות מרובות תורות שנוצרו על ידי Llama-3.1-70B-Instruct באמצעות llm-swarm. הרעיון הוא חילופי דברים פשוטים של שלושה עד ארבעה סיבובים קצרים בין משתמש לעוזר בינה מלאכותית. הנושאים הותאמו במיוחד למודלים קטנים, עם 20 נושאי יומיום שכוללים 100 תת נושאים כל אחד, ועוד 43 נושאי מדע בסיסי עם 10 תת נושאים לכל אחד.

המבנה קשיח ומכוון. כל שיחה נפתחת בברכה של המשתמש ובמענה קבוע של העוזר שמציע עזרה. מכיוון שהמודל שיצר את הטקסט נטה להתחיל תמיד במילה Hi, היוצרים החליפו חלק מהמופעים באופן אקראי בברכות כמו Hello או Hey כדי לייצר מעט גיוון. השיחות המפולחות שמורות בעמודת messages, והנתונים מחולקים לקובצי אימון ומבחן.

מתאים ל

  • אימון התנהגות בסיסית

    לימוד מודלים קטנים להגיב לברכות שלום ושאלות זהות פשוטות בלי להמציא נושאים לא קשורים.

  • העשרת תערובת אימון

    הוספת 2,200 דוגמאות שיחה קצרות לדאטהסטים גדולים יותר כמו Magpie כדי לאזן את הסגנון.

  • בדיקת יכולת שיחה

    שימוש בקובץ המבחן להערכה של מודל קטן על הבנת נושאי יומיום ומדע אלמנטרי.

איפה זה נופל

זהו דאטהסט סינתטי לגמרי באנגלית בלבד, ואין בו שום תוכן בעברית. השיחות קצרות, בסיסיות מאוד ובעלות מבנה קבוע כמעט לחלוטין שמתחיל תמיד באותה ברכה של העוזר. אם תאמנו רק עליו, תקבלו מודל מוגבל ביותר. הוא נועד להיות תוסף קטן לתערובת אימון קיימת ולא מאגר עצמאי. בנוסף, הנתונים הופקו על ידי מודל שפה ולא נבדקו ידנית על ידי בני אדם.

שאלות
נפוצות

האם המאגר כולל שיחות בעברית?

לא, כל השיחות במאגר נוצרו באנגלית בלבד. אם המטרה שלכם היא מודל שמגיב בעברית לברכות פשוטות, תצטרכו לתרגם את הנתונים או ליצור סט מקביל בעצמכם.

האם מותר להשתמש בו לפרויקט מסחרי?

כן, הרישיון הוא apache-2.0 ומאפשר שימוש מסחרי ללא תשלום. התנאי היחיד הוא שמירה על הודעת זכויות היוצרים והרישיון המקורי בתוצרי הקוד והפיתוח שלכם.

האם אפשר לאמן מודל רק על הדאטהסט הזה?

ממש לא מומלץ. יש בו רק 2,200 שיחות פשוטות והוא נועד אך ורק להזרקת התנהגות יומיומית לתוך תערובת אימון רחבה יותר של מודלים קטנים, לצד דאטהסטים של הוראות.

איך הנתונים האלה נוצרו?

הם נוצרו בצורה מלאכותית על ידי הרצת Llama-3.1-70B-Instruct עם תסריט ייעודי שחילץ שיחות קצרות. לאחר היצירה נעשה שינוי אוטומטי של חלק מברכות הפתיחה כדי למנוע חזרתיות יתר.

איך טוענים

טוענים את המאגר ישירות מתוך ספריית datasets בלי צורך באישור גישה או הרשאות מיוחדות. הנתונים מגיעים בשני קובצי Parquet בלבד, אחד לאימון ואחד למבחן, כך שההורדה שוקלת מעט מאוד ומסתיימת תוך שניות. השדה המרכזי שמעניין אתכם באימון הוא messages, שמכיל את רצף ההודעות המובנה בין המשתמש לעוזר מוכן לשימוש בפורמט צ'אט.

from datasets import load_dataset

ds = load_dataset("HuggingFaceTB/everyday-conversations-llama3.1-2k")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי והפצה, כל עוד אתם כוללים את תנאי הרישיון המקוריים ומעניקים ייחוס מתאים ליוצרים. אין כאן דרישה של שיתוף תחת אותו רישיון, כך שאתם יכולים לאמן עליו מודלים מסחריים או לשלב אותו במוצרים קנייניים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗