GPT
I

instruction_merge_set

קוד פתוח

LinkSoulרישיון לא דווח2023-05-31

אוסף ענק של הוראות ושיחות ממוזגות מגל פריצת הדרכים של תחילת 2023. הוא חוסך איסוף ידני של עשרות מאגרים מוכרים לצורך אימון מודלי שיחה.

  • 351הורדות בחודש
  • 123לייקים

מה זה

המאגר מאחד רשומות מעשרים וארבעה מקורות שונים שנבנו לאימון מודלים במילוי הוראות ושיחה מרובת תורות. תמצאו כאן שיחות אמיתיות בין רופאים למטופלים מתוך HealthCareMagic ואיקליניק, נתונים אנושיים שנוצרו על ידי עובדי דאטהבריקס בפרויקט דולי, לצד סטים סינתטיים מבוססי מודלים כמו אלפקה, גואנקו וקאמל. בנוסף שולבו עשרות אלפי אינטראקציות שנקצרו משרג'יפיטי לפני שנסגר, והשוואות של תגובות אדם מול מכונה.

התוכן מכסה קשת רחבה של משימות: ניתוח תחבירי, סימולציות תפקידים, ייעוץ רפואי, שיחות שירות לקוחות ופתרון בעיות קוד. המקורות המקוריים השתמשו בסינונים שונים, חלקם ביצעו הסרת כפילויות וחלקם אספו טקסטים ישירות מהרשת או מסוכני בינה מלאכותית, אך הכרטיס הנוכחי לא מפרט תהליך סינון אחיד שנעשה בעת המיזוג עצמו.

מתאים ל

  • אימון בסיסי להוראות

    כוונון ראשוני של מודלי שפה באנגלית ובסינית על מגוון משימות שיחה ופתרון בעיות.

  • בניית דיאלוגים רב-שלביים

    שימוש בשיחות אולטרה-צ'אט ושרג'יפיטי לפיתוח מודלים שיודעים לשמור על הקשר לאורך זמן.

  • מחקר על דאטה סינתטי

    השוואה בין ביצועי תשובות אנושיות לתשובות שנוצרו על ידי מודלי שפה בתחילת דרכם.

איפה זה נופל

הבעיה המרכזית היא חוסר עקביות באיכות. חלק ניכר מהנתונים יוצר על ידי ג'יפיטי שלוש וחצי וארבע מגרסאות מוקדמות של 2023, ולכן הוא כולל הזיות ודפוסי ניסוח מלאכותיים. מבחינת שפות, המאגר מתרכז בעיקר באנגלית ובסינית, עם מעט גרמנית ויפנית בגואנקו. עברית לא מוזכרת בכרטיס כלל. בתחום הרפואי שולבו נתוני אמת של רופאים, מה שמחייב זהירות קיצונית סביב דיוק עובדתי, פרטיות והטיות קליניות לפני שמשתמשים בהם.

שאלות
נפוצות

האם מותר להשתמש במאגר הזה לפיתוח מודל מסחרי?

לא מומלץ בכלל. יוצרי האוסף לא צירפו רישיון, ובפנים יש שילוב של עשרות מקורות שחלקם נאספו לצרכי מחקר בלבד או מתבססים על פלטים של מודלים קנייניים. שימוש מסחרי עלול להפר זכויות יוצרים או תנאי שימוש.

האם המאגר כולל תוכן בעברית?

הכרטיס לא מזכיר עברית באף אחד מתתי המאגרים שנכללו בו. השפות העיקריות המפורטות בתיעוד הן אנגלית וסינית, לצד מעט גרמנית ויפנית בחלקים מסוימים של גואנקו.

באיזה מבנה הקבצים מגיעים?

המאגר מחולק לעשרים ושבעה קובצי פארקט שונים. אין צורך להמיר קבצי טקסט ידנית, והטעינה מתבצעת ישירות בסביבות פייתון סטנדרטיות.

מה מייחד את האוסף הזה לעומת אלפקה רגיל?

במקום להסתפק בהוראות פשוטות ממקור יחיד, המאגר הזה מאגד יחד מקורות רפואיים, סקריפטים של קוד, שיחות בין סוכנים ונתוני שרג'יפיטי. המגוון רחב בהרבה, אך המחיר הוא חוסר אחידות באיכות הנתונים.

איך טוענים

טוענים את המידע ישירות דרך ספריית הדאטהסטס הרגילה בעזרת המזהה של לינקסול. המאגר ציבורי לחלוטין ואין צורך בהרשאות מיוחדות או אישור גישה מראש. הנתונים מפוצלים לעשרים ושבעה קובצי פארקט שונים, לכן מומלץ להוריד אותם מקומית או לעבוד במצב הזרמה אם אין לכם מקום פנוי רב בדיסק. כל שורת מידע מכילה את השיחה או ההוראה, וחשוב לשים לב למזהה המקור שמוצמד לכל שורה כדי לדעת מאיזה תת מאגר היא הגיעה, שכן הפורמט הפנימי של התוכן עשוי להשתנות בין הדאטהסטים השונים שאוחדו לחבילה הזו.

from datasets import load_dataset

ds = load_dataset("LinkSoul/instruction_merge_set")

הרישיון

היוצרים לא הגדירו רישיון למאגר הממוזג, וזה משאיר שטח אפור ומסוכן. חלק מהמקורות הפנימיים כמו דולי נוצרו ברישיון מסחרי פתוח, אך חלקים אחרים מכילים פלטים שנקצרו ממוצרי אופן איי איי בניגוד לתנאי השימוש שלהם או סטים עם רישיונות מחקר בלבד. בלי רישיון מסודר אי אפשר להשתמש במאגר לפרויקטים מסחריים, ואימון מודל עליו עלול לחשוף אתכם לסיכונים משפטיים.

הרישיון המלא ב־Hugging Face ↗