GPT
M

moss-003-sft-data

קוד פתוח

OpenMOSS-Teamcc-by-4.02023-05-20

מעל מיליון שיחות לאימון מודלים מבוססי הוראות, כולל חלק ייעודי להפעלת כלים חיצוניים כמו מחשבון וחיפוש. מי שבונה סוכן שצריך להחליט מתי לקרוא לתוסף ימצא כאן חומר נדיר יחסית.

  • 3,319הורדות בחודש
  • 68לייקים

מה זה

המאגר מחולק לשני עולמות עיקריים. החלק הראשון מכיל מעל מיליון שיחות רגילות ללא כלים, שרובן מתמקדות בכתיבה, משחקי תפקידים וקוד, לצד קטגוריות של סיעור מוחות והוראות מורכבות. יש שם גם דוגמאות ספציפיות להמשך שיחה מקוטעת ומעבר בין שפות באמצע הדיאלוג. היוצרים מציינים שהם מחקו לחלוטין את החלק שנוגע לכנות כי הוא הכיל מידע פרטי.

החלק השני מיועד לעבודה עם תוספים ומונה כ־350 אלף דוגמאות. כ־300 אלף מתוכן מיועדות לשימוש במנוע חיפוש, מחשבון ופותר משוואות, ועוד כ־50 אלף מכילות הוראות ליצירת תמונות מטקסט. המבנה הזה נועד ללמד מודל לא רק לענות, אלא לעצור ולקרוא לפונקציה כשחסר לו מידע.

מתאים ל

  • אימון מודל לשימוש בכלים

    לימוד מודלים מתי לפנות למחשבון, מנוע חיפוש או פותר משוואות כדי לענות על שאלות מדויקות.

  • פיתוח צ'אטבוט למשחקי תפקידים

    שימוש בכמעט רבע מיליון שיחות ייעודיות לבניית דמויות שמחזיקות שיחה עקבית.

  • אימון להתמודדות עם קטיעות

    שיפור היכולת של המודל להמשיך תשובות שנעצרו באמצע לפי בקשת המשתמש.

איפה זה נופל

הכרטיס לא מפרט אילו שפות נכללות בפנים, וכנראה שרובו באנגלית ובסינית, כך שאי אפשר לבנות עליו לעברית בלי לבדוק את התוכן ידנית. בנוסף, הנתונים פורסמו במאי 2023, כך שהמידע על העולם לא עדכני. נקודה קריטית נוספת היא שחלק הכנות הוסר בגלל פרטיות, מה שאומר שחסר כאן מרכיב בטיחות חשוב שצריך להשלים ממקור אחר.

שאלות
נפוצות

האם מותר להשתמש במידע כדי לאמן מודל מסחרי?

כן, הרישיון המדווח הוא cc-by-4.0 שמתיר שימוש מסחרי מלא. התנאי היחיד הוא מתן קרדיט ברור ליוצרים המקוריים.

האם הדאטהסט כולל תמיכה בעברית?

התיעוד לא מציין נוכחות של עברית, ומדווח בעיקר על החלפת שפות כללית. סביר להניח שהרוב המוחלט באנגלית ובסינית, לכן לא מומלץ להסתמך עליו לאימון ייעודי בעברית בלי לדגום אותו תחילה.

מה מייחד אותו ממאגרי הוראות רגילים?

היתרון הבולט הוא 350 אלף שיחות שמדגימות שימוש בכלים חיצוניים כמו חיפוש ומחשבון. רוב מאגרי ה־SFT הפתוחים מתמקדים בטקסט בלבד, וכאן יש הכנה מובנית לקריאות לפונקציות.

איך טוענים

הקבצים שמורים בארכיון מכווץ בפורמט jsonl, מחולקים לפי שימוש בכלים. אין צורך לבקש אישור גישה מיוחד כדי להוריד אותם מהמאגר. תצטרכו לפתוח את קובצי ה־zip כדי לגשת לשורות המידע, ולבחור את הקובץ המתאים: שיחות נקיות, שיחות עם כלים ללא תמונות, או הקובץ שכולל גם פקודות text2image.

from datasets import load_dataset

ds = load_dataset("OpenMOSS-Team/moss-003-sft-data")

הרישיון

המאגר מופץ תחת רישיון cc-by-4.0. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו ולאמן עליו מודלים, כל עוד אתם נותנים קרדיט מתאים לצוות OpenMOSS. אין חובה לשתף את המודל המאומן או את הנגזרות באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת ייחוס

הרישיון המלא ב־Hugging Face ↗