GPT
D

databricks-dolly-15k

קוד פתוח

databrickscc-by-sa-3.02023-04-11

מאגר של מעל 15,000 הוראות ותשובות שנכתבו בידי עובדי דאטאבריקס ולא חולצו ממודלים אחרים. הוא מאפשר אימון מודלים למילוי פקודות ברישיון חופשי לחלוטין לשימוש מסחרי.

  • 64,649הורדות בחודש
  • 1,085לייקים

מה זה

המאגר מכיל מעל 15,000 רשומות המחולקות לשמונה קטגוריות התנהגותיות, ביניהן סיכום, שאלות ותשובות פתוחות וסגורות, כתיבה יצירתית, חילוץ מידע, סיווג, סיעור מוחות וקטגוריה חופשית. כל רשומה כוללת הנחיה ותשובה שנכתבו על ידי בני אדם, ובחלק מהמשימות נוסף גם שדה הקשר.

אלפי עובדי חברת דאטאבריקס חיברו את הנתונים בעצמם. נאסר עליהם להיעזר במודלי שפה או במקורות רשת, למעט ויקיפדיה לצורך משימות ספציפיות כמו סיכום או שאלות מבוססות טקסט. ההנחיות לכותבים היו קצרות במכוון כדי לעודד היקף תרומה גבוה, ולכן אין כאן סינון קפדני לפי תקן אחיד אלא עבודה אנושית מגוונת.

מתאים ל

  • אימון למילוי הוראות

    כיוונון עדין של מודלי שפה לקבלת מענה עקבי לפקודות משתמש במגוון משימות.

  • יצירת דאטה סינתטי

    שימוש ברשומות כדוגמאות לכתיבת מיליוני הנחיות חדשות באמצעות מודלים פתוחים.

  • אוגמנטציה של נתונים

    ניסוח מחדש של ההנחיות והתשובות כדי לייצב את יכולת ההכללה של מודלים.

איפה זה נופל

הטקסטים כולם באנגלית אמריקאית ואין כאן עברית כלל. התוכן מוטה באופן טבעי לפרופיל הדמוגרפי ולתחומי העניין של עובדי חברת תוכנה אחת, וחלקם אינם דוברי אנגלית כשפת אם. במשימות שנשענות על ויקיפדיה יש שגיאות עובדתיות והטיות המגיעות ישירות ממנה. מעבר לכך, ההנחיות הקצרות לעובדים הביאו לאיכות ביצוע לא אחידה בין דוגמאות שונות.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לאימון מודל מסחרי?

כן. הרישיון הוא cc-by-sa-3.0 ומאפשר שימוש מסחרי מפורש. עם זאת, חובת השיתוף הזהה דורשת לוודא שאינכם מפרים את תנאי הרישיון בכל הנוגע להפצת משקלי המודל או נתוני המשך.

האם יש בדאטהסט תמיכה בעברית?

לא. כל הרשומות נכתבו באנגלית בלבד. אם המטרה שלכם היא מודל בעברית, תצטרכו לתרגם את הנתונים או להשתמש בהם רק כבסיס סינתטי.

איך הנתונים נאספו?

הם נכתבו ידנית על ידי עובדי דאטאבריקס לפי שמונה קטגוריות התנהגות מוגדרות מראש. נאסר עליהם להשתמש בבינה מלאכותית יוצרת, והטקסטים התבססו על הידע האישי שלהם או על קטעים מוויקיפדיה.

מה ההבדל בין המאגר הזה למאגרי הוראות אחרים?

רוב מאגרי ההוראות המוקדמים נשענו על פלטים של ChatGPT או מודלים קנייניים אחרים, מה שהגביל את השימוש המסחרי בהם. כאן המקור הוא אנושי לחלוטין ולכן הנתונים פתוחים למסחור.

איך טוענים

טוענים את המאגר ישירות מקובץ databricks-dolly-15k.jsonl שנמצא במאגר Hugging Face. אין צורך בבקשת אישור גישה מיוחדת, הוא פתוח להורדה ישירה. השדות המרכזיים בכל שורה כוללים את ההנחיה, התשובה, הקטגוריה ושדה ההקשר. אם אתם משתמשים בשדה ההקשר לצורך אימון, חשוב לנקות ממנו סוגריים מרובעים עם מספרי הערות שוליים שהועתקו ישירות מוויקיפדיה לפני שמזינים אותו למודל.

from datasets import load_dataset

ds = load_dataset("databricks/databricks-dolly-15k")

הרישיון

המאגר מופץ ברישיון cc-by-sa-3.0. מותר להשתמש בו לכל מטרה, כולל מחקר ומוצרים מסחריים, אך חובה לתת קרדיט לדאטאבריקס ולוויקיפדיה. תנאי השיתוף הזהה מחייב שכל נגזרת של הנתונים תופץ באותו רישיון בדיוק, מה שדורש בדיקה משפטית אם המודל המאומן נחשב ליצירה נגזרת לפי פרשנות זו.

הרישיון המלא ב־Hugging Face ↗