GPT
D

databricks_dolly_15k

קוד פתוח

HuggingFaceH4cc-by-3.02023-04-12

מאגר הוראות שנכתב כולו בידי עובדי דאטבריקס ולא נוצר ממודלים אחרים. הוא מציע פתרון למי שמחפש לכוונן מודל שפה עם היתר שימוש מסחרי מלא.

  • 3,530הורדות בחודש
  • 23לייקים

מה זה

המאגר כולל יותר מ־15,000 רשומות של שאלות ותשובות שנכתבו על ידי אלפי עובדי חברת דאטבריקס. העובדים התבקשו ליצור זוגות של הנחיה ותשובה בשמונה קטגוריות שונות, בהן סיעור מוחות, סיווג, מענה על שאלות פתוחות או סגורות, חילוץ מידע, סיכום וכתיבה יצירתית.

ההנחיות אסרו במפורש להשתמש בבינה מלאכותית יוצרת או במקורות רשת חיצוניים, למעט ויקיפדיה. עבור משימות כמו סיכום או חילוץ מידע, הכותבים הדביקו קטעים ישירות מוויקיפדיה לתוך שדה ההקשר. ההנחיות לכותבים היו תמציתיות במכוון כדי להשיג כמות גדולה של נתונים, ולא בוצע סינון קפדני לפי סרגל הערכה נוקשה.

מתאים ל

  • אימון מודלי שיחה

    כוונון עדין של מודלי שפה למענה להוראות במגוון משימות יומיומיות באנגלית.

  • ייצור דאטה סינתטי

    שימוש ברשומות כדוגמאות מעטות כדי לייצר מיליוני הנחיות חדשות בעזרת מודל שפה.

  • אוגמנטציית נתונים

    ניסוח מחדש של השאלות והתשובות באמצעות מודל חיצוני כדי להרחיב את המאגר.

איפה זה נופל

הנתונים כולם באנגלית אמריקאית ואין כאן עברית בכלל. חלק מהכותבים אינם דוברי אנגלית כשפת אם, וההטיות ותחומי העניין בטקסטים משקפים את הדמוגרפיה של עובדי חברת הייטק אחת. הטקסטים שנלקחו מוויקיפדיה כוללים הפניות שלא נוקו, שגיאות עובדתיות והטיות נושאיות שקיימות באנציקלופדיה המקורית. ההנחיות היו קצרות ולכן איכות התיוג אינה אחידה.

שאלות
נפוצות

האם מותר להשתמש במאגר למטרות מסחריות?

כן, המאגר פתוח לשימוש מסחרי ואקדמי לפי תנאי רישיון cc-by-sa-3.0. חובה לתת ייחוס לדאטבריקס ולתורמי ויקיפדיה. כל מאגר נתונים שתפיצו המבוסס עליו חייב להיות תחת אותו הרישיון בדיוק.

האם המאגר כולל עברית?

לא. כל הרשומות נכתבו באנגלית אמריקאית על ידי עובדי החברה. מי שמחפש לאמן מודלים בעברית יצטרך לתרגם את הנתונים או לפנות למקורות אחרים.

איך נאספו הנתונים?

הנתונים נוצרו ישירות בידי עובדי דאטבריקס לפי שמונה קטגוריות מוגדרות מראש. נאסר עליהם להשתמש בכלי בינה מלאכותית או לחפש באינטרנט מעבר לוויקיפדיה. בחלק מהמשימות עובדים ענו על שאלות שניסחו עמיתיהם.

במה הוא שונה ממאגרי הוראות אחרים?

רוב מאגרי ההוראות המוקדמים נוצרו באמצעות שאילתות למודלים סגורים כמו אלה של חברת אופן איי איי, מה שהגביל את השימוש המסחרי בהם. כאן מדובר בטקסטים שנכתבו בידי בני אדם בלבד. ההבדל הזה מעניק לו מעמד משפטי נקי שמאפשר אימון מסחרי.

איך טוענים

טוענים את המאגר ישירות דרך ספריית הדאטהסטס בלי צורך באישור גישה או בהרשמה מיוחדת, והוא זמין להורדה מיידית. המידע שמור בקובץ פרקט יחיד של סט האימון, כך שמדובר במשקל קל מאוד שמתאים גם לעבודה על מחשב נייד רגיל ללא שרת ייעודי. הרשומות מחולקות לעמודות הכוללות את ההנחיה, ההקשר והתשובה. לפני שמתחילים באימון המודל, צריך לנקות ידנית סוגריים עם מספרי הפניות שמקורם בהעתקות מוויקיפדיה ומופיעים בתוך שדה ההקשר.

from datasets import load_dataset

ds = load_dataset("HuggingFaceH4/databricks_dolly_15k")

הרישיון

המאגר מופץ ברישיון ייחוס ושיתוף זהה cc-by-sa-3.0, למרות שמטא-דאטא המאגר מציג cc-by-3.0. מותר להשתמש בו לצרכים אקדמיים ומסחריים, כולל שינוי והרחבה, אך נדרש לתת קרדיט לדאטבריקס ולוויקיפדיה. תנאי השיתוף הזהה עשויים לחייב אתכם להפיץ נגזרות של הדאטהסט תחת אותו רישיון.

הרישיון המלא ב־Hugging Face ↗