GPT
T

tulu-3-sft-personas-code

קוד פתוח

allenaiרישיון לא דווח2024-10-30

מאגר סינתטי של שאלות תכנות בפייתון שמבוססות על פרסונות ותרחישים מהעולם האמיתי. הוא מיועד למי שרוצה לשפר יכולות קוד במודל שפה בלי ליפול למבנה שבלוני של תרגילי כתיבה.

  • 6,529הורדות בחודש
  • 17לייקים

מה זה

אלן אינסטיטיוט יצרו כאן 34,999 דוגמאות שנועדו לכוונון עדין של מודלים. הרעיון המרכזי מבוסס על הרחבת שיטה ממאמר של Ge et al. משנת 2024, שמשתמשת בדמויות שונות כדי לייצר שאלות תכנות מגוונות יותר. במקום לבקש סתם פונקציה שממיינת מערך, הבעיה מנוסחת מתוך צורך של בעל תפקיד או סיטואציה מוגדרת.

כל שורה במאגר מכילה מזהה ייחודי, את הפרומפט שכולל את שאלת הפייתון וההקשר של הדמות, ומערך הודעות בפורמט צ'אט סטנדרטי של משתמש ועוזר. המאגר כולל רק שפת פייתון, וכל הטקסט מסביב מנוסח באנגלית.

מתאים ל

  • אימון הוראות לקוד

    כוונון מודלי שפה על שיחות פייתון מגוונות שמשלבות תרחישים מהחיים ולא רק קטעי קוד מבודדים.

  • הערכת עמידות להקשר

    בדיקת יכולת המודל לחלץ דרישות תכנות מתוך תיאור תפקיד רחב במקום מהוראה טכנית יבשה.

  • סינון והעשרת דאטה

    שימוש במבנה הפרסונות כדי לחקור שיטות ייצור של נתוני קוד סינתטיים מורכבים יותר.

איפה זה נופל

הנתונים כולם סינתטיים וממוקדים בפייתון בלבד, כך שהם לא יעזרו למי שמחפש שפות תכנות אחרות. אין פה מילה אחת בעברית וכל השיח מתנהל באנגלית. מעבר לזה, המאמר המלא עדיין מסומן כחסר בכרטיס, מה שאומר שהפרומפטים המדויקים ששימשו לייצור הדאטה והסינון שלו לא מפורטים במלואם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

בתיאור הטקסטואלי מופיע רישיון ODC-BY שמאפשר שימוש מסחרי תחת מתן קרדיט. עם זאת, בהגדרות המאגר הרשמיות נכתב שלא דווח רישיון. לפני שמשלבים אותו במוצר מומלץ לפנות לאיש הקשר שמופיע בכרטיס כדי לקבל אישור ודאי.

האם יש כאן תמיכה בעברית או בשפות תכנות שאינן פייתון?

לא. הדאטהסט כולו באנגלית ומוקדש אך ורק לשאלות ומשימות קוד בפייתון. אין בו שפות תכנות אחרות ואין בו נתונים בשפה העברית.

איך הדאטה נאסף והאם מדובר בקוד אמיתי של מתכנתים?

המאגר יוצר באופן סינתטי לחלוטין לפי מתודולוגיה של פרסונות ותרחישים שנלקחה ממאמר מ־2024. הוא לא נאסף ממאגרי גיטהאב ציבוריים אלא נוצר על ידי מודלים כדי להרחיב את מגוון השאלות.

איך טוענים

טוענים את הנתונים ישירות דרך ספריית datasets באמצעות הנתיב של המאגר. כל המידע יושב בקובץ parquet יחיד בחלוקת train, כך שאין צורך בהרשאות מיוחדות או בהורדה מורכבת. השדות העיקריים שמעניינים אתכם לאימון הם messages שמכיל את רצף השיחה, או prompt אם אתם מעדיפים לבנות את התבנית בעצמכם.

from datasets import load_dataset

ds = load_dataset("allenai/tulu-3-sft-personas-code")

הרישיון

בכרטיס הדאטהסט המפתחים ציינו את רישיון ODC-BY, אף על פי שבמטא-דאטה הכללי של המאגר מופיע שלא דווח רישיון. רישיון ODC-BY מתיר שימוש מסחרי ושינויים בקובץ, בתנאי שנותנים קרדיט מלא למחברים. אם אתם מתכננים לאמן מודל מסחרי, כדאי לוודא את הסתירה הזו ישירות מול המפרסמים.

הרישיון המלא ב־Hugging Face ↗