GPT
T

ta-prompt

קוד פתוח

bigcodeapache-2.02023-05-03

קבצי טקסט פשוטים שמכילים שיחות מוכנות להזרקה לתוך חלון ההקשר של מודל קוד. הם נועדו להפוך מודל השלמה בסיסי לעוזר טכני אינטראקטיבי בלי שתצטרכו לאמן אותו מחדש.

  • 137הורדות בחודש
  • 200לייקים

מה זה

במאגר יש ארבעה קבצים בלבד, כולל README.md ושני קבצי טקסט בשם TA_prompt_v0.txt ו־TA_prompt_v1.txt שפורסמו במאי 2023. הם מכילים דיאלוגים מובנים בין משתמש לעוזר, מופרדים במקפים, בפורמט Human ו־Assistant. המטרה היא להדביק את הטקסט הזה ישירות לתחילת חלון ההקשר של שמונת אלפים מאה תשעים ושניים טוקנים של המודל StarCoder כדי לכוון את התשובות שלו.

התוכן מכסה כמה סוגי משימות מוגדרים. יש כאן המרה מקוד לטקסט כמו הסבר מטרת הקוד או מציאת באגים, מעבר מטקסט לקוד לכתיבת פונקציות, המרת קוד בין שפות תכנות, שאלות טקסטואליות על מושגים טכניים, וכמה שאלות כלליות על זהות העוזר. הכרטיס לא מציין מאיפה השיחות האלו נאספו, האם נכתבו ידנית בידי אדם או נוצרו במכונה, ואיזה סינון נעשה עליהן אם בכלל.

מתאים ל

  • הנחיית מודל קוד בזמן אמת

    הדבקת הטקסט בתחילת הקשר המודל כדי לייצר התנהגות של עוזר טכני בלי לאמן אותו.

  • הסבר ותרגום קוד

    שימוש בתבניות הקיימות כדי לחלץ הסברים על באגים או לתרגם קוד בין שפות שונות.

  • הדגמת מבנה לשיחות טכניות

    בסיס לכתיבת פרומפטים מותאמים אישית בפורמט של שאלות ותשובות למודלי שפה.

איפה זה נופל

זה לא סט נתונים לאימון מלא אלא אוסף דוגמאות בודדות להקשר. המפרסמים עצמם מבהירים שהמודל מיועד למשימות קוד, ולכן לא צריך לצפות ממנו לתשובות רלוונטיות לשאלות כלליות. בנוסף, חובה לבצע עיבוד נוסף לפלט הקוד לפני שמריצים ובודקים אותו כדי להימנע מטעויות. השפה המוגדרת היא קוד, אין פה שום התייחסות לשפות אחרות או לעברית, ומאחר שמקור הדוגמאות לא מפורט, קשה לדעת אילו הטיות מסתתרות בפתרונות.

שאלות
נפוצות

האם מותר להשתמש בזה במוצר מסחרי?

כן. הרישיון המדווח הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי, שינוי והפצה. התנאי העיקרי הוא שמירה על הודעת הרישיון המקורית והצהרות זכויות היוצרים.

כמה המאגר הזה שוקל?

הוא זעיר. המאגר כולל ארבעה קבצים בלבד, מתוכם שני קבצי טקסט פשוטים של פרומפטים וקובץ הסבר. ההורדה לוקחת שניות בודדות ולא דורשת שטח אחסון מיוחד.

האם יש במאגר תמיכה בעברית?

לא. שפת המאגר מוגדרת כקוד, וכל הדוגמאות וההנחיות בכרטיס כתובות באנגלית בלבד. אם תרצו לתת הנחיות בעברית, תצטרכו לתרגם או לכתוב פרומפטים דומים בעצמכם.

איך הנתונים נאספו?

תיעוד המאגר לא מספק מידע על מקור השיחות. לא כתוב האם צוות הפרויקט כתב אותן בעצמו, הוציא אותן ממאגר קיים, או ייצר אותן בעזרת מודל אחר, ולכן יש לבדוק את התוכן ידנית לפני השימוש.

איך טוענים

אין כאן טבלאות של parquet או מבנה של ספריית datasets. אתם פשוט מורידים את קבצי ה־txt ישירות מהמאגר וקוראים אותם כטקסט גולמי. הגישה חופשית לגמרי ואין צורך לבקש אישור מיוחד. כדי להשתמש בזה, פשוט משרשרים את תוכן הקובץ לפני השאלה של המשתמש בתוך הפרומפט ששולחים למודל.

from datasets import load_dataset

ds = load_dataset("bigcode/ta-prompt")

הרישיון

הרישיון המדווח הוא Apache 2.0. הרישיון הזה מתיר שימוש מסחרי ומאפשר לכם לשנות את הקבצים ולשלב אותם במערכות שלכם. אין חובה לשתף פרויקטים נגזרים תחת אותו רישיון, אך יש לשמור על הודעות זכויות היוצרים והרישיון המקוריות. אם אתם משתמשים בזה כפרומפט בתוך מוצר מסחרי, הרישיון לא מגביל אתכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗