GPT
X

xlcost-text-to-code

קוד פתוח

codeparrotcc-by-sa-4.02022-07-13

המאגר מרכז תיאורים באנגלית ותרגומי קוד מקבילים בשבע שפות תכנות, ברמת קטעים קצרים ותוכניות מלאות. הוא מיועד למי שרוצה לאמן או לבחון מודלים של יצירת קוד מטקסט עם יישור ישיר בין שפות.

  • 1,629הורדות בחודש
  • 51לייקים

מה זה

הרשומות בנויות מזוגות של תיאור מילולי באנגלית מול קוד תואם, בשבע שפות: פייתון, ג'אווה, ג'אווהסקריפט, סי, סי פלוס פלוס, סי שארפ ו־PHP. המאגר מציע שתי רמות פירוט. ברמת המקטעים יש קטעי קוד ממוקדים עם ההערה המקורית שלהם, וברמת התוכנית שרשרו את כלל ההערות לכדי תיאור אחד ארוך שמתאים לתוכנית המלאה. התיאורים זהים ומיושרים בין כל השפות עבור אותם המקטעים.

הקוד עצמו עבר טוקניזציה מוקדמת שמורגשת מיד בנתונים. ירידות שורה מוחלפות במחרוזת ייעודית, ויש סימונים מפורשים להזחה וביטול הזחה, לצד רווחים בין אופרטורים וסוגריים. הכרטיס לא מפרט את המקור המדויק שממנו נגרדו התוכניות המקוריות או אילו מנגנוני סינון הופעלו, ומפנה למאמר הבנצ'מרק הרחב יותר.

מתאים ל

  • הערכת מודלים לכתיבת קוד

    בדיקת ביצועים השוואתית של מודלים שמייצרים קוד מתיאור מילולי באנגלית מול קבוצות מבחן קבועות מראש.

  • אימון ייצור קוד רב לשוני

    כוונון עדין של מודל קוד שמקבל הנחיות באנגלית ומייצר פתרונות בשבע שפות תכנות שונות במקביל.

  • מחקר על יישור מקטעים

    ניתוח האופן שבו מודלים מתמודדים עם תרגום אותו תיאור מילולי מדויק לתחבירים שונים.

איפה זה נופל

הקוד לא נשמר כטקסט גולמי רגיל אלא עם סימונים כמו רווחים סביב תווים ותגיות במקום רווחים וירידות שורה. אם המודל שלכם מצפה לתחביר טבעי, תצטרכו לכתוב תהליך ניקוי שיחזיר את הקוד למבנה נורמלי לפני האימון. כל ההסברים כתובים באנגלית בלבד, ואין פה עברית בכלל. בנוסף, התיאורים ברמת התוכנית מורכבים משרשור מלאכותי של הערות קוד קצרות, מה שמייצר ניסוח מקוטע שלא תמיד דומה לפרומפטים שמשתמשים כותבים במציאות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הרישיון מאפשר שימוש מסחרי עקרונית, אך כולל סעיף שיתוף זהה. המשמעות היא שכל יצירה נגזרת חייבת להשתחרר תחת אותו הרישיון הפתוח, מה שמקשה מאוד על שילוב במערכות קנייניות סגורות.

האם יש במאגר תמיכה בעברית?

לא. כל הטקסטים המילוליים וההערות כתובים באנגלית בלבד, לצד הקוד בשבע השפות הנתמכות.

מדוע הקוד מלא במילים כמו NEW_LINE?

הנתונים עברו עיבוד מקדים שפירק מילים והמיר תווי רווח, טאבים וירידות שורה לטוקנים מילוליים. כדי להריץ את הקוד או לבדוק אותו מול קומפיילר, תצטרכו להמיר את המחרוזות האלה בחזרה לרווחים אמיתיים.

כמה דוגמאות יש בכל קובץ?

הגודל משתנה לפי השפה והרמה. בדוגמה שבתיעוד, עבור תוכניות פייתון מלאות, קובץ האימון כולל 9,263 רשומות, המבחן כולל 887, והאימות 472.

איך טוענים

טוענים את המאגר ישירות דרך הספרייה הרגילה של Hugging Face בלי צורך באישור גישה או מפתחות. חובה להגדיר תת מאגר מתוך 14 האפשרויות, לפי שפת התכנות ורמת הפירוט, כשברירת המחדל היא מקטעי פייתון. הנתונים שמורים בקובצי JSON עם חלוקה מובנית לאימון, בדיקה ואימות, ומכילים שני שדות פשוטים: שדה התיאור ושדה הקוד המעובד.

from datasets import load_dataset

ds = load_dataset("codeparrot/xlcost-text-to-code")

הרישיון

המאגר מופץ תחת רישיון CC-BY-SA 4.0 שמתיר שימוש מסחרי ומחקר, אבל דורש מתן קרדיט ושיתוף זהה. הדרישה הזו בעייתית במיוחד לפיתוח מוצרים סגורים, כי היא עלולה לחייב אתכם להפיץ נתונים מעובדים או מודלים שנגזרו ממנו תחת אותו הרישיון בדיוק.

  • שימוש מסחרי
  • שינוי הקוד
  • חובת שיתוף באותו רישיון

הרישיון המלא ב־Hugging Face ↗