GPT
J

JavaScript-Code-Large

קוד פתוח

ajibawa-2023mit2026-02-18

  • code
  • javascript

מאגר ממוקד של מעל חמישה מיליון קובצי ג'אווהסקריפט נקיים מתערובת של שפות אחרות. הוא נבנה עבור מי שרוצה לאמן מודלי שפה ייעודיים לקוד צד לקוח ושרת בלי לסנן דאטה רב-לשוני.

  • 4,196הורדות בחודש
  • 33לייקים

מה זה

המאגר מכיל קוד מקור בפורמט ג'אווהסקריפט בלבד, ומיועד למשימות של יצירת טקסט ואימון מודלים. בפנים תמצאו מעל חמישה מיליון קבצים המכסים מגוון רחב של מבנים תחביריים בשפה: פונקציות חץ, מחלקות ופרוטוטייפים, ניהול מודולים מסוג CommonJS ו־ES Modules, דפוסי קוד אסינכרוני, מניפולציות של ה־DOM, לוגיקת צד שרת ב־Node.js, רכיבי ממשק משתמש, הערות JSDoc ומאפיינים מודרניים של תקן ES6 והלאה.

התוכן מחולק לקובצי jsonl מרובים ששמותיהם ממוספרים, כגון java_script_only_0000.jsonl והלאה, מתוך סך של 73 קבצים שנמצאים במאגר. הדאטהסט לא כולל פיצול רשמי ומובנה לסטים של אימון, בדיקה ואימות, כך שאת החלוקה תצטרכו לעשות בעצמכם בהתאם לצרכי המחקר או הפיתוח.

הכרטיס מציג את התוכן כהשלמה למאגר מקביל של שפת ג'אווה לצורך מחקר השוואתי, אך הוא אינו מפרט את מקורות הגרידה המדויקים של הקבצים, האם הגיעו מגיטהאב או ממאגרים ציבוריים אחרים, או אילו שלבי ניקוי וסינון של כפילויות בוצעו על הקוד בפועל.

מתאים ל

  • אימון מודל שפה ייעודי לקוד

    אימון של מודלי בסיס או המשך אימון למודל קיים על מיליוני דוגמאות תחביר ג'אווהסקריפט עדכני.

  • כלי השלמת קוד ל־IDE

    התאמת מודלים קטנים יותר למשימות של השלמת שורות קוד, סגירת פונקציות וזיהוי תבניות בצד לקוח ושרת.

  • מחקר השוואתי בין שפות

    ביצוע ניתוחים אמפיריים ומחקרי מעבר ידע מול דאטהסטים מקבילים בשפות מונחות עצמים אחרות.

איפה זה נופל

הבעיה המרכזית כאן היא שקיפות המקורות. הכרטיס לא מסביר מהיכן הקוד נאסף, האם הוסרו ספריות חיצוניות מקובצות (minified code) או קוד משוכפל, ואיך נופו סיכוני אבטחה או סיסמאות שעלולות להיות מוטמעות בקוד מקור פתוח. שפת התיעוד היא אנגלית בלבד, כך שלא תמצאו כאן כמעט הערות קוד בעברית, והאיסוף מבוסס קבצים ולא פרויקטים שלמים, מה שמקשה על ניתוח תלויות מורכב. לפני שמאמנים עליו מודל שייכנס למוצר אמיתי, חייבים לבצע סינון ידני של איכות, לבדוק כפילויות ולוודא שהקוד אינו כולל חולשות אבטחה ידועות שעלולות לחלחל למודל שלכם.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

כן, המאגר מסומן תחת רישיון MIT, שמתיר שימוש מסחרי מלא, כולל אימון מודלים המשולבים במוצרים סגורים. התנאי היחיד הוא שמירת הודעת הרישיון וזכויות היוצרים המקוריות של המפרסם בתיעוד הפרויקט שלכם.

האם הדאטהסט כולל קוד עם הערות בעברית?

המאגר מוגדר רשמית בשפה האנגלית, ורוב הקוד הפתוח בעולם נכתב באנגלית. ייתכן שקיימות הערות בודדות בשפות אחרות אם הן נאספו ממאגרים שונים, אך אין להסתמך עליו לצורך הבנה או יצירה של הערות ותיעוד בעברית.

מאיפה נאספו חמשת מיליון הקבצים?

דף המאגר אינו מפרט את מקור האיסוף, את המאגרים הספציפיים שנסרקו או את שיטות הסינון שהופעלו עליהם. הדבר היחיד שמצוין הוא שמדובר בקובצי ג'אווהסקריפט המכסים מגוון פרדיגמות, כך שחובת בדיקת האיכות וההתאמה חלה עליכם.

איך המאגר מאורגן טכנית להורדה?

המאגר מורכב מ־73 קבצים בסך הכל, שעיקרם קובצי jsonl המחזיקים את נתוני הקוד. אין חלוקה מובנית לחלקי אימון ומבחן, ולכן מומלץ להוריד קובץ יחיד תחילה כדי לבדוק את מבנה הנתונים לפני משיכת כל הקבצים.

איך טוענים

טוענים את המאגר ישירות דרך ספריית datasets או על ידי הורדה של 73 קובצי ה־jsonl שנמצאים במאגר. אין צורך באישור גישה מוקדם או בהמתנה להרשאות מיוחדות, הגישה פתוחה לחלוטין. בגלל שמדובר ביותר מחמישה מיליון קבצים המחולקים בין עשרות קובצי jsonl גדולים, כדאי לעבוד בשיטת streaming במקום לטעון את כל הנפח ישירות לזיכרון העבודה שלכם. מבנה הרשומות מבוסס על קובצי קוד, אך הכרטיס לא מציין שמות שדות ספציפיים מעבר לחלוקת הקוד עצמו, ולכן מומלץ לקרוא שורה אחת לדוגמה מתוך הקובץ הראשון לפני שמריצים פייפליין מלא של עיבוד ואימון.

from datasets import load_dataset

ds = load_dataset("ajibawa-2023/JavaScript-Code-Large")

הרישיון

המאגר מפורסם תחת רישיון MIT. זהו רישיון מתירני שמאפשר שימוש מסחרי, שינוי של המידע, הפצה מחדש ואימון מודלים ללא דרישה לשתף את הקוד הנגזר תחת אותו הרישיון, כל עוד שומרים על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗