GPT
G

google-code-archive

קוד פתוח

nyuuzyouother2026-01-09

  • code
  • google-code
  • archive

המאגר מרכז קוד מקור ממאות אלפי פרויקטים ישנים שאוחסנו בגוגל קוד עד סגירתו. הוא שימושי למי שרוצה לאמן מודלים על ספריות עבר, דפוסי פיתוח היסטוריים וקוד שנכתב לפני עידן גיטהאב הנוכחי.

  • 650הורדות בחודש
  • 73לייקים

מה זה

הנתונים נשלפו מתוך ארכיון הפרויקטים הציבורי של גוגל קוד שפעל בשנים 2006 עד 2016, לפי רשימת מזהים שמקורה במיזם Archive Team. מתוך המאגרים הורדו רק פרויקטים שכללו קוד זמין ושנפח הארכיון שלהם לא עלה על 64 מגה בייט. כל קובץ מקור נבדק באמצעות go-enry לשם סיווג שפת התכנות, ונשמרו אך ורק קובצי קוד ומרקאפ בקידוד טקסט תקין. פרויקטים שהכילו רק תיעוד הושמטו לחלוטין.

רשומת נתונים בודדת מייצגת קובץ קוד בודד ומכילה את תוכן הטקסט, שם הפרויקט, הנתיב היחסי, השפה שזוהתה, סוג הרישיון המקורי וגודל הקובץ בבייטים. הסינון הטכני ניקה ספריות תלויות וספקים כמו node_modules או vendor, קובצי נעילה, תוצרי בנייה, קבצים בינאריים, קוד ממוזער ושורות החורגות מאורך של אלף תווים. כמו כן נזרקו קבצים בעלי סממני יצירה אוטומטית בחמש מאות הבייטים הראשונים. כל המידע יושב בפיצול יחיד של אימון ללא חלוקה מוגדרת למבחן או אימות.

מתאים ל

  • אימון מודלים על שפות מורשת

    לימוד תחביר וספריות ישנות של Java ו־PHP מפרויקטים שפעלו בשנים 2006 עד 2016.

  • זיהוי פגיעויות היסטוריות

    בדיקת כלי ניתוח סטטי ומודלים לאיתור חולשות אבטחה ידועות בקוד legacy אמיתי.

  • מחקר על התפתחות קוד פתוח

    ניתוח מגמות של רישיונות, מבני פרויקטים ושפות תכנות פופולריות בעשור הראשון של המאה.

איפה זה נופל

הקוד במאגר נכתב בין 2006 ל־2016 ומשקף שפות, פרקטיקות וספריות ישנות, כמו פייתון 2 או גרסאות עבר של ג'אווה ו־PHP. יש בו סיכון גבוה לחולשות אבטחה ידועות, שימוש ב־APIs שכבר בוטלו ודפוסים שלא מקובלים בפיתוח מודרני. פרויקטים גדולים הוחרגו בגלל תקרת 64 מגה בייט לארכיון, כך שאין כאן ייצוג למערכות ענק מאותה תקופה. בנוסף, לא נעשה ניקוי של מידע רגיש, ולכן תמצאו שם כתובות מייל בהערות ואף מפתחות API וסיסמאות שנשמרו בטעות במקור.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח מוצר מסחרי?

הדבר תלוי באופן שבו אתם מסננים את הנתונים. המאגר מכיל פרויקטים ברישיונות שונים, החל מרישיונות מתירניים שמתאימים למסחר כמו MIT ו־Apache 2.0, ועד רישיונות הדורשים שיתוף זהה כמו GPL. עליכם להשתמש בשדה הרישיון כדי להשאיר רק קוד שמותר לשימוש מסחרי.

כמה מקום בדיסק נדרש כדי לעבוד עם הנתונים?

הקבצים המכווצים בפורמט Parquet תופסים 47 גיגה בייט ב־71 קבצים. בזמן פריסה וטעינה של הטקסט עצמו לזיכרון או שמירתו בצורה לא דחוסה, תזדקקו למקום פנוי גדול בהרבה, שכן מדובר בעשרות מיליוני קובצי מקור.

האם יש במאגר תמיכה או קוד בעברית?

שפות התוכן המוגדרות הן קוד ואנגלית בלבד. ייתכן שתמצאו הערות קוד או מחרוזות בעברית בתוך פרויקטים מקומיים שהועלו לגוגל קוד, אך לא נעשה סינון או תיוג ייעודי עבור עברית.

במה הוא שונה ממאגרי קוד מודרניים כמו The Stack?

ההבדל המרכזי הוא חלון הזמן ומקור המידע. בעוד מאגרים מודרניים סורקים את גיטהאב העדכני ומכילים טכנולוגיות עכשוויות, כאן מדובר בתמונת מצב קפואה של גוגל קוד שנסגר ב־2016, עם דגש חזק על Java ו־PHP ישנות וללא פרויקטים מודרניים.

איך טוענים

המאגר מגיע כקובצי Parquet דחוסים באלגוריתם Zstd, המחולקים ל־71 חלקים בנפח כולל של 47 גיגה בייט. אין צורך בבקשת גישה מיוחדת או אישור מקדים כדי להוריד אותו. בעת טעינת הנתונים למודל, השדות העיקריים לעבודה הם code שמכיל את הטקסט המלא, ו־language שמאפשר לפלטר את 454 השפות שזוהו. שדה ה־license קריטי לסינון לפני תחילת האימון כדי להימנע מהפרת זכויות יוצרים.

from datasets import load_dataset

ds = load_dataset("nyuuzyou/google-code-archive")

הרישיון

הרישיון הכללי מוגדר בתור רישיון אחר, מכיוון שהמאגר הוא אוסף של פרויקטים שונים שכל אחד מהם פורסם במקור תחת תנאים משלו. יש בפנים מיליוני קבצים תחת רישיונות מתירניים כמו Apache 2.0 ו־MIT, לצד קוד רב ברישיונות מדביקים מסוג GPL v2 ו־v3, קוד מנחלת הכלל וקוד ללא הגדרה ברורה. מי שמאמן מודל לשימוש מסחרי חייב לסנן מראש את הרשומות לפי שדה הרישיון ולהישמע לתנאי הייחוס של הפרויקט המקורי.

הרישיון המלא ב־Hugging Face ↗