GPT
L

licenses

קוד פתוח

choosealicensemit2024-04-17

אוסף טקסטי מקור של רישיונות קוד פתוח נפוצים בפורמט מרקדאון. מתאים למי שבונה כלי לבדיקת תאימות רישיונות או סיווג מסמכים משפטיים.

  • 14,048הורדות בחודש
  • 58לייקים

מה זה

המאגר כולל 49 קבצים בסך הכל, שמרכזים נוסחים של רישיונות תוכנה מוכרים כמו אפאצ'י, סוגי בי.אס.די שונים, רישיונות גנו, קריאייטיב קומונס ונוסחים נוספים. המקור של הנתונים הוא הפרויקט הפתוח choosealicense.com של גיטהאב, שמסביר ומציג רישיונות בצורה נגישה למפתחים ברשת.

כל רשומה במאגר מאוחסנת כקובץ מרקדאון נפרד בתוך תיקיית ייעודית בשם markdown, כאשר שם הקובץ תואם למזהה הרישיון המקובל בתעשייה, כמו mit או apache-2.0. הדף לא מפרט תהליכי סינון מורכבים, חלוקה מובנית לקבוצות אימון ובדיקה או שדות מטא-דאטה מיוחדים. מדובר פשוט בהעתקה ישירה של קובצי הטקסט מתוך הריפו של גיטהאב אל תוך מאגר נתונים פשוט.

מתאים ל

  • זיהוי רישיונות בקוד

    בדיקת התאמה בין קובצי רישיון לא מוכרים במאגרים לבין הנוסח המקורי.

  • אימות טקסטואלי במערכות CI

    בדיקה אוטומטית שפרויקט כולל נוסח רישיון מלא ותקין לפני הפצה.

  • הערכת מודלים משפטיים

    בחינת היכולת של מודל קטן לזהות תנאי הפצה לפי טקסט משפטי מלא.

איפה זה נופל

זה לא מאגר ענק שמתאים לאימון מודל שפה מאפס, אלא אוסף קטנטן של נוסחי רישיונות בלבד. כל הטקסטים הם בשפה האנגלית, ואין פה ייצוג לשפות אחרות או התאמות לחוק הישראלי. מעבר לזה, המאגר עודכן באפריל 2024 ומכיל רשימה מוגדרת של כמה עשרות רישיונות בלבד, כך שאם אתם מחפשים רישיונות קנייניים, גרסאות ישנות במיוחד או ניסוחים משפטיים מותאמים אישית, לא תמצאו אותם כאן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון המדווח הוא mit. הרישיון הזה מתיר שימוש מסחרי חופשי, בתנאי ששומרים על הודעת הרישיון המקורית של הפרויקט.

כמה המאגר הזה שוקל?

הנפח כמעט אפסי. יש בו 49 קובצי טקסט קצרים בפורמט מרקדאון, כך שהורדה ועיבוד לוקחים שבריר שנייה.

האם יש במאגר רישיונות או תרגומים בעברית?

לא. כל הנתונים נלקחו מהפרויקט של גיטהאב והם כוללים אך ורק את נוסחי הרישיונות הרשמיים בשפה האנגלית.

מאיפה הנתונים האלה הגיעו?

הטקסטים נמשכו ישירות ממאגר הגיטהאב הפתוח של choosealicense.com. הם מייצגים את הרישיונות הנפוצים ביותר בעולם הקוד הפתוח.

איך טוענים

אין פה צורך באישורי גישה או הגדרות מיוחדות, פשוט מושכים את הקבצים ישירות מהמאגר. הנתונים שמורים כקובצי מרקדאון וטקסט רגיל, ובכרטיס עצמו מצורפת פקודת באש שמסבירה איך לשנות את הסיומת של קובצי טקסט אם צריך לעבד אותם כמרקדאון. בגלל שמדובר בעשרות בודדות של קבצים טקסטואליים, הנפח הכולל זניח לחלוטין ואפשר לטעון את כל התוכן ישירות לזיכרון בלי לחשוב פעמיים.

from datasets import load_dataset

ds = load_dataset("choosealicense/licenses")

הרישיון

המאגר מופץ תחת רישיון mit. מותר להשתמש בו לצרכים מסחריים, לשנות את הנתונים ולשלב אותם בכל פרויקט או אימון, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורית. אין כאן דרישה להפיץ את התוצרים באותו הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא ב־Hugging Face ↗