GPT
L

linux-commands

קוד פתוח

missvectorapache-2.02025-11-26

  • linux
  • shell
  • commands
  • terminal
  • multilingual

מאגר סינתטי שממפה תיאורים בשפה טבעית לפקודות מעטפת של לינוקס בעשר שפות שונות. הוא מיועד למי שרוצה לאמן מודלים לתרגום הוראות טקסט ישירות לפקודות טרמינל, כולל כלי פיתוח וניהול שרתים.

  • 319הורדות בחודש
  • 97לייקים

מה זה

המאגר מכיל בין עשרת אלפים למאה אלף רשומות שמחברות בין בקשה בשפה חופשית לבין פקודת של מתאימה. הנתונים סינתטיים ומכסים משימות כמו ניהול קבצים, פקודות של Arch Linux, עבודה עם Git, פריסות בתוך Docker וניהול שוטף של מערכות הפעלה. אין כאן תיעוד של איסוף ממשתמשים אמיתיים בטרמינל אלא תוכן שנוצר ועבר עריכה מראש.

המבנה בקבצים מחולק לפי שפות וכולל פיצול מובנה לחלקי אימון, בדיקה ואימות בפורמט פרקט. השדות ברשומות מציגים את התיאור בשפה הנבחרת ואת הפקודה התואמת תחת שדה ההשלמה, מה שמאפשר להזין אותם ישירות לתהליכי פיין טיונינג של מודלי שפה.

מתאים ל

  • אימון עוזר אישי לטרמינל

    פיין טיונינג למודל שמקבל הוראה באנגלית ופולט פקודת יוניקס תואמת.

  • תרגום פקודות רב לשוני

    בניית ממשק שממיר בקשות בשפות כמו ערבית, רוסית וספרדית לפקודות מעטפת.

  • אוטומציה של Git ו־Docker

    התאמת מודלים להשלמת פקודות עבודה נפוצות בתהליכי פיתוח ותשתיות.

איפה זה נופל

הנתונים כולם סינתטיים, מה שאומר שהם עלולים להכיל הזיות או פקודות שלא עובדות בתרחישי קצה. היוצרת מציינת מפורשות שאין להריץ את הפקודות בסביבות ייצור ללא בדיקה מקדימה, כי פקודה שגויה אחת יכולה למחוק שרת. בנוסף, עברית חסרה לחלוטין מתוך עשר השפות הנתמכות, כך שלמשתמש ישראלי המאגר רלוונטי רק בפניות באנגלית או בשפות זרות אחרות.

שאלות
נפוצות

האם מותר להשתמש במאגר לפרויקטים מסחריים?

כן, רישיון apache 2.0 מתיר שימוש מסחרי מלא. אתם יכולים לאמן עליו מודלים מסחריים בלי לפתוח את הקוד שלכם. חובה רק לתת קרדיט ליוצרת ולצרף את נוסח הרישיון המקורי.

האם המאגר כולל עברית?

לא, עברית לא נכללת ברשימת השפות של המאגר. הוא מכיל עשר שפות אחרות ובהן אנגלית, ערבית, רוסית, גרמנית וצרפתית. לפרויקט בעברית תצטרכו לתרגם את הנתונים באופן עצמאי.

מאיפה הגיעו הנתונים של הפקודות?

הנתונים לא הוקלטו משרתים אמיתיים אלא נוצרו בצורה סינתטית מובנית. הם עברו סידור ועריכה כדי לכסות נושאים כמו קבצים, דוקר וארץ' לינוקס. בגלל המקור הסינתטי חובה לבדוק כל פקודה לפני הרצה.

כמה רשומות יש במאגר ואיך הוא שמור?

המאגר כולל בין עשרת אלפים למאה אלף רשומות בסך הכל. המידע מחולק על פני שלושים וחמישה קבצים בפורמט פרקט. החלוקה הפנימית מופרדת לפי תיקיות של שפות ופיצולים של אימון ובדיקה.

איך טוענים

טוענים אותו בספריית datasets הרגילה עם הנתיב missvector/linux-commands בלי צורך באישור גישה מיוחד. המאגר שוקל מעט יחסית ומחולק לשלושים וחמישה קבצי פרקט לפי שפות וחלוקות דאטה. בעבודה השוטפת ניגשים ישירות לשדה הטקסט לפי השפה המבוקשת ולשדה ההשלמה completion שמחזיק את הפקודה עצמה.

from datasets import load_dataset

ds = load_dataset("missvector/linux-commands")

הרישיון

המאגר מופץ תחת רישיון apache 2.0 המאפשר שימוש מסחרי ומחקרי חופשי. מותר לערוך את הנתונים, להפיץ אותם מחדש ולאמן עליהם מודלים בלי לחייב פתיחה של הקוד שלכם. הדרישה העיקרית היא מתן קרדיט ליוצרת המקורית ושמירה על תנאי הרישיון והודעות זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗