GPT
Z

zed-industries/zeta

קוד פתוח

zed-industriesapache-2.02024-11-27

  • code

מאגר נתונים פתוח מבית עורך הקוד Zed שמכיל דוגמאות לחיזוי עריכת הקוד הבאה של המפתח. הוא נבנה במקור כדי לאמן מודל מבוסס מיקום סמן ודפוסי עבודה שמשלים עריכות בלחיצת טאב.

  • 7.6Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 2,475הורדות בחודש

מה זה

המאגר כולל 617 קבצים ומחולק לשלושה חלקים עיקריים שנועדו לשלבי אימון שונים. החלק הראשון שמור בקובץ train.jsonl ומרכז דוגמאות לאימון מונחה רגיל, החלק השני נמצא בתוך dpo.jsonl ומיועד לאופטימיזציית העדפות ישירה, והחלק השלישי הוא eval.jsonl שמשרת הערכת ביצועים. הנתונים האלה נוצרו במקור מתוך קובצי מרקדאון שיושבים בתיקיות המאגר, כמו ספריית dpo שמכילה קבצים ממוספרים.

תהליך האיסוף והעיבוד נשען על כמה שלבים פנימיים שמתועדים בסקריפטים המצורפים. לפי התיעוד, תחזיות נמשכו ממאגר Snowflake ועברו בדיקה אנושית ידנית בעזרת שרת ווב מקומי, שבו בודק אישר דוגמאות טובות והעביר אותן לתיקיית האימון או פסל אותן לפח. בנוסף, המפתחים השתמשו בבוחן חיצוני דרך ממשק ה־API של חברת Anthropic כדי להדביק תוויות על הנתונים באופן אוטומטי, לפני שקובצי המרקדאון עברו אימות ונארזו לקובצי ה־JSONL הסופיים.

מתאים ל

  • אימון השלמת עריכות קוד

    שימוש בקובצי ה־JSONL כדי לאמן מודלים על חיזוי הצעד הבא של מתכנת בעורך.

  • כוונון מודלים בשיטת DPO

    הפעלת מחברת ה־DPO על קובץ dpo.jsonl לצורך התאמת העדפות במודלי פיתוח.

  • הערכת מודלי תכנות

    בדיקת ביצועים של מודלי שפה לעריכת קוד מול סט הנתונים שבקובץ eval.jsonl.

איפה זה נופל

התיעוד מודה במפורש בחלק מתהליך הסינון שמודל השפה של אנתרופיק לא תמיד החזיר תוויות בפורמט הנדרש, ולכן חלק מהדוגמאות נשארו ללא תיוג ומצריכות בדיקה נוספת. המאגר מותאם באופן צר למשימה של חיזוי העריכה הבאה בעורך Zed, כך שהוא מניח קשר הדוק למיקום סמן ודפוסי עבודה ספציפיים. אין בתיעוד פירוט לגבי שפות התכנות שנכללות בו, מגוון הפרויקטים או תמיכה בעברית בהערות קוד, ולכן מי שמתכנן לאמן עליו מודל רחב חייב לבדוק את התפלגות הטקסט בפועל.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט הזה במוצר מסחרי?

כן, המאגר מפורסם תחת רישיון Apache 2.0 המאפשר שימוש מסחרי חופשי לחלוטין. מותר לאמן עליו מודלים מסחריים פנימיים או מוצרים שנמכרים ללקוחות. הדרישה העיקרית היא לשמור על תנאי הייחוס והעתק הרישיון המקורי.

האם המאגר כולל תמיכה בקוד עם הערות בעברית?

כרטיס המאגר לא מפרט אילו שפות תכנות או שפות טבעיות נכללות בתוכו. הנתונים מיועדים במקור להשלמת קוד באנגלית ולדפוסי עריכה טכניים, ולכן סביר להניח שאין בו כמעט טקסט בעברית. מומלץ לסרוק את קובצי ה־JSONL לפני שמסתמכים עליו בהקשר מקומי.

איך נאספו וסוננו הנתונים בדאטהסט?

הנתונים מבוססים על תחזיות שנשלפו ממאגר Snowflake של צוות Zed. משם הם עברו אימות ידני באמצעות ממשק ווב ייעודי שחילק אותם לדוגמאות מאושרות או דחויות, לצד תיוג אוטומטי שבוצע באמצעות ממשק ה־API של Anthropic.

איזה מודל אומן על הנתונים האלה במקור?

הדאטהסט שימש לאימון Zeta, מודל מותאם אישית שנגזר מ־Qwen2.5-Coder-7B. המטרה שלו היא לספק למשתמשי העורך הצעות עריכה חכמות על בסיס היסטוריית העבודה שלהם ומיקום הסמן.

איך מריצים

המאגר ציבורי ופתוח להורדה ישירה מ־Hugging Face בלי צורך בהרשאה מקדימה. הנתונים זמינים בקובצי JSONL שמיועדים לטעינה נוחה בספריות אימון, לצד קובצי המקור בפורמט מרקדאון. כדי להריץ את סקריפטי העיבוד והסינון צריך סביבת פייתון עם חבילות כמו fastapi ו־uvicorn, ואם רוצים להפעיל את תיוג הנתונים מחדש נדרש גם מפתח גישה לחשבון Anthropic. בנוסף מצורפות במאגר מחברות Jupyter ייעודיות לתהליכי האימון וה־DPO.

pip install -U huggingface_hub
hf download zed-industries/zeta

הרישיון

המאגר מופץ תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של הנתונים והפצה מחודשת שלהם. מותר לאמן עליו מודלים מסחריים בלי חובה לפתוח את הקוד שלכם, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗