GPT
S

swallow-code-v2

קוד פתוח

tokyotech-llmapache-2.02025-10-20

  • code

קורפוס של 49.8 מיליארד תוקנים של קוד פייתון משוכתב ומעוצב, שמיועד לאימון מודלי שפה. הוא נבנה כדי לתת חלופה חופשית תחת אפאצ'י לדאטהסטים קודמים שהיו מוגבלים ברישיון או בגודל.

  • 10,120הורדות בחודש
  • 44לייקים

מה זה

המאגר מבוסס על קוד מקור שנלקח מתוך The-Stack-v2 ועבר שרשרת עיבוד של חמישה שלבים. הצינור כלל עיצוב ראשוני בעזרת ruff, סינון לפי אורך הטקסט, ודירוג איכות בסולם של אפס עד עשר בעזרת פרומפט מבוסס SeedCoder. במקום לשמור את הקוד הגולמי, היוצרים השתמשו במודל Qwen3-235B-A22B-Instruct כדי לשכתב את הקטעים לרמת בהירות ומבנה אלגוריתמי גבוהים יותר, ולאחר מכן העבירו הכל עיצוב סופי נוסף.

מבנה התיקיות משקף את שלבי העיבוד השונים, מ־stage1 ועד stage5. הגרסה הסופית של המאגר יושבת תחת התקייה של שלב 5 ומתמקדת בקוד שסווג במקור כאיכות בינונית, משום שבניסויים המקדימים של הצוות שכתוב של קוד כזה הניב ביצועים עדיפים במבחני קוד על פני קוד שדורג מלכתחילה כאיכותי מאוד.

מתאים ל

  • קדם-אימון מודלי קוד

    אימון מקדים או המשך אימון של מודלי שפה על עשרות מיליארדי תוקנים של פייתון סינתטי ומעוצב.

  • כוונון עדין למשימות פייתון

    שיפור היכולת של מודל קיים לפתור בעיות אלגוריתמיות ולייצר פונקציות ברורות ונקיות מתחביר בעייתי.

  • מחקר על שכתוב קוד בלמידה

    השוואת ביצועים בין שלבי עיבוד שונים, החל מקוד גולמי מעוצב ועד קוד משוכתב במלואו.

איפה זה נופל

התכנון המקורי של הפרויקט נועד לכלול 13 שפות תכנות, אבל אילוצי משאבים וכוח מחשוב הביאו לצמצום המאגר לפייתון בלבד, כך שהוא לא יעזור למי שמאמן מודל רב-לשוני. שפת הטקסט וההערות היא אנגלית, ואין כאן עברית כלל. מעבר לכך, כל הקוד שוכתב מחדש על ידי מודל שפה, מה שעלול ליצור אחידות יתר בסגנון הכתיבה ולמחוק דפוסים שמופיעים בקוד אמיתי ומבולגן של מפתחים. בנוסף, ההחלטה להתמקד בקוד מקור מאיכות בינונית עבדה טוב על HumanEval, אבל לא בטוח שהיא מייצגת פרויקטים ארכיטקטוניים מורכבים.

אותה משפחה

swallow-code יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש בדאטהסט לפיתוח מוצר מסחרי?

כן, הרישיון הוא Apache 2.0 שמתיר שימוש מסחרי מלא. עם זאת, היוצרים מציינים שהשימוש כפוף גם לתנאי הרישיון של The-Stack-v2 שממנו נאסף הקוד המקורי, ולכן מומלץ לבדוק אותם לפני שילוב במוצר.

האם יש בדאטהסט תמיכה בעברית?

לא, הדאטהסט כולל קוד פייתון באנגלית בלבד. שפת המקור וההערות שנכתבו הן באנגלית, ולא נכללו שפות טבעיות אחרות.

באילו שפות תכנות מדובר?

בפועל המאגר הסופי מכיל רק פייתון. התוכנית המקורית הייתה לכלול 13 שפות תכנות, אך בשל מגבלות שעות GPU של צוות המחקר שאר השפות בוטלו.

מה ההבדל בין גרסה זו לגרסה הראשונה?

גרסה זו מציעה 49.8 מיליארד תוקנים לעומת 16.1 מיליארד בגרסה הקודמת. בנוסף, הרישיון שונה מ־Llama 3.3 ל־Apache 2.0, ושכתוב הקוד בוצע באמצעות Qwen3-235B-A22B-Instruct במקום המודל הקודם.

איך טוענים

הנתונים מפוצלים לקובצי jsonl רבים לפי שלבי העיבוד והשפות, עם 1,483 קבצים בסך הכל במאגר. אין צורך לבקש אישור גישה מיוחד כדי להוריד את הקבצים, והם זמינים ישירות מ־Hugging Face. אם אתם מתכננים אימון מלא, שימו לב שמדובר בעשרות מיליוני רשומות שמחזיקות כמעט 50 מיליארד תוקנים, כך שתצטרכו תשתית אחסון מקומית רחבה ורוחב פס מתאים לפני שמורידים את כל שלב 5 למכונה.

from datasets import load_dataset

ds = load_dataset("tokyotech-llm/swallow-code-v2")

הרישיון

המאגר מופץ תחת רישיון Apache 2.0, שמאפשר שימוש מסחרי ומחקר, שינוי והפצה, ללא דרישה לשתף את הנגזרות באותו רישיון. חובה לשמור על הודעות זכויות היוצרים והרישיון המקוריות. בנוסף, השימוש כפוף לתנאי הרישיון של The-Stack-v2 שממנו נלקחו הנתונים במקור, ולכן יש לוודא שהתנאים הללו תואמים לשימוש שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗