GPT
L

Ling-Coder-SFT

קוד פתוח

inclusionAIapache-2.02025-03-08

  • code

מעל חמישה מיליון דוגמאות אימון לקוד באנגלית ובסינית שנוצרו באמצעות מודלי שפה. הוא מיועד למי שמכוון לאמן מודל שיודע לתכנת, להסביר אלגוריתמים ולנמק הרצת קוד ביותר מעשרים שפות פיתוח.

  • 990הורדות בחודש
  • 45לייקים

מה זה

המאגר מכיל דאטה סינתטי שנוצר בשיטות הדומות ל־OSS-Instruct ו־Evol-Instruct, ושימש בפועל לכוונון המודל Ling-Coder Lite. תהליך הבנייה התחיל מזרעי קוד שמהם מודלי שפה חילצו נקודות מפתח והסברים. משם המודלים הרחיבו כל סט נקודות לשבעה שילובים שונים, כאשר עבור כל שילוב יוצרו עשר שאלות תכנות ייחודיות שתורגמו לתשובות מלאות על ידי מודל שפה.

התוכן עצמו מתמקד בתרחישים כמו המרת טקסט לקוד, השלמת קוד, נימוק הרצה של תוכניות, שאלות ותשובות על אלגוריתמים מורכבים ושימוש בספריות פייתון נפוצות. כל הזוגות של שאלות ותשובות עברו סינון מבוסס חוקים, ניקוי רעלים, הסרת חפיפות מול מבחני ביצועים, בדיקות איכות ובחירה על בסיס אבלציה. התוצאה היא אוסף ממוקד של מעל חמישה מיליון רשומות, ללא חלוקה פנימית לתתי קבוצות מעבר לקבצי האימון עצמם.

מתאים ל

  • כוונון מודלי שפה לקוד

    אימון הוראות מקיף על חמישה מיליון דוגמאות לשיפור יכולות תכנות, השלמת שורות והסבר פונקציות ביותר מעשרים שפות.

  • אימון על ספריות פייתון

    חיזוק היכרות המודל עם חבילות פייתון נפוצות באמצעות שאלות ותשובות ממוקדות על מימושים מעשיים.

  • שיפור נימוק הרצת קוד

    לימוד מודלים להבין מה קורה בזמן ריצה, לנתח שלבי ביצוע של אלגוריתמים מורכבים ולאתר תקלות לוגיות.

איפה זה נופל

כל המאגר מורכב מטקסט וקוד שנוצרו באופן סינתטי על ידי מודלי שפה, ולכן הוא חשוף להזיות מובנות ולאי דיוקים שקשה לתפוס בסינון אוטומטי. בנוסף, הכיסוי הלשוני מוגבל לחלוטין לאנגלית ולסינית בלבד, כך שאין כאן בכלל תמיכה בהוראות בעברית או בהבנת דרישות בשפות אחרות. מי שבונה מוצר לפרודקשן יצטרך לבצע בדיקות קפדניות על איכות הקוד שנוצר, בייחוד כשמדובר בספריות חיצוניות שמשתנות תדיר.

אותה משפחה

Ling-Coder יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם מותר להשתמש במאגר לפיתוח כלי מסחרי?

כן, הרישיון המדווח הוא apache-2.0, שמתיר שימוש מסחרי מלא, כולל אימון מודלים פנימיים או מוצרים שמוצעים בתשלום. התנאי העיקרי הוא שמירה על תנאי הרישיון ומתן קרדיט ליוצרים.

האם הדאטהסט כולל תמיכה בעברית?

לא, המאגר כולו מוגדר ומכיל דוגמאות בשפות אנגלית וסינית בלבד. אם אתם מחפשים לאמן מודל שיבין פרומפטים בעברית או ייצר תיעוד מקומי, תצטרכו להביא מקורות מידע נוספים.

איך הנתונים נאספו ונבדקו?

הנתונים נוצרו בצורה סינתטית על ידי הרחבת זרעי קוד ויצירת שאלות ותשובות באמצעות מודלי שפה, בשיטות המזכירות את OSS-Instruct ו־Evol-Instruct. לאחר מכן הם עברו סינונים מבוססי חוקים, הסרת רעלים ובדיקות איכות כדי לסנן דוגמאות גרועות.

איך טוענים

הנתונים פתוחים להורדה ישירה ללא צורך באישור גישה מראש. הם יושבים בתיקיית data ומחולקים לעשרים ושבעה קבצי parquet שונים, שממוספרים מ־00000 עד 00026. כדי להתחיל לעבוד איתם אפשר למשוך אותם דרך ספריית datasets הרגילה בפייתון, אך כדאי לקחת בחשבון שמדובר במיליוני דוגמאות שמחייבות מקום פנוי משמעותי בדיסק וזיכרון עבודה מתאים. המבנה מיועד למשימות יצירת טקסט ומכיל את חילופי הדברים בין השאלות לתשובות.

from datasets import load_dataset

ds = load_dataset("inclusionAI/Ling-Coder-SFT")

הרישיון

המאגר מופץ תחת רישיון apache-2.0. זהו רישיון מתירני שמאפשר שימוש מסחרי חופשי, שינוי של הנתונים והפצה מחדש, כולל אימון מודלים מסחריים על בסיסו. אין חובה לשתף את המודל המאומן או יצירות נגזרות תחת אותו הרישיון, אך נדרש לשמור על הודעות זכויות היוצרים והייחוס המקוריות.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא ב־Hugging Face ↗