GPT
M

Magicoder-S-DS-6.7B

קוד פתוח

ise-uiucother2023-12-03

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

התאמה מתקדמת לקוד על בסיס DeepSeek בגודל 6.7B שנועדה לתכנות יומיומי. הוא אומן על נתונים סינתטיים מקוד פתוח כדי להוריד הטיות ולדייק תשובות.

  • 6.7Bפרמטרים
  • 16,384טוקנים בהקשר
  • 25.1 GBמשקל הקבצים
  • 535הורדות בחודש

מה זה

החוקרים מאילינוי לקחו את מודל הבסיס של DeepSeek Coder ואימנו אותו בשיטה שהם מכנים OSS-Instruct. הרעיון היה לייצר משימות תכנות בעזרת GPT-3.5 תוך שימוש בקטעי קוד פתוח אמיתיים, כדי לא לקבל רק שאלות שגרתיות ומשעממות. לגרסת ה־S הזו הוסיפו גם סט נתונים נוסף של 110 אלף דוגמאות מ־Evol-Instruct שעברו ניקוי.

בפועל מדובר במודל שממוקד כולו בכתיבת קוד, השלמות והסברים של לוגיקה טכנית. חלון ההקשר של 16,384 טוקנים נותן לו מספיק מרחב לקרוא קבצים שלמים או מודולים מורכבים בלי לאבד את ההתחלה, מה שלא תמיד קיים במודלים ישנים יותר במשקל הזה.

מתאים ל

  • השלמת קוד ופונקציות

    מתאים לכתיבת מימושים של פונקציות ובדיקות יחידה על בסיס הנחיות ברורות.

  • הסבר וניפוי שגיאות

    חלון של 16K טוקנים מאפשר להזין קבצים ארוכים כדי למצוא באגים בלוגיקה.

  • עוזר פיתוח מקומי

    מיועד למפתחים שרוצים סיוע בכתיבת קוד על גבי שרת מקומי בלי להוציא מידע.

איפה זה נופל

יוצרי המודל מבהירים שהוא מיועד למשימות קוד בלבד. אם תנסו לנהל איתו שיחות כלליות, לכתוב טקסט שיווקי או לנתח מסמכים רגילים, הוא יתקשה מאוד ועלול לייצר טעויות גסות. מעבר לזה, המודל עלול לפלוט קוד שגוי או מטעה, ולכן אי אפשר להריץ את התוצרים שלו בלי בדיקות ובדיקת אדם.

שאלות
נפוצות

האם המודל מתאים לשיחה כללית בעברית?

לא. המודל אומן מראש אך ורק למשימות תכנות, והוא יתקשה מאוד במשימות שפה כלליות או בעברית.

האם חובה להשתמש בפורמט הפרומפט המיוחד של Magicoder?

כן, המודל אומן ספציפית לזהות תבנית של הוראה ומענה עם תגיות מוגדרות, וסטייה מהמבנה תפגע באיכות הקוד שהוא מייצר.

האם אפשר להשתמש בו במוצר מסחרי?

זה מורכב. אף שהבסיס נשען על רישיון DeepSeek, הנתונים נוצרו בעזרת OpenAI שאוסרת על שימוש כזה כדי להתחרות במוצריה.

איך מריצים

כדי להריץ אותו מקומית צריך להוריד 25.1 ג'יגה־בייט של משקלים. המודל שמור ב־float32, אבל בקוד הדוגמה הרשמי מריצים אותו ישירות ב־bfloat16 דרך ספריית transformers, מה שחותך את צריכת הזיכרון ומאפשר להכניס אותו לכרטיס מסך מודרני עם 16 או 24 ג'יגה זיכרון.

ההרצה מתבצעת בעזרת ה־pipeline הרגיל של Hugging Face יחד עם פורמט פקודה ספציפי של המודל שמגדיר הוראה ומענה. אם אין לכם חומרה ייעודית מקומית, עדיף להרים שרת מנוהל בענן לשעות העבודה או לפנות לפתרונות API קיימים.

from transformers import pipeline

pipe = pipeline("text-generation", model="ise-uiuc/Magicoder-S-DS-6.7B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כאחר ומפנה לרישיון של DeepSeek, אך נקודת התורפה המשפטית האמיתית היא נתוני האימון. המודל אומן על מידע סינתטי שהופק על ידי מודלים של OpenAI, ותנאי השימוש שלהם אוסרים להתחרות בהם. מי שרוצה לשלב אותו במוצר מסחרי צריך לבחון טוב את ההשלכות המשפטיות האלה.

הרישיון המלא בעמוד המודל ↗