GPT
M

Mellum-4b-base

קוד פתוח

JetBrainsapache-2.02025-04-28

  • transformers
  • safetensors
  • llama
  • text-generation
  • code

JetBrains עומדים גם מאחורי JetBrains AI, ויש עליו סקירה כאן.

מודל קוד קומפקטי שמיועד להשלמת שורות ופונקציות ישירות בסביבת הפיתוח. הוא נבנה כבסיס קל לאימון או להרצה מקומית בלי לתפוס משאבי שרת כבדים.

  • 4Bפרמטרים
  • 8,192טוקנים בהקשר
  • 7.5 GBמשקל הקבצים
  • 2,389הורדות בחודש

מה זה

מדובר במודל שפותח על ידי JetBrains ואומן על כארבעה טריליון טוקנים ממאגרי קוד ציבוריים כמו The Stack וגרסתו השנייה, יחד עם ויקיפדיה באנגלית. הארכיטקטורה שלו נשענת על LLaMA עם 30 שכבות, והוא מתמקד במשימות של השלמת קוד, כולל יכולת מובנית למילוי קטעים חסרים באמצע קובץ על בסיס מה שנכתב לפני ואחרי.

במבחני ביצועים רואים בבירור את ייעודו. במבחן RepoBench 1.1 על פייתון הוא מקבל התאמה מדויקת של 28.20 אחוז בהקשר של 2k, אך המספר צונח ל־21.10 אחוז כשהקונטקסט נמתח ל־16k, מעבר לחלון המקורי שלו שעומד על 8,192 טוקנים. במבחן HumanEval למילוי שורה בודדת המודל מגיע ל־66.21 אחוזי הצלחה, אבל במקטעים אקראיים הוא צונח ל־29.70 אחוז. הנתונים מראים שמדובר בכלי טוב להצעות נקודתיות ומהירות, אך לא לייצור בלוקים מורכבים מאפס.

מתאים ל

  • השלמת קוד מקומית ב־IDE

    מתאים לחיבור לעורך הקוד לצורך הצעות שורה ופונקציות מהירות בלי להוציא מידע מחוץ לרשת.

  • בסיס לכוונון פנימי

    משמש נקודת מוצא מצוינת לאימון נוסף על בסיס הקוד הארגוני הפרטי של החברה שלכם.

  • מילוי קטעים חסרים בקבצים

    תומך במבנה Fill-in-the-Middle ומאפשר השלמת לוגיקה פנימית בהתאם לחלק העליון והתחתון בקובץ.

איפה זה נופל

זהו מודל בסיס ולא מודל שעבר כוונון להוראות, כך שהוא פשוט ממשיך טקסט ולא עונה לשאלות ישירות. המפתחים מציינים במפורש שהקוד שהוא מייצר משקף הטיות ממאגרי קוד פתוח ועלול לכלול חולשות אבטחה, ולכן אסור להסתמך עליו בעיניים עצומות. בנוסף, אף שנבדק במרחקי הקשר ארוכים, הביצועים שלו נופלים משמעותית ברגע שחורגים מ־8,192 טוקנים.

אותה משפחה

Mellum יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה בתור עוזר שיחה סטייל ChatGPT?

לא. מדובר במודל בסיס שלא עבר אימון שיחה או התאמה להוראות. אם תכתבו לו שאלה, הוא ינסה להמשיך אותה כטקסט או כקוד במקום לענות עליה.

האם כדאי להעמיס עליו קבצים גדולים מעבר ל־8,000 טוקנים?

עדיף שלא. אף שהבדיקות של החברה כללו הרצות עד 16k, הדיוק שלו בציוני הבנצ'מרק יורד בצורה ברורה ברגע שעוברים את גבול 8,192 הטוקנים שבהם אומן.

איך מריצים

המודל מגיע בקבצי משקלים בנפח של 7.5 גיגה בייט בדיוק bfloat16, כך שכרטיס מסך בודד עם 12 או 16 גיגה זיכרון יריץ אותו בקלות. אפשר לטעון אותו בעזרת transformers בפייתון, או להעביר אותו למנועים כמו vLLM לשרת מקומי ו־llama.cpp או Ollama אם רוצים לעבוד על מחשב אישי.

אם כל מה שאתם צריכים זה שירות השלמות בסיסי לצוות קטן, הרצה עצמית שלו היא פתרון זול ופרטי. מנגד, מכיוון שמדובר במודל בסיס שלא עבר התאמה לשיחה או הנחיות מורכבות, אם המטרה היא צ'אט שמסביר שגיאות או מתכנן ארכיטקטורה, חבל על זמן ההקמה ועדיף לפנות למודל גדול יותר דרך ממשק קיים.

from transformers import pipeline

pipe = pipeline("text-generation", model="JetBrains/Mellum-4b-base")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0, שמאפשר שימוש מסחרי חופשי לחלוטין. אפשר לשנות את המשקלים, להטמיע אותו בתוך מוצר סגור או שירות ענן, ולהפיץ אותו ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים המקורית והרישיון המצורף.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗