GPT
N

North-Mini-Code-1.0-GGUF

קוד פתוח

unslothapache-2.02026-06-10

  • transformers
  • gguf
  • conversational
  • unsloth
  • chat

גרסת GGUF למודל תכנות מבוסס תערובת מומחים של Cohere, שמפעיל 3 מיליארד פרמטרים מתוך 30 בזמן אמת. הוא מיועד להרצה מקומית של סוכני קוד, פקודות טרמינל וחלונות הקשר ארוכים של עד 256K.

  • 416 GBמשקל הקבצים
  • 259,428הורדות בחודש
  • 139לייקים

מה זה

מדובר במודל שפותח על ידי Cohere Labs ועבר קוונטיזציה של Unsloth לפורמט GGUF. הארכיטקטורה שלו בנויה על תערובת מומחים דלילה עם 128 מומחים בסך הכל, כשבכל טוקן רצים 8 בלבד. השילוב הזה נותן מהירות חישוב של מודל קטן עם זיכרון משקלים של מודל בינוני, לצד תמיכה בפלט חריג באורכו של עד 64K טוקנים.

האימון שלו התמקד בהפעלת כלים, כתיבת קוד ובדיקות אוטומטיות עם מנגנון תגמול מאומת. המבחנים שלו בכרטיס המודל התרכזו בביצוע משימות פיתוח מעשיות כמו SWE-Bench ופקודות מעטפת בטרמינל. הדגש כאן הוא על יכולת לבצע חשיבה שזורה בין קריאות לפקודות שונות, במקום פליטת בלוקים של קוד ללא בדיקה.

מתאים ל

  • סוכן תיקון באגים אוטומטי

    הוא אומן על SWE-Bench ויודע להריץ פקודות shell, לקרוא קבצים ולבצע תיקוני קוד בסבבים.

  • ניתוח קוד בריפו גדול

    תמיכה בחלון הקשר של 256K מאפשרת להזין קבצים מרובים במכה אחת ללא צורך בחיתוך מוקדם.

  • הפעלת כלי טרמינל מקומיים

    התמחות במשימות Terminal-Bench מאפשרת לו לתרגם הנחיות בשפה טבעית לרצף פקודות מדויק במערכת.

איפה זה נופל

הארכיטקטורה חדשה ולא נתמכת עדיין בגרסה הרשמית והיציבה של llama.cpp, מה שמחייב הידור קוד מותאם מענף ספציפי של PR. בנוסף, חלון הקשר של 256K ופלט של 64K מנפחים את צריכת הזיכרון באופן קיצוני, כך שבחומרה מוגבלת תצטרכו להגביל את ההקשר משמעותית. הכרטיס גם מדגיש שהמודל מוגבל לטקסט בלבד ואינו מעבד תמונות או קבצים בינאריים.

שאלות
נפוצות

האם אפשר להריץ את הקבצים האלה כבר עכשיו בגרסה הרגילה של llama.cpp?

לא. הארכיטקטורה של המודל דורשת תמיכה במבנה cohere2moe שנמצא כרגע ב־PR מספר 24260. תצטרכו להוריד את הקוד מהענף של ה־PR ולקמפל את הבינאריים בעצמכם עד שהשינוי ימוזג לגרסה הראשית.

כמה זיכרון וידאו צריך כדי להריץ את גרסת ה־4 ביט?

עבור המשקלים עצמם בכימות Q4 נדרשים כ־18 עד 20 גיגה־בייט VRAM. אם תרצו לנצל הקשר רחב יותר מכמה אלפי טוקנים בודדים, תצטרכו 24 גיגה־בייט לפחות או פיצול בין כרטיסים.

איך מריצים

כדי להריץ אותו דרך llama.cpp, תצטרכו כרגע לקמפל ידנית ענף מ־PR מספר 24260 שתומך בארכיטקטורת cohere2moe. לאחר הבנייה, מורידים את הקובץ הרצוי, למשל גרסת UD-Q4_K_XL, ומפעילים את llama-server עם דגל jinja להפעלת תבנית הצ'אט וחלון ההקשר המבוקש.

מבחינת חומרה, 30 מיליארד פרמטרים בכימות של 4 ביט ידרשו לפחות 20 עד 24 גיגה־בייט של זיכרון כרטיס מסך, וכפול מזה אם רוצים לנצל חלון הקשר עמוק של מאות אלפי טוקנים. אם יש לכם רק מעבד או כרטיס ביתי פשוט עם 8 עד 12 גיגה זיכרון, זה יזחל או ייפול, ועדיף להרים שרת מרוחק או לקרוא לשירות ענן.

ollama run hf.co/unsloth/North-Mini-Code-1.0-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל שוחרר תחת רישיון Apache 2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של המשקלים, הפצה ושילוב שלו בתוך מוצרים ויישומים פנימיים או חיצוניים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים שתפיצו.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗