GPT
N

North-Mini-Code-1.0

קוד פתוח

CohereLabsapache-2.02026-06-05

  • transformers
  • safetensors
  • cohere2_moe
  • text-generation
  • conversational

זה מודל קוד שרץ עם שלושה מיליארד פרמטרים פעילים בלבד מתוך שלושים. הוא מיועד למי שרוצה להריץ סוכן פיתוח מקומי שמפעיל פקודות מסוף בלי לשלם על חישוב של מודל ענק.

  • 30Bפרמטרים
  • 500,000טוקנים בהקשר
  • 56.8 GBמשקל הקבצים
  • 10,469הורדות בחודש

מה זה

מדובר במודל מומחים של שלושים מיליארד פרמטרים בסך הכול, אבל בכל טוקן מופעלים רק שלושה מיליארד מתוך מאה עשרים ושמונה מומחים. המבנה הזה נותן מהירות של מודל קטן עם קיבולת ידע רחבה יותר. המטרה העיקרית שלו היא לא רק להשלים פונקציות בודדות, אלא לתפקד בתוך לולאות עבודה של סוכני תוכנה שמריצים פקודות במערכת ההפעלה ומנתחים את הפלט.

הוא אומן בשני שלבי כוונון עדין ואחריהם למידת חיזוק עם תגמולים שניתנים לאימות, במיוחד סביב משימות של הרצת טרמינל. התמיכה המובנית במחשבה משולבת בין קריאות לכלים מאפשרת לו לתכנן שלבים, לקרוא לפונקציית bash, לקבל את הפלט ולהמשיך לחשוב על הצעד הבא. המפרסמים בדקו אותו מול מבחנים כמו SWE-Bench ו־Terminal-Bench v2 כדי לבחון יכולת פתרון תקלות מעשיות בקוד.

מתאים ל

  • סוכן תיקון באגים בטרמינל

    הוא אומן להריץ פקודות bash, לקרוא פלטים ולתקן תקלות בתוך סביבות פיתוח בלי לעבור דרך שרתים חיצוניים.

  • עבודה בתוך OpenCode

    הגדרת ברירת המחדל שלו נתמכת ישירות בכלי, ומאפשרת שימוש במודל מקומי שמנמק צעדים תוך כדי כתיבה.

  • ניתוח קבצי קוד ארוכים

    התמיכה במאות אלפי טוקנים בהקשר מאפשרת לטעון מאגר שלם ולבקש שינויים מורכבים במקום פונקציה מבודדת.

איפה זה נופל

ההתקנה המקומית רחוקה מלהיות חלקה ודורשת גרסאות פיתוח ישירות ממאגרי הגיט של transformers או vLLM, לצד התקנת ספריית melody של Cohere לניתוח התשובות. בנוסף, יש פער בדיווח בין נתוני המטא שמציינים הקשר של חמש מאות אלף טוקנים לבין כרטיס המודל שמגדיר מאתיים חמישים ושישה אלף קלט ושישים וארבעה אלף פלט. כדי לקבל תוצאות טובות המודל תלוי לחלוטין בהעברת שרשרת המחשבה שלו בין הצעדים, ואם המערכת שלכם לא שומרת את הבלוק הזה בהיסטוריה, הביצועים שלו במשימות סוכן ייפגעו.

שאלות
נפוצות

האם אפשר להריץ אותו על מחשב נייד רגיל?

לא. קבצי המודל שוקלים כמעט חמישים ושבעה ג'יגה בייט ודורשים חומרה חזקה, עדיף שני מעבדים גרפיים ייעודיים. על חומרה צרכנית רגילה ללא מספיק זיכרון וידאו הוא לא יעלה.

מה זה אומר שלושים מיליארד פרמטרים עם שלושה פעילים?

הארכיטקטורה מחלקת את הידע למאה עשרים ושמונה מומחים, אבל בכל רגע נתון רק שמונה נבחרים לבצע את החישוב בפועל. המשמעות היא שהמודל דורש זיכרון של מודל בינוני כדי להחזיק את הקבצים, אך מגיב במהירות חישוב של מודל קטן בהרבה.

איך מריצים

כדי להריץ אותו צריך להחזיק בזיכרון את כל המשקלים, שתופסים קרוב לחמישים ושבעה ג׳יגה בייט. בריצת vLLM המפתחים מדגימים חלוקה על פני שני כרטיסי מסך עם מקביליות טנזורים של שתיים, וקביעת אורך מודל מרבי של שלוש מאות ועשרים אלף טוקנים. צריך לשים לב שחלון ההקשר המלא דורש משאבי זיכרון משמעותיים עבור ה־KV cache מעבר למשקלי המודל עצמם.

אם אין לכם שני כרטיסי עיבוד מתאימים עם מספיק זיכרון וידאו, שרת עצמאי כזה פשוט ייחנק. במקרה כזה, עדיף להשתמש ב־OpenCode או ב־Space שהעלו ב־Hugging Face כדי לבדוק אותו לפני שמקימים עבורו שרת ייעודי.

from transformers import pipeline

pipe = pipeline("text-generation", model="CohereLabs/North-Mini-Code-1.0")
print(pipe("שלום"))

הקבצים

61 קבצים במאגר, 56.8 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצרים פנימיים או למכור שירותים שמבוססים עליו, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗