GPT
S

arcee-ai/SuperNova-Medius-GGUF

קוד פתוח

arcee-aiapache-2.02024-10-10

  • gguf
  • mergekit
  • merge
  • endpoints_compatible
  • conversational

זיקוק של ענקים כמו לאמה 405B לתוך גוף קומפקטי של 14 מיליארד פרמטרים. פתרון מדויק למי שרוצה ביצועים מתקדמים מקומית בלי לתחזק שרתים מפלצתיים.

  • 226 GBמשקל הקבצים
  • 1,314הורדות בחודש
  • 64לייקים

מה זה

מדובר במודל של 14 מיליארד פרמטרים שמבוסס על הארכיטקטורה של Qwen2.5-14B-Instruct. במקום לאמן מאפס, החברה לקחה ידע משני מודלי ענק, Qwen2.5-72B ו־Llama-3.1-405B, והזריקה אותו פנימה בתהליך זיקוק מורכב שכלל התאמת אוצר מילים דרך כלי ייעודי ואימון על דאטה של EvolKit.

במבחנים הוא עוקף את מודל הבסיס שלו עם ממוצע של 0.480 מול 0.450. היתרון הגדול מתבטא במעקב אחרי הוראות מורכבות עם ציון של 0.832 ב־IFEval, ובמשימות היגיון ומתמטיקה קשה הוא מצליח איפה שמודל המקור כשל לגמרי, עם ציון 0.152 לעומת אפס עגול.

מתאים ל

  • סיוע טכני ותכנות

    הבנת הוראות חדה וציונים גבוהים בהיגיון מורכב הופכים אותו לכלי עזר מצוין לכתיבת קוד ותיעוד.

  • תמיכת לקוחות אוטונומית

    התמודדות טובה עם שיחות מפותלות והוראות קפדניות בלי צורך להחזיק מודל 70B יקר ברקע.

  • יצירת תוכן מובנה

    יכולת מעקב גבוהה ב־IFEval מאפשרת לו לייצר טקסטים שעומדים במבנה ובפורמט מדויקים לפי דרישה.

איפה זה נופל

במבחן MuSR המודל מקבל 0.402, ציון מעט נמוך יותר ממודל הבסיס שלו ומגרסת הלייט, מה שמעיד על נקודת תורפה בהיגיון רב שלבי מסוים. בנוסף, למרות השיפור המשמעותי במתמטיקה מול האפס של מודל המקור, 0.152 במבחן Math Level 5 זה עדיין ציון נמוך מאוד שמחייב בדיקה זהירה אם המערכת שלכם נשענת על חישובים מדויקים.

אותה משפחה

SuperNova-Medius יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

למה יש 226 גיגה של קבצים להורדה?

הריפו מכיל עשרות גרסאות כימות שונות של אותו מודל. בוחרים קובץ יחיד לפי מגבלות הזיכרון של כרטיס המסך שלכם, ולא מורידים את כל התיקייה.

האם הוא באמת עדיף על מודל הבסיס של Qwen?

לפי המדדים כן. הוא מציג שיפור עקבי כמעט בכל המבחנים, במיוחד במתמטיקה מתקדמת ובהבנת הוראות, בזכות הזיקוק ממודל ה־405B של מטא.

איך מריצים

המשקל הכולל בריפו מגיע ל־226 גיגה בגלל ריבוי קבצי GGUF שונים, אבל אתם צריכים להוריד רק קובץ כימות אחד שמתאים לחומרה שלכם. מודל 14B בכימות סביר רץ מצוין על כרטיס מסך בודד של 16 או 24 גיגה זיכרון דרך כלי הרצה כמו llama.cpp.

אם אין לכם כרטיס כזה וכל מה שיש זה מעבד רגיל, הביצועים ייפלו משמעותית. במצב כזה, או אם אתם צריכים סקייל רחב בלי לנהל תשתית, עדיף להשתמש ב־API מנוהל של המודל הגדול יותר בסדרה.

ollama run hf.co/arcee-ai/SuperNova-Medius-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

רישיון apache-2.0 מלא וחופשי. מותר להשתמש בו לצרכים מסחריים, לשלב אותו במוצרים סגורים, לשנות את המשקלים ולהפיץ מחדש, כל עוד שומרים על תנאי הרישיון ומתן הקרדיט המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗