GPT
S

SuperNova-Medius-GGUF

קוד פתוח

bartowskiapache-2.02024-10-11

  • gguf
  • mergekit
  • merge
  • text-generation
  • endpoints_compatible

גרסת משקלים מכווצים לריצה מקומית של SuperNova-Medius, המיועדת להסקה מהירה בחומרה צרכנית רגילה דרך llama.cpp בלי שרת ייעודי.

  • 230 GBמשקל הקבצים
  • 3,774הורדות בחודש
  • 42לייקים

מה זה

המאגר הזה הוא המרה מכווצת בפורמט GGUF למודל המקורי של חברת arcee-ai, שנעשתה באמצעות llama.cpp בגרסת b3901.bartowski ביצע כאן כיול בעזרת imatrix, טכניקה שנועדה לשמר דיוק מרבי גם כאשר דוחסים את הפרמטרים לרמות נמוכות. המודל מתמקד ביצירת טקסט כללית ומיועד להרצה על מעבדים או כרטיסי מסך ביתיים.

בניגוד למודלים שלמים שמגיעים בגדלים כבדים בפורמט של 16 ביט, כאן החבילה מציעה קשת רחבה של קבצים מ־4.31 ג'יגה בייט ועד 29.55 ג'יגה בייט. אין כאן נתוני מבחנים ספציפיים בכרטיס לגבי ביצועי אינטליגנציה או ידע, אלא רק מגוון רחב של גרסאות דחיסה שמאפשרות לבחור בין איכות פלט לבין צריכת זיכרון בפועל.

מתאים ל

  • עוזר מקומי פרטי

    ריצה מקומית ב־LM Studio בלי לשלוח נתונים החוצה, בגרסת Q4_K_M על חומרה אישית.

  • פיתוח על שבבי ARM

    גרסאות Q4_0 מותאמות שמנצלות פקודות חומרה ייעודיות להאצה במכשירים מבוססי ARM.

  • סביבות עם זיכרון נמוך

    שימוש בגרסאות IQ2 שדורשות פחות מחמישה ג'יגה בייט זיכרון כשאין כרטיס מסך חזק.

איפה זה נופל

הכרטיס לא מספק נתוני דיוק, שפת אימון, או ביצועים בעברית, ולכן חובה לבדוק אותו עצמאית לפני שילוב במערכת פעילה. מעבר לזה, רמות הדחיסה הנמוכות כמו IQ2 או Q2_K מאבדות הרבה מאוד מאיכות הפלט ולא מתאימות למשימות שדורשות היגיון מורכב או כתיבה נקייה.

שאלות
נפוצות

איזה קובץ בדיוק אני צריך להוריד מתוך כל הרשימה?

אם המטרה היא איזון טוב בין מהירות לאיכות, מומלץ להוריד את SuperNova-Medius-Q4_K_M.gguf. אם יש לכם כרטיס מסך מרווח עם 16 ג'יגה בייט VRAM ומעלה, גרסת Q6_K_L תיתן תוצאה קרובה מאוד למקור.

האם גרסאות ה־ARM מתאימות למחשבי אפל סיליקון?

לא. קובצי ה־Q4_0_X_X מיועדים למעבדי ARM תחת לינוקס עם תמיכה ספציפית ולא למנגנון Metal של אפל, כך שעבור מחשבי מק עדיף לבחור קובצי K-quants רגילים.

איך מריצים

טוענים קובץ בודד לתוך LM Studio או מריצים דרך llama.cpp בפקודת שורה. לבחירת הקובץ, מודדים את נפח הזיכרון של כרטיס המסך ומורידים קובץ שמשקלו קטן בערך בשני ג'יגה בייט מנפח ה־VRAM הזמין כדי לאפשר פריקה מלאה של המודל לזיכרון המהיר.

לרוב המשתמשים כדאי להתחיל עם גרסת Q4_K_M ששוקלת 8.99 ג'יגה בייט ורצה מצוין על כרטיס עם 12 או 16 ג'יגה בייט זיכרון. אם יש לכם מחשב מבוסס מעבד ARM ייעודי, קיימות גרסאות Q4_0 מיוחדות, אבל הן לא מתאימות למחשבי מק או ווינדוס.

ollama run hf.co/bartowski/SuperNova-Medius-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי חופשי, שינוי של הקוד והמשקלים, והפצה מחדש בתוך מוצרים. התנאי העיקרי הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שמפיצים הלאה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗