GPT
M

Ministral-8B-Instruct-2410-GGUF

קוד פתוח

bartowskiother2024-10-21

  • gguf
  • text-generation
  • en
  • fr
  • de

גרסת GGUF מכווצת של Ministral 8B שמתאימה להרצה מקומית. הפורמט מאפשר להריץ מודל הוראות קומפקטי ישירות על כרטיסי מסך ביתיים או מעבדים.

  • 119 GBמשקל הקבצים
  • 3,577הורדות בחודש
  • 55לייקים

מה זה

מדובר בהמרה של המודל המקורי מבית Mistral AI לפורמט GGUF בעזרת llama.cpp, אותה ביצע bartowski באמצעות כיול imatrix. המודל שוקל במקור כ־16 ג'יגה בייט בגרסת הדיוק המלא, ונועד למשימות יצירת טקסט ומענה להוראות. ההבדל המרכזי כאן לעומת המודל המקורי הוא הכיווץ, שמנגיש אותו לחומרה צנועה בלי לחייב שרתים ייעודיים.

הוא מתמקד ביעילות בגודל של שמונה מיליארד פרמטרים, קטגוריה שמתאימה למי שרוצה ביצועים סבירים בלי תקורת זיכרון כבדה. המודל אומן ותומך בשפות אנגלית, צרפתית, גרמנית, ספרדית, איטלקית, פורטוגזית, סינית ויפנית. כרטיס המודל לא מציג ציוני מבחנים או השוואות ביצועים מול דגמים מקבילים, ולכן ההבדל המעשי מתבטא בעיקר בזמינות של עשרות גרסאות כיווץ שונות להתאמה מדויקת לנפח הזיכרון שלכם.

מתאים ל

  • עוזר מקומי למחשב נייד

    גרסת Q4 רצה בזיכרון של 6 ג'יגה ומאפשרת מענה מהיר להוראות באנגלית ובשפות אירופאיות בלי לשלוח מידע לרשת.

  • עיבוד טקסט במכשירי ARM

    הגרסאות המותאמות כמו Q4_0_4_4 מנצלות פקודות ייעודיות לחומרה ומספקות מהירות משופרת על רכיבי קצה מתאימים.

  • תרגום בין שפות נתמכות

    המודל מכיל תמיכה מובנית בשפות מרכזיות כמו צרפתית, גרמנית, ספרדית ויפנית, ומאפשר עיבוד רב־לשוני מקומי.

איפה זה נופל

כרטיס המודל מציין מפורשות שייתכן ונדרשים שינויים נוספים ב־llama.cpp כדי להגיע לביצועים מלאים, כך שלא בטוח שתקבלו מיצוי מוחלט של יכולות המודל בהרצה הנוכחית. מעבר לכך, עברית כלל אינה מופיעה ברשימת השפות הנתמכות, ולכן אין להסתמך עליו למשימות בשפה זו ללא בדיקה מקדימה. בנוסף, גרסאות מתחת ל־Q4 מציגות ירידה מורגשת באיכות הפלט, והרצת גרסאות מסוג I-quant על גבי מעבדים רגילים או אפל סיליקון תגרור ירידה בקצב היצירה.

שאלות
נפוצות

האם המודל מתאים לעבודה בעברית?

עברית אינה נכללת ברשימת השפות הרשמיות של המודל. הוא עשוי להבין מילים מסוימות עקב אימון כללי, אך התחביר והאוצר הלשוני יהיו לקויים מאוד ביחס לשפות הנתמכות. למשימות בעברית כדאי לבחור מודל שעבר התאמה ייעודית.

איזה קובץ הכי מומלץ להוריד מתוך הרשימה?

הקובץ המומלץ לרוב השימושים הוא Q4_K_M ששוקל 4.91 ג'יגה בייט. הוא שומר על איכות פלט קרובה למקור ונכנס בקלות למרבית כרטיסי המסך המודרניים. אם יש לכם כרטיס עם 8 ג'יגה זיכרון גרפי פנוי, תוכלו לעלות ל־Q5_K_M לשיפור קל נוסף.

איך מריצים

כדי להריץ אותו מקומית אפשר להשתמש בתוכנות כמו LM Studio או ישירות דרך llama.cpp. טווח המשקלים נע בין 2.96 ג'יגה בייט בגרסאות הנמוכות ביותר ועד 16.05 ג'יגה בייט בגרסת f16 המלאה. עבור רוב המשתמשים, גרסת Q4_K_M ששוקלת 4.91 ג'יגה בייט מספקת פשרה טובה ודורשת כרטיס מסך עם לפחות 6 עד 8 ג'יגה בייט של זיכרון גרפי, תלוי בגודל ההקשר שתקצו.

יש גם קבצים ייעודיים למעבדי ARM כמו Q4_0_4_4 שנותנים האצה בחומרה תואמת, אך אינם מיועדים למערכות חלונות או מק. אם אין לכם זיכרון ייעודי פנוי או אם אתם מתכננים עומס עבודה כבד שדורש מקביליות גבוהה, הרצה מקומית תהיה איטית מאוד ועדיף לפנות לשרת מרוחק עם מעבד גרפי חזק.

ollama run hf.co/bartowski/Ministral-8B-Instruct-2410-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון מוגדר כ־other ואינו מציין תנאי קוד פתוח סטנדרטיים כמו MIT או Apache. המשמעות היא שאין היתר שימוש מסחרי מוגדר מראש בתוך המאגר הזה. אם אתם מתכננים לשלב אותו במוצר מסחרי, חובה לבדוק את תנאי הרישיון המקוריים של Mistral AI לפני ההפצה.

הרישיון המלא בעמוד המודל ↗