GPT
M

bartowski/Mistral-7B-Instruct-v0.3-GGUF

קוד פתוח

bartowskiapache-2.02024-05-22

  • gguf
  • text-generation
  • endpoints_compatible
  • conversational

גרסת GGUF מוכנה לשימוש מקומי של מיסטרל בגרסה 0.3. מתאים למי שצריך מודל הוראות קומפקטי ומהיר שרץ לגמרי על המחשב בלי תלות בענן.

  • 99.9 GBמשקל הקבצים
  • 27,104הורדות בחודש
  • 48לייקים

מה זה

מדובר בהמרה של Mistral-7B-Instruct-v0.3 לפורמט GGUF באמצעות llama.cpp, שביצע bartowski עם כיול imatrix. ההבדל המרכזי כאן הוא לא המודל עצמו אלא הנגישות שלו. במקום להוריד קבצי משקלים מקוריים כבדים ולהסתבך עם סביבות פייתון מורכבות, מקבלים קובץ יחיד שרץ ישירות דרך מנועים מקומיים.

המאגר כולל עשרים ושתיים רמות דחיסה שונות, החל מגרסאות ששומרות על דיוק גבוה וכמעט זהה למקור ועד דחיסות קיצוניות שנועדו להידחק לחומרה מוגבלת מאוד. מי שבוחר בגרסאות הביניים מקבל את היכולות המוכרות של מיסטרל ביצירת טקסט ומענה להוראות, אבל בצריכת זיכרון שמאפשרת להחזיק את כל העסק ישירות בתוך כרטיס המסך.

מתאים ל

  • הרצה מקומית על לפטופ

    קובץ Q4_K_M שוקל 4.37 גיגה ומאפשר תפעול מהיר גם על חומרה מוגבלת.

  • סביבות ללא חיבור רשת

    פורמט GGUF מאפשר הפעלה עצמאית דרך llama.cpp בלי שום תלות בשרת חיצוני.

  • כרטיסי מסך קטנים

    גרסאות IQ3 מספקות פתרון דחוס שנכנס לזיכרון של כרטיסים ישנים יחסית.

איפה זה נופל

הכרטיס מציין במפורש שהמודל לא תומך בהנחיית מערכת, כלומר אי אפשר להגדיר לו תפקיד או חוקי התנהגות קבועים בנפרד מגוף ההוראה. בנוסף, חובה להקפיד על מבנה הפרומפט הספציפי שכולל תגיות INST, אחרת הביצועים והתשובות נפגעים מיד. כמו כן, גרסאות הדחיסה הנמוכות כמו IQ1 מוגדרות בכרטיס כאיכות ירודה ביותר ולא מומלצות לשימוש.

שאלות
נפוצות

איזה קובץ הכי כדאי להוריד מהרשימה?

לרוב המשתמשים מומלץ לקחת את Q4_K_M ששוקל 4.37 גיגה ומספק איזון מצוין בין איכות לביצועים. אם יש לכם מספיק זיכרון בכרטיס המסך ואתם רוצים איכות קרובה למקור, לכו על Q6_K ששוקל 5.94 גיגה.

האם המודל מקבל System Prompt?

לא, כרטיס המודל מציין בבירור שאין תמיכה בהנחיית מערכת. חייבים להשתמש במבנה התחבירי המדויק עם תגיות INST ישירות על הפרומפט עצמו.

איך מריצים

מורידים קובץ ספציפי בעזרת huggingface-cli ולא את כל המאגר. אם המטרה היא מהירות מקסימלית, צריך שהקובץ ייכנס כולו לזיכרון כרטיס המסך, כלומר קובץ שמשקלו קטן בלפחות גיגה או שניים מסך הזיכרון הגרפי הזמין. גרסת Q4_K_M שוקלת 4.37 גיגה ומציעה איזון מצוין לרוב כרטיסי המסך הביתיים, בעוד שגרסת Q8_0 מגיעה ל־7.70 גיגה ומיועדת למי שדורש איכות מרבית.

למי שיורד מתחת ל־Q4 עדיף לבחור בגרסאות ה־IQ אם מריצים על כרטיסי Nvidia או AMD עם rocBLAS, כי הן שומרות על איכות טובה יותר באותו נפח. עם זאת, גרסאות ה־IQ לא יעבדו טוב על Vulkan ויהיו אטיות יותר על מעבדי אפל ועל CPU רגיל.

ollama run hf.co/bartowski/Mistral-7B-Instruct-v0.3-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא apache-2.0, מה שמאפשר שימוש חופשי כולל שימוש מסחרי מלא, שינוי הקוד והפצה של המודל כחלק ממוצר עצמאי, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗