GPT
M

Mistral-7B-v0.1-GGUF

קוד פתוח

TheBlokeapache-2.02023-09-27

  • transformers
  • gguf
  • mistral
  • pretrained
  • text-generation

גרסת קבצים מכווצת של מודל שבעה מיליארד הפרמטרים מבית Mistral AI, שנועדה להרצה על מחשבים אישיים. הוא עוקף מודלים כפולים ממנו בגודל, בלי לדרוש שרת ייעודי.

  • 51.2 GBמשקל הקבצים
  • 6,660הורדות בחודש
  • 279לייקים

מה זה

המאגר הזה מציע המרות בפורמט GGUF למודל הבסיס Mistral-7B-v0.1. המודל המקורי מבוסס על ארכיטקטורת שנאי עם Grouped-Query Attention ומשתמש בטוקנייזר מסוג Byte-fallback BPE. לפי נתוני היצרן, המודל עוקף את Llama 2 13B בכל המבחנים שנבדקו, מה שאומר שמקבלים רמת ביצועים של מודל 13B בחומרה שמחזיקה רק חצי מזה.

הקובץ לא מגיע בצורה אחת. TheBloke ארז אותו בשיטות קוונטיזציה שונות מ־2 ביט ועד 8 ביט, שמאפשרות לבחור בדיוק את נקודת האיזון בין איכות התוצר לנפח הזיכרון הפנוי. הגרסאות האלו רצות ישירות על המעבד או בשילוב עם כרטיס מסך ביתי דרך ספריות כמו llama.cpp.

מתאים ל

  • השלמת טקסט מקומית

    מתאים למשימות גנרציה ישירות שלא דורשות מבנה שיחה, ברמת דיוק גבוהה ובחומרה מינימלית.

  • בסיס לאימון והתאמה

    מעולה כנקודת מוצא למי שרוצה לבצע התאמה ייעודית למשימה עסקית על גבי משקלים חזקים.

  • פיתוח ובדיקות אופליין

    מאפשר לבנות יישומי שפה במחשב נייד בלי חיבור לרשת ובלי עלויות ענן שוטפות.

איפה זה נופל

זהו מודל בסיס פתוח בלבד, הוא לא עבר fine-tuning להוראות או צ'אט, ולכן אין לו תבנית פרומפט מובנית. אם תזרקו לו שאלה בלי הכוונה, הוא פשוט ימשיך את הטקסט במקום לענות כמו עוזר וירטואלי.

בנוסף, הכרטיס מציין במפורש שפורמט GGUF לא תומך עדיין במנגנון ה־sliding window של המודל. המשמעות היא שאתם מוגבלים לאורך הקשר של 4096 טוקנים בלבד, ואי אפשר למשוך הקשרים ארוכים יותר.

אותה משפחה

Mistral יצא ב־8 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ כדאי לי להוריד מתוך הרשימה?

עבור רוב השימושים, mistral-7b-v0.1.Q4_K_M.gguf הוא הבחירה הנכונה. הוא שוקל 4.37 גיגה ומציע שילוב מוצלח בין מהירות, איכות ודרישות זיכרון סבירות של פחות מ־7 גיגה. הימנעו מ־Q2_K אלא אם אתם חנוקים לגמרי במשאבים, כי איבוד האיכות שם משמעותי.

האם המודל תומך בשיחה כמו ChatGPT?

לא ישירות מהקופסה. מדובר במודל בסיס שמשלים טקסט ולא במודל שעבר התאמה לשיחות. כדי לקבל חוויית צ'אט ב־llama.cpp צריך להשתמש בדגלים ייעודיים להוראות, או לחפש גרסה שעברה fine-tuning מתאים.

האם אפשר להשתמש בהקשר ארוך מ־4096 טוקנים?

לא כרגע דרך הקבצים האלה. המימוש הנוכחי ב־GGUF אינו כולל תמיכה במנגנון ה־sliding window של הארכיטקטורה המקורית. הריצה מוגבלת לתקרה של 4096 טוקנים.

איך מריצים

ההרצה נעשית באמצעות כלים שתומכים בפורמט כמו llama.cpp, LM Studio, או ספריית llama-cpp-python. רוב המשתמשים יבחרו בקובץ Q4_K_M ששוקל 4.37 גיגה ומציע איכות מאוזנת. בשביל להריץ אותו בלי כרטיס מסך תצטרכו 6.87 גיגה זיכרון RAM פנוי, או כרטיס מסך עם לפחות 6 גיגה VRAM כדי לטעון את השכבות אליו.

מי שמוכן להתפשר על דיוק בשביל לחסוך מקום יכול לרדת ל־Q2_K שדורש 5.58 גיגה זיכרון, ומי שמחפש איכות כמעט מקסימלית ילך על Q6_K או Q8_0 שדורשים מעל 8 עד 10 גיגה. אם המטרה היא להרים שירות זמין למאות משתמשים במקביל, כנראה שעדיף לשלם לפי טוקן ל־API חיצוני מאשר להחזיק שרתים מקומיים.

ollama run hf.co/TheBloke/Mistral-7B-v0.1-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש מסחרי חופשי, שינוי של הקבצים, שילוב במוצרים סגורים והפצה מחדש, כל עוד שומרים על תנאי הרישיון המקוריים ומצרפים את הודעת זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗