GPT
M

Mistral-7B-OpenOrca-GGUF

קוד פתוח

TheBlokeapache-2.02023-10-02

  • transformers
  • gguf
  • mistral
  • text-generation
  • en

גרסת קוונטיזציה יעילה לאחד מאימוני ה־7B החזקים שיצאו למיסטרל. מתאים למי שרוצה ביצועי חשיבה של מודלים כפולים בגודל, ישירות על מעבד או כרטיס מסך ביתי.

  • 51.2 GBמשקל הקבצים
  • 6,229הורדות בחודש
  • 243לייקים

מה זה

המאגר הזה מציע קובצי GGUF של Mistral 7B שעבר כוונון עדין על דאטה-סט מבוסס GPT-4 של פרויקט OpenOrca. המטרה של האימון הייתה להנחיל למודל יכולות הנמקה שלב-אחר-שלב, ולא רק יצירת טקסט בסיסית. המודל עובד עם פורמט השיחה ChatML ומגיע עם חלון הקשר של 8k.

במבחני HuggingFace Leaderboard בעת שחרורו, הוא רשם ציון ממוצע של 65.33, מה שהציב אותו במקום השני מבין כל המודלים מתחת ל־30B ועקף כמעט כל מודל 13B קיים. במבחן MMLU הוא הוציא 61.73 וב־HellaSwag הגיע ל־83.79. הנתונים האלה מתורגמים ישירות להבנה טובה יותר של הוראות מורכבות, תחום שבו מודלים פתוחים קטנים נוטים להישבר בקלות.

מתאים ל

  • עוזר מקומי למפתחים

    רץ ישירות על מחשב נייד חזק דרך LM Studio, אידיאלי למענה על שאלות טכניות ופתרון בעיות באנגלית בלי לשלוח מידע החוצה.

  • פירוק משימות והנמקה

    אימון האורקה מכוון לחשיבה שלב אחר שלב, מה שמתאים לשאלות שמצריכות לוגיקה והסבר מפורט במשאבי חומרה צנועים.

  • שרת צ׳אט עצמאי ופרטי

    שילוב במוצר פנימי בארגון דרך llama-cpp-python, תחת פורמט השיחה ChatML וללא תלות בחיבור לרשת חיצונית.

איפה זה נופל

הקובץ מוגדר לשפה האנגלית בלבד, ואימון OpenOrca מבוסס עליה. מי שינסה להשתמש בו לעברית יקבל ביצועים חלשים וערבוב תחבירי כבד. מעבר לכך, במבחן TruthfulQA הוא עומד על 52.24 בלבד, מה שאומר שהנטייה להזיות עדיין נוכחת מאוד, במיוחד בגרסאות מכווצות בכבדות כמו Q2_K או Q3 שמוגדרות מראש עם אובדן איכות גבוה. חובה לבדוק את התשובות שלו בעניינים עובדתיים לפני שמשלבים אותו בזרימת עבודה אמיתית.

אותה משפחה

Mistral-7B-OpenOrca יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ ספציפי כדאי לי להוריד מהרשימה?

ההמלצה הרשמית והפרקטית היא קובץ Q4_K_M. הוא מספק שילוב מצוין בין נפח של 4.37 ג״ב לבין שימור איכות הריצה, ודורש פחות מ־7 ג״ב זיכרון עבודה בהרצה מלאה על מעבד.

האם המודל יפעל בצורה סבירה בעברית?

לא. המודל אומן והוגדר רשמית עבור אנגלית, וכל דאטה-סט האימון ממוקד בה. הוא עשוי לפלוט מילים בודדות בעברית אם יוכרח, אך התוצאה תהיה משובשת ולא מתאימה לשימוש אמיתי.

איך מריצים

אין שום סיבה להוריד את כל המאגר ששוקל 51.2 ג״ב, בוחרים קובץ בודד. הגרסה המאוזנת והמומלצת לרוב המשתמשים היא Q4_K_M שתופסת 4.37 ג״ב ודורשת כ־6.87 ג״ב זיכרון RAM בלבד אם מריצים על המעבד, או פחות מכך על VRAM אם מקצים שכבות לכרטיס המסך. למי שיש חומרה צנועה במיוחד אפשר לרדת ל־Q3_K_M שלוקח סביב 3.52 ג״ב, ולמי שדורש דיוק מרבי יש את Q5_K_M או Q6_K.

ההרצה מתבצעת מקומית דרך llama.cpp, ספריות כמו ctransformers ו־llama-cpp-python, או תוכנות שולחניות כמו LM Studio. שווה להריץ אותו לבד אם אתם צריכים פרטיות מלאה או רוצים אפס עלויות תעבורה, אבל אם המטרה היא שירות ייצור שדורש זמני מענה של אלפיות השנייה לעשרות משתמשים במקביל, שרת מרוחק או API ייעודי עדיין יהיו יציבים יותר.

ollama run hf.co/TheBloke/Mistral-7B-OpenOrca-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0, שמאפשר שימוש מסחרי חופשי, שינוי הקוד והפצה מחדש. מותר לשלב אותו במוצרים מסחריים בלי לשלם תמלוגים, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗