GPT
S

stablelm-zephyr-3b-GGUF

קוד פתוח

TheBlokeother2023-12-07

  • transformers
  • gguf
  • stablelm
  • causal-lm
  • en

גרסת GGUF מכווצת למודל שיחה קומפקטי של 3 מיליארד פרמטרים. פתרון מתאים למי שרוצה להריץ מודל הוראות סביר מקומית על מחשב נייד בלי להשקיע בחומרה ייעודית.

  • 20.0 GBמשקל הקבצים
  • 3,105הורדות בחודש
  • 101לייקים

מה זה

מדובר במודל שפת שיחה שפותח במקור על ידי Stability AI על בסיס stablelm-3b-4e1t, ועבר אימון הוראות ושיפור באמצעות DPO בהשראת Zephyr 7B. המטרה שלו היא לספק ביצועים שמתקרבים למודלים כפולים מגודלו תוך חיסכון במשאבים, כשהוא מאומן על שילוב של דאטה־סטים פתוחים וסינתטיים כמו SlimOrca, UltraChat ו־MetaMathQA.

במבחני ביצועים המודל מציג ציון של 6.64 ב־MT-Bench ושיעור ניצחון של 76 אחוז ב־AlpacaEval. המספרים האלה מציבים אותו מעל מודלים ותיקים וגדולים יותר כמו Guanaco של 65 מיליארד פרמטרים או MPT-Chat של 7 מיליארד, אך במבחני ידע והיגיון מורכבים כמו MMLU הוא מגיע ל־46.3 ו־GSM8K ל־42.3, מה שמבהיר את הגבולות הברורים של גודל 3B.

מתאים ל

  • עוזר מקומי במחשב נייד

    צורך מעט מאוד זיכרון, כ־4.2 גיגה־בייט בגרסת Q4, ומתאים לניסוח הודעות וסיכום טקסטים באנגלית ללא חיבור לרשת.

  • בוט שיחה קל משקל

    אימון ה־DPO מעניק לו סגנון דיאלוג טוב למשימות תמיכה ומענה בסיסי על פי הנחיות פשוטות באנגלית.

  • פיתוח ובדיקות על מעבד

    מאפשר לבחון אינטגרציות של ממשקי שיחה עם llama.cpp ו־LangChain בסביבות פיתוח נטולות כרטיס גרפי ייעודי.

איפה זה נופל

המודל אומן ותומך רשמית באנגלית בלבד. לא כדאי לבנות עליו לעיבוד עברית, שכן אין לגביה נתוני אימון או התאמה. בנוסף, אף על פי שהוא מפיק תשובות שיחה קולחות, ציוני הבנצ'מרק חושפים חולשה משמעותית בידע כללי ופתרון בעיות כמותיות, עם 42.3 ב־GSM8K ו־35.26 בלבד ב־BigBench. לפני שילוב במערכת יש לקחת בחשבון שהוא נוטה להזיות ברגע שהשאלה חורגת משיחה פשוטה או ניסוח טקסט.

שאלות
נפוצות

האם המודל מתאים לשימוש בעברית?

התיעוד הרשמי מציין תמיכה באנגלית בלבד. לא מומלץ להשתמש בו לטקסטים בעברית כי התוצאות צפויות להיות מקוטעות או חסרות משמעות.

איזה קובץ GGUF כדאי להוריד מהרשימה?

הקובץ המומלץ לרוב השימושים הוא stablelm-zephyr-3b.Q4_K_M.gguf. הוא מספק יחס מאוזן בין גודל של 1.71 גיגה־בייט לאיכות הפלט, ודורש כ־4.21 גיגה־בייט RAM בלבד.

האם אפשר להשתמש בו במוצר מסחרי של החברה?

לא. הרישיון המקורי הוא רישיון מחקר לא מסחרי של Stability AI, כך שאי אפשר להטמיע אותו במוצרים מסחריים.

איך מריצים

המודל מגיע במגוון רמות כימוס בפורמט GGUF, החל מגרסאות 2 ביט במשקל 1.20 גיגה־בייט ועד 8 ביט במשקל 2.97 גיגה־בייט. גרסת Q4_K_M שוקלת 1.71 גיגה־בייט ודורשת 4.21 גיגה־בייט של זיכרון עבודה בריצה על מעבד בלבד, כך שהיא רצה בצורה חלקה כמעט על כל מחשב אישי, כולל מקבוק בסיסי או מחשבי לינוקס וחלונות, דרך כלים כמו llama.cpp, LM Studio או ספריית llama-cpp-python.

גרסאות ה־2 וה־3 ביט סובלות מפגיעה מורגשת באיכות הפלט ולא מומלצות. עדיף להישאר בטווח של Q4_K_M או לעלות ל־Q5_K_M שלוקח כ־4.49 גיגה־בייט RAM. אם המשימה דורשת ידע עמוק, יכולת הבנה של שפות נוספות או פתרון בעיות מתמטיות סבוכות, חבל על הטרחה של הרצה מקומית ועדיף לפנות ל־API חיצוני של מודל גדול.

ollama run hf.co/TheBloke/stablelm-zephyr-3b-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד המקורי שוחרר תחת רישיון מחקרי לא מסחרי של Stability AI, המסומן בדף כ־other. המשמעות פשוטה, אסור להשתמש במודל הזה בתוך מוצר מסחרי, שירות בתשלום או פעילות עסקית מניבה, אלא רק למטרות מחקר, בדיקות ושימוש אישי.

הרישיון המלא בעמוד המודל ↗