GPT
Z

zephyr-7B-beta-GGUF

קוד פתוח

TheBlokemit2023-10-27

  • transformers
  • gguf
  • mistral
  • generated_from_trainer
  • en

גרסת GGUF מכווצת למודל צ'אט פופולרי שמאפשרת להריץ שיחות מתקדמות ישירות על המעבד או כרטיס מסך ביתי. הוא עוקף מודלים גדולים ממנו בהרבה במבחני שיחה.

  • 51.2 GBמשקל הקבצים
  • 2,032הורדות בחודש
  • 231לייקים

מה זה

מדובר בהמרה של TheBloke למודל Zephyr 7B Beta שפותח במקור על ידי Hugging Face H4 על בסיס Mistral 7B. המודל עבר אימון ישיר על העדפות, מה שמכונה DPO, במטרה לשפר את היכולת שלו לענות כמו עוזר אישי שימושי בלי ההגבלות הכבדות שמגיעות עם אימונים רגילים.

במדדי ביצועים כמו MT-Bench הוא מקבל ציון 7.34, ובאלפקה אוול הוא מגיע לשיעור ניצחון של 90.60 אחוזים. המשמעות בפועל היא שבמשימות שיחה כלליות וכתיבה חופשית הוא מתעלה אפילו על מודלים של שבעים מיליארד פרמטרים כמו Llama2-Chat, למרות שהוא שוקל שבריר מהם ועולה הרבה פחות משאבים.

מתאים ל

  • בוט שיחה באנגלית

    הוא מציג יכולת ניסוח ברמה של מודלים ענקיים ונכנס בקלות לכרטיס מסך ביתי.

  • ניסויי עבודה מקומיים

    פורמט GGUF נתמך כמעט בכל כלי מקומי בלי צורך בתשתית ענן יקרה.

  • עוזר מענה פנימי

    רישיון MIT פותח שימוש חופשי במוצרים מסחריים ללא תשלום תמלוגים.

איפה זה נופל

היוצרים מציינים בפירוש שהמודל לא עבר יישור קלאסי עם סינון אנושי פעיל, ולכן הוא מייצר בקלות פלט בעייתי או לא הולם כשמבקשים ממנו. בנוסף, הוא מתמחה בעיקר באנגלית. במשימות שדורשות תכנות מורכב, פתרון בעיות במתמטיקה או היגיון רב שלבי הוא מפגר בצורה ברורה אחרי מודלים מסחריים סגורים.

אותה משפחה

zephyr-7B-beta יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך כל הרשימה שמופיעה שם?

לא מורידים את כל המאגר ששוקל מעל חמישים גיגה, אלא בוחרים קובץ אחד בלבד. האפשרות המאוזנת ביותר היא zephyr-7b-beta.Q4_K_M.gguf שמציעה שילוב טוב בין דיוק לצריכת זיכרון.

האם המודל תומך בעברית ברמה טובה?

הכרטיס מצהיר על אנגלית בלבד כשפת עבודה עיקרית, והוא אומן על נתונים סינתטיים באנגלית. הוא אולי יבין מילים ספורות, אבל הוא לא מיועד למענה שוטף בעברית.

איך מריצים

להרצה מקומית מורידים קובץ בודד מהרשימה, כשההמלצה הרשמית היא גרסת Q4_K_M ששוקלת 4.37 גיגה בייט ודורשת פחות משבעה גיגה זיכרון עבודה, או Q5_K_M לאיכות קצת יותר גבוהה. אפשר לטעון אותו ישירות לתוך ספריות כמו llama.cpp או כלים עם ממשק גרפי כמו LM Studio ו־text-generation-webui, ואם יש לכם כרטיס מסך עם שמונה גיגה זיכרון אפשר לזרוק את כל השכבות אליו ולקבל מהירות מעולה.

אם אין לכם חומרה ייעודית בכלל ותרצו להריץ אותו רק על המעבד הוא עדיין יעבוד, אבל אם המטרה היא להרים שירות יציב שמשרת עשרות משתמשים במקביל, כנראה עדיף להשתמש בנקודת קצה מנוהלת במקום לתחזק שרת עצמאי.

ollama run hf.co/TheBloke/zephyr-7B-beta-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון MIT. המשמעות פשוטה: מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים פרטיים ולהפיץ אותו חופשי, כל עוד שומרים על הודעת זכויות היוצרים המקורית בקוד.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗