GPT
Z

zephyr-7B-alpha-GGUF

קוד פתוח

TheBlokemit2023-10-11

  • transformers
  • gguf
  • mistral
  • generated_from_trainer
  • en

גרסת GGUF מכווצת של מודל שיחה מבוסס Mistral 7B שעבר אימון העדפות ישיר. פתרון קל להרצה מקומית על מחשב אישי או שרת ללא תלות בענן.

  • 51.2 GBמשקל הקבצים
  • 2,094הורדות בחודש
  • 138לייקים

מה זה

מדובר בהמרה לפורמט GGUF של Zephyr 7B Alpha שיצרו Hugging Face H4 על בסיס Mistral 7B v0.1. המודל עבר כוונון עדין על שיחות סינתטיות ממאגר UltraChat ויישור העדפות באמצעות DPO על גבי UltraFeedback, במקום להשתמש בשיטות הישנות של RLHF. המטרה היתה לייצר עוזר שיחה קטן שעונה בצורה מועילה וישירה בלי הסירוסים הרגילים של מודלים מיושרים.

במדדי ההערכה המודל השיג דיוק תגמול של 0.7812 וציון loss של 0.4605 על סט הבדיקה שלו, כשבמהלך האימון הסירו במכוון חלק ממנגנוני הסינון כדי לשפר את הביצועים במבחן MT Bench. בפועל קיבלתם מודל 7B שמדבר ומתנהג בצורה חופשית ומהירה יותר מרוב מה שהיה זמין בקטגוריית המשקל הזו בסוף 2023.

מתאים ל

  • בוט שיחה מקומי באנגלית

    מתאים לשיחה שוטפת ומענה לשאלות על מחשב אישי מנותק מרשת, בזכות אימון ה־DPO שמותאם לדיאלוגים.

  • מחקר על מודלים לא מסוננים

    שימושי לבדיקת התנהגות מודלי שפה קטנים שהוסרו מהם מנגנוני הבטיחות הרגילים כדי למדוד השפעה על איכות התשובה.

  • פיתוח יישומים עם LangChain

    מאפשר בדיקת פייפליינים מקומית דרך llama-cpp-python או ctransformers בלי לשלם על קריאות API חיצוניות.

איפה זה נופל

היוצרים מצהירים בפירוש שהמודל לא עבר יישור קפדני להעדפות אנושיות ואין בו מנגנון סינון תשובות בזמן אמת כמו במערכות של חברות מסחריות גדולות. המשמעות היא שהמודל נוטה לייצר פלטים בעייתיים או פוגעניים אם מבקשים ממנו, ולכן הכרטיס שלו מגדיר אותו למטרות מחקר ולימוד בלבד ולא לסביבת ייצור פתוחה. בנוסף, המודל אומן בעיקר על אנגלית, כך שביצועים בעברית אינם מובטחים ולא נבדקו בחומר הרשמי.

שאלות
נפוצות

איזה קובץ בדיוק צריך להוריד מתוך כל הקבצים בדף?

עבור רוב המחשבים מומלץ להוריד את zephyr-7b-alpha.Q4_K_M.gguf. הוא שוקל 4.37 גיגהבייט ומספק איזון מוצלח בין שמירה על יכולות המודל המקורי לדרישות זיכרון סבירות של פחות מ־7 גיגהבייט RAM.

האם המודל יפעל בצורה טובה בעברית?

הכרטיס מציין במפורש שהשפה העיקרית של המודל היא אנגלית. הוא נשען על Mistral ועל דאטהסטים סינתטיים באנגלית, לכן לא הייתי בונה עליו למשימות טקסט מורכבות בשפה העברית.

איך מריצים

להרצה בפועל צריך כלי שתומך בפורמט GGUF כמו llama.cpp, LM Studio, KoboldCpp או ספריית llama-cpp-python. לא מורידים את כל המאגר ששוקל 51.2 גיגהבייט אלא קובץ יחיד לפי החומרה שיש לכם. הגרסה המאוזנת והמומלצת לרוב האנשים היא Q4_K_M ששוקלת 4.37 גיגהבייט ודורשת 6.87 גיגהבייט זיכרון להרצה מלאה על מעבד בלבד.

אם יש לכם כרטיס מסך עם לפחות 6 עד 8 גיגהבייט VRAM, אפשר לטעון אליו את כל השכבות ולקבל מהירות תגובה גבוהה. אם יש לכם מחשב ישן בלי מאיץ גרפי סביר ותרצו להריץ מקבילית עומסים לכמה משתמשים בו זמנית, עדיף לפנות ל־API מסחרי במקום לחנוק את המעבד המקומי.

ollama run hf.co/TheBloke/zephyr-7B-alpha-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון MIT. זהו רישיון קוד פתוח מתירני מאוד שמאפשר שימוש חופשי, שינוי, הפצה ומסחר, כולל הטמעה במוצרים מסחריים סגורים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקבצים שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗