GPT
W

WizardLM-2-7B-GGUF

קוד פתוח

MaziyarPanahiרישיון לא דווח2024-04-15

  • transformers
  • gguf
  • mistral
  • quantized
  • 2-bit

גרסת GGUF יעילה למודל שמיקרוסופט אימנה על בסיס מיסטרל שבעה מיליארד. הוא מביא ביצועי שיחה והיגיון של מודלים כבדים בהרבה ישירות לחומרה ביתית.

  • 62.4 GBמשקל הקבצים
  • 152,441הורדות בחודש
  • 83לייקים

מה זה

מיקרוסופט ביססה את הפיתוח על Mistral-7B-v0.1 והעבירה אותו אימון עם דאטה סינתטי שנוצר כולו על ידי בינה מלאכותית. המטרה הייתה לייצר יכולות היגיון, צ'אט מורכב, תכנות ומענה רב לשוני בלי לנפח את כמות הפרמטרים. המאגר הנוכחי כולל המרות שביצע MaziyarPanahi לפורמט GGUF, מה שפותח גישה ישירה לכלים מבוססי מעבד וכרטיסים גרפיים פשוטים.

במדדי MT-Bench שהיוצרים פרסמו, הוא מוביל את קטגוריית הגודל שלו. במבחני העדפת אנוש ללא תוצאות תיקו, המודל מציג רמת ביצועים שמשתווה ל־Qwen1.5-32B שעוקף אותו בגודל פי ארבעה, ואף גובר על Qwen1.5-14B ו־Starling-LM-7B. זה אומר שמקבלים יכולת ניסוח והבנת הוראות שמזכירה מודלים בינוניים, אבל במהירות תגובה של שבעה מיליארד פרמטרים.

מתאים ל

  • בוט תמיכה מקומי

    מאפשר הרצה של צ'אט רב שלבי מורכב בתוך רשת ארגונית סגורה ובמהירות גבוהה.

  • עוזר תכנות במחשב נייד

    מספק יכולות חשיבה ופתרון באגים מקומיים בלי לשלוח קוד פנימי לשרתים חיצוניים.

  • עיבוד טקסטים ארוכים

    תומך בחלון של עד 32K טוקנים לקריאת מסמכים ומיצוים על חומרה ביתית.

איפה זה נופל

למרות ההבטחה לרב לשוניות, המודל נשען על בסיס מיסטרל שלא אומן ייעודית על עברית. איכות השפה והתחביר המקומי יהיו נמוכים משמעותית מאנגלית, ויש לבדוק את ההבנה היטב לפני שילוב בממשק עברי. בנוסף, קיימת סתירה פנימית בתיעוד לגבי מבנה הפרומפט: חלק מהמדריך מפנה לפורמט Vicuna, ובדוגמת ההרצה מופיע פורמט ChatML, מה שעלול לייצר פלט משובש אם לא מוגדר נכון.

אותה משפחה

WizardLM-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ צריך להוריד מתוך המאגר?

מספיק להוריד קובץ יחיד לפי החומרה שלכם ולא את כל התיקייה. הקובץ המאוזן לרוב השימושים הוא Q4_K_M, ששומר על איכות טובה מול דרישות זיכרון נמוכות.

איך המודל מתמודד עם עברית?

הבסיס הוא מיסטרל המיועד בעיקר לאנגלית, והאימון הנוסף אמנם רב לשוני אך לא ממוקד בישראל. אפשר לצפות לפלט עברי בסיסי, אך לניסוחים מורכבים תיתקלו בתחביר שבור והזיות.

איך מריצים

אין צורך להוריד את כל המאגר ששוקל 62.4 ג'יגה בייט, אלא רק קובץ כימות בודד. להרצה מקומית משתמשים בכלים כמו llama.cpp, LM Studio או ספריית llama-cpp-python. דחיסות פופולריות כמו Q4_K_M דורשות פחות משמונה ג'יגה בייט זיכרון וידאו, מה שמאפשר לטעון את כל 35 השכבות לכרטיס מסך בסיסי או להריץ על זיכרון המחשב.

המפרט תומך בהקשר של עד 32,768 טוקנים, אך משיכת חלון מלא כזה תגדיל משמעותית את צריכת הזיכרון. אם מטרת הפיתוח היא רק קריאות פשוטות בלי דרישה לפרטיות מוחלטת או הרצה מנותקת מרשת, שירות ענן יחסוך את כאב הראש של תחזוקת שרת מקומי.

ollama run hf.co/MaziyarPanahi/WizardLM-2-7B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המאגר המקורי של מיקרוסופט מציין רישיון Apache 2.0 שמאפשר שימוש מסחרי, שינוי והפצה תחת ייחוס. עם זאת, בעמוד ההמרה הנוכחי של MaziyarPanahi הרישיון מוגדר כלא דווח. אם אתם בונים מוצר מסחרי, כדאי לוודא משפטית את שרשרת הרישוי מול הפרויקט המקורי כדי למנוע חשיפה.

הרישיון המלא בעמוד המודל ↗