GPT
W

WizardLM-2-8x22B-GGUF

קוד פתוח

MaziyarPanahiרישיון לא דווח2024-04-15

  • transformers
  • gguf
  • quantized
  • 2-bit
  • 3-bit

גרסת GGUF מכווצת לאחד ממודלי הקוד הפתוח הכבדים של מיקרוסופט. פתרון למי שחייב מודל ענק מקומית ומוכן לשלם במשאבי זיכרון קיצוניים.

  • 1005 GBמשקל הקבצים
  • 1,990הורדות בחודש
  • 130לייקים

מה זה

מדובר בהמרה של המודל WizardLM-2-8x22B מבית מיקרוסופט לפורמט GGUF, שמיועד לעבודה ישירה דרך llama.cpp. במקור זהו מודל מסוג Mixture of Experts שמחזיק ארכיטקטורה ענקית, והוא נבנה כדי להתמודד עם מטלות מורכבות של הבנה, יצירת טקסט ופתרון בעיות ברמה גבוהה.

היתרון המרכזי כאן הוא היכולת להריץ מודל במשקל כזה בלי להחזיק תשתיות ענן מורכבות של מעבדי H100 ייעודיים, אלא בחלוקה לקבצים מכווצים ברמות שונות. עם זאת, הדף לא מציג מבחני ביצועים מספריים או השוואות רשמיות מול מתחרים, ולכן תצטרכו לבחון בעצמכם איך רמות הקוונטיזציה השונות משפיעות על איכות הפלט בפועל.

מתאים ל

  • ניסויי שפה מקומיים

    בדיקת יכולות של מודל ענק על שרת פנימי כשלא רוצים להוציא נתונים לשירותי ענן חיצוניים.

  • הפעלת משימות ללא אינטרנט

    הרצה מקומית של שאלות ותשובות דרך llama.cpp בסביבות מנותקות רשת.

  • בדיקת רמות קוונטיזציה

    השוואה מעשית בין דיוק המודל בגרסאות דחיסה שונות על אותה חומרה.

איפה זה נופל

ההגבלה הראשונה והכבדה ביותר היא המשקל, שדורש פיצול של המודל למספר קבצים וחומרה שאין לרוב המפתחים על המחשב האישי. בנוסף, כרטיס המודל לא חושף מגבלות טכניות, חולשות ספציפיות בטקסט או מדדים על יכולות בשפות שאינן אנגלית, ולכן חובה לבדוק אותו עצמאית מול כל תרחיש שימוש שאינו באנגלית לפני שמשלבים אותו במערכת אמיתית.

אותה משפחה

WizardLM-2 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם צריך להוריד את כל הקבצים שבמאגר?

ממש לא, המאגר כולל מספר גרסאות כיווץ יחד. אתם בוחרים את רמת הדחיסה הרצויה, למשל Q4_K_S, ומורידים רק את הקבצים הממוספרים ששייכים אליה.

איך מגדירים את הטקסט כדי לקבל תשובה טובה?

המודל מצפה לתבנית ברורה שמפרידה בין המערכת, המשתמש והעוזר. אפשר להשתמש בהוראת מערכת פשוטה שאחריה מופיע USER והשאלה שלכם, או בפורמט השיחה המורחב שמודגם בדף המודל.

איך מריצים

המודל הזה דורש שימוש ב־llama.cpp או כלים תומכי GGUF שיודעים לטעון קבצים מפוצלים. במקום להוריד את כל המאגר, שכולל עשרות קבצים בנפח כולל עצום, מורידים רק את החלקים של הקוונט הספציפי שבו רוצים להשתמש, למשל באמצעות huggingface-cli וסינון קבצי Q2_K או Q4_K_S.

מבחינת חומרה, גם בגרסאות המכווצות ביותר נדרש נפח זיכרון RAM או VRAM חריג של עשרות רבות של ג'יגה בייט כדי לטעון ולהריץ אותו בצורה סבירה. אם אין לכם תחנת עבודה ייעודית עם כרטיסי מסך חזקים או שרת מקומי עם מאות ג'יגה בייט של זיכרון, עדיף לחפש שירות שמציע את המודל המקורי דרך API במקום להסתבך עם זמני טעינה איטיים במיוחד.

ollama run hf.co/MaziyarPanahi/WizardLM-2-8x22B-GGUF:Q6_K

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

64 קבצים במאגר, 1005 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון של המאגר הזה מסומן ככזה שלא דווח. במצב כזה אין אישור מפורש לשימוש מסחרי, וכל שילוב שלו במוצר מסחרי חושף אתכם לסיכון משפטי עד לבירור הרישיון המקורי של מיקרוסופט.

הרישיון המלא בעמוד המודל ↗