GPT
Q

Qwen1.5-MoE-A2.7B

קוד פתוח

Qwenother2024-02-29

  • transformers
  • safetensors
  • qwen2_moe
  • text-generation
  • pretrained

יש כאן גם סקירה על Qwen עצמו.

מודל תערובת מומחים שדורש חישוב של מודל קטן ומספק ביצועים שמשתווים למודל 7B. הוא מתאים למי שרוצה מהירות גבוהה בזמן ריצה ומוכן להשקיע בזיכרון של מודל מלא.

  • 14Bפרמטרים
  • 8,192טוקנים בהקשר
  • 26.7 GBמשקל הקבצים
  • 672,767הורדות בחודש

מה זה

מדובר במודל שנוצר משדרוג של Qwen-1.8B לארכיטקטורת MoE, עם סך כולל של מעל 14 מיליארד פרמטרים שמהם רק 2.7 מיליארד פעילים בכל רגע. המבנה הזה נותן מהירות הסקה שמגיעה לפי 1.74 בהשוואה לגרסת Qwen1.5-7B, תוך שמירה על רמת ביצועים דומה לשלה.

המודל אומן על אנגלית בלבד ומגיע עם חלון הקשר של 8,192 טוקנים ב־24 שכבות. במקום לחשב את כל הרשת בכל מילה, הניתוב הפנימי מעביר את המידע רק לחלק מהמומחים, מה שחוסך זמן עיבוד יקר בלי לוותר על איכות התוצאה.

מתאים ל

  • אימון ייעודי למשימות באנגלית

    בסיס טוב לביצוע SFT ואימונים מותאמים, כפי שממליצים המפתחים.

  • הסקה מהירה על שרתים מקומיים

    מהירות הסקה גבוהה פי 1.74 ממודל 7B רגיל, אידיאלי למערכות שדורשות זמני תגובה קצרים.

  • שירותי שפה בעלי שיהוי נמוך

    הפעלה של 2.7 מיליארד פרמטרים בלבד בזמן ריצה חוסכת חישובים בכל טוקן.

איפה זה נופל

זהו מודל בסיס ולא מודל צ'אט, והיוצרים מציינים במפורש שלא כדאי להשתמש בו ישירות ליצירת טקסט ללא אימון המשך כמו SFT או RLHF. בנוסף, הוא מתועד עבור השפה האנגלית בלבד, כך שאינו מיועד למשימות בעברית, ותצטרכו לבצע התאמות כדי לקבל ממנו תוצאות טובות בשיחה.

אותה משפחה

Qwen1.5-MoE-A2.7B יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם אפשר להשתמש בו מיד כצ'אטבוט?

לא מומלץ. היוצרים מציינים בעצמם שזהו מודל בסיס שנועד לאימון המשך, ולכן הוא לא יענה בצורה מובנית לשאלות בלי כוונון מקדים.

למה צריך כל כך הרבה זיכרון בשביל מודל של 2.7 מיליארד פרמטרים?

כי כל 14.3 מיליארד הפרמטרים חייבים לשבת בזיכרון כדי שהניתוב יעבוד. רק החישוב בפועל מתבצע על 2.7 מיליארד בכל שלב, אבל הקבצים ששוקלים 26.7 גיגה בייט עדיין נטענים במלואם.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־26.7 גיגה בייט בדיוק של bfloat16, כך שתצטרכו כרטיס מסך שיכול להחזיק את כל המשקלים בזיכרון, למרות שבזמן חישוב בפועל רצים רק 2.7 מיליארד פרמטרים. להרצה נדרשת ספריית transformers ישירות מגיטהאב כדי למנוע שגיאות זיהוי של הארכיטקטורה.

אם אין לכם חומרה שמחזיקה קבצים בנפח כזה בזיכרון הגרפי, עדיף להשתמש בנקודת קצה מרוחקת שמציעה אותו. הפעלת מודל כזה מקומית שווה את ההשקעה רק כשיש לכם צורך מובהק במהירות תגובה גבוהה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-MoE-A2.7B")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר בתור other ולא תחת רישיון קוד פתוח סטנדרטי. במצב כזה חובה לגשת למאגר המקורי ולקרוא את תנאי השימוש המדויקים לפני שמשלבים אותו במוצר מסחרי, כי ההגבלות המשפטיות אינן מפורטות כאן בצורה פתוחה.

הרישיון המלא בעמוד המודל ↗