GPT
Q

Qwen2-57B-A14B

קוד פתוח

Qwenapache-2.02024-05-22

  • transformers
  • safetensors
  • qwen2_moe
  • text-generation
  • pretrained

יש כאן גם סקירה על Qwen עצמו.

מודל תערובת מומחים שמחזיק 57 מיליארד פרמטרים אך מפעיל רק 14 מיליארד בכל ריצה. הוא נותן ביצועים חזקים בקוד ובמתמטיקה יחד עם מהירות הסקה גבוהה.

  • 57Bפרמטרים
  • 131,072טוקנים בהקשר
  • 107 GBמשקל הקבצים
  • 9,837הורדות בחודש

מה זה

מדובר במודל בסיס שמשתמש בארכיטקטורת תערובת מומחים כדי לחסוך בכוח חישוב בזמן ריצה. הרעיון פשוט: מתוך 57 מיליארד פרמטרים שיושבים בזיכרון, רק 14 מיליארד משתתפים בחישוב של כל טוקן. זה מייצר מהירות תגובה גבוהה מאוד ביחס לגודל שלו, ובבדיקות של היוצרים על שני כרטיסי A100 עם vLLM הוא הציג קצב של מעל עשרת אלפים טוקנים לשנייה, כמעט כפול ממודל רגיל של 32 מיליארד פרמטרים.

במדדי ביצועים הוא עוקף מודלים כמו Mixtral-8x7B ומתעלה עליהם בעיקר במשימות תכנות ופתרון בעיות מתמטיות. עם תוצאה של 53 נקודות ב־HumanEval ו־43 נקודות ב־MATH, הוא מציג יכולת ניתוח גבוהה משמעותית ממודלים בגודל דומה. לצד זה, המודל מגיע עם חלון הקשר ענקי של 131,072 טוקנים שמאפשר לבלוע מסמכים טכניים ארוכים או ספריות קוד שלמות.

מתאים ל

  • אימון מודל קוד ארגוני

    תוצאות גבוהות במבחני תכנות הופכות אותו לבסיס מצוין לכוונון על מאגרי קוד פנימיים של החברה.

  • בסיס לכוונון הוראות

    מתאים למי שרוצה לבצע SFT או RLHF עצמאי כדי לייצר מודל שירות מותאם ומדויק.

  • עיבוד מסמכים ארוכים

    חלון הקשר של 131,072 טוקנים מאפשר לנתח קבצי ענק במהירות הודות להפעלה של 14 מיליארד פרמטרים בלבד.

איפה זה נופל

זהו מודל בסיס ולא מודל שיחה, והיוצרים מציינים במפורש שהם לא ממליצים להשתמש בו ישירות ליצירת טקסט בלי אימון המשך. אם תשלחו לו פקודות כמו לבוט רגיל, תקבלו השלמת משפטים ולא תשובות הגיוניות. בנוסף, למרות שהטוקנייזר תומך בריבוי שפות, כרטיס המודל מסמן רשמית רק אנגלית, ואין עדות ליכולת עבודה סבירה בעברית ללא כוונון ייעודי.

אותה משפחה

Qwen2 יצא ב־13 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש בו לצ'אט ישר אחרי ההורדה?

לא. זהו מודל בסיס שנועד להשלמת טקסט ולא אומן לעקוב אחרי הוראות של משתמש. כדי לדבר איתו בצורה נוחה צריך להשתמש בגרסת הצ'אט של הסדרה או לאמן אותו בעצמכם על נתוני שיחה.

למה להעדיף אותו על פני מודל מלא באותו הגודל?

היתרון המרכזי הוא שילוב של ידע רחב ומהירות. מכיוון שהוא מפעיל רק 14 מיליארד פרמטרים בכל טוקן, מהירות ההסקה שלו כפולה ממודלים רגילים, תוך שמירה על רמת דיוק גבוהה שנשענת על נפח הזיכרון הכולל.

איך מריצים

כדי להריץ אותו עצמאית תצטרכו שרת כבד. המשקלים לבדם תופסים 107 גיגה בייט בפורמט bfloat16, מה שאומר שחייבים לפחות שני כרטיסי מסך מקצועיים ברמה של A100 כדי שהכל ייכנס לזיכרון יחד עם ההקשר. תזדקקו גם לספריית transformers מגרסה 4.40.0 ומעלה כדי שהמערכת תזהה את הארכיטקטורה.

אם אין לכם תשתית ענן ייעודית כזו, אל תנסו לסחוב את זה על חומרה מקומית. עבור רוב המפתחים עדיף לגשת אליו דרך שירותי ענן או API שמארחים אותו, כי העלות של החזקת שרתים עם מספיק זיכרון וידאו תהיה יקרה מדי לצריכה מזדמנת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2-57B-A14B")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים שוחררו תחת רישיון apache-2.0. הרישיון הזה מתיר שימוש מסחרי מלא, שינוי של המודל והפצה שלו, כל עוד שומרים על הודעת זכויות היוצרים המקורית. אתם חופשיים לבנות עליו מוצרים פנימיים או שירותים בתשלום בלי לשלם תמלוגים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗