GPT
Q

Qwen1.5-MoE-A2.7B-Chat

קוד פתוח

Qwenother2024-03-14

  • transformers
  • safetensors
  • qwen2_moe
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

מודל שיחה שמבוסס על תערובת מומחים, ונותן ביצועים של מודל שבעה מיליארד עם עלות חישוב של פחות משלושה בזמן ריצה.

  • 14Bפרמטרים
  • 32,768טוקנים בהקשר
  • 26.7 GBמשקל הקבצים
  • 42,705הורדות בחודש

מה זה

מדובר במודל שיחה שמחזיק מעל 14 מיליארד פרמטרים בזיכרון, אבל מפעיל בפועל רק 2.7 מיליארד עבור כל טוקן. הבסיס שלו מגיע משדרוג של מודל צפוף קטן יותר, ועבר אימון נוסף עם כוונון עדין והתאמת העדפות ישירה. הרעיון פה פשוט, לקבל את איכות התשובות והידע של מודל גדול בהרבה, אבל לחסוך זמן עיבוד יקר בכל בקשה.

לפי המפתחים, הוא מגיע לרמת ביצועים דומה מאוד לזו של מודל שבעה מיליארד פרמטרים רגיל מאותה סדרה. ההבדל הגדול הוא בקצב הייצור, שמהיר פי 1.74 ממנו, ובמשאבים שנצרכו בשלב האימון. חלון ההקשר עומד על קצת יותר מ־32 אלף טוקנים, כך שהוא מסוגל להתמודד עם מסמכים ארוכים למדי בלי לאבד את השיחה.

מתאים ל

  • בוט שיחה מהיר בענן

    זמן מענה קצר פי 1.74 ממודלים רגילים באותה רמת איכות, מה שמוזיל עלויות שרת בעומס.

  • ניתוח טקסטים ארוכים

    הקשר של 32 אלף טוקנים מאפשר להזין תיעוד ומסמכים גדולים בלי לפצל אותם.

  • מערכות מענה מבוססות הקשר

    אימון ייעודי לשיחה שמאפשר חיבור קל למאגרי מידע קיימים דרך חלון טוקנים רחב.

איפה זה נופל

החיסרון המרכזי במודלי תערובת מומחים הוא הזיכרון. למרות שזמן הריצה קל, עדיין צריך להחזיק את כל 14 המיליארד פרמטרים בתוך כרטיס המסך. בנוסף, המפתחים מזהירים במפורש מתופעות של החלפת שפה לא רצויה באמצע הטקסט ותשובות מקולקלות, וממליצים להשתמש רק בהגדרות הייצור המדויקות שלהם. שפת המקור הרשמית היא אנגלית, כך ששימוש בעברית עלול לקרטע.

אותה משפחה

Qwen1.5-MoE-A2.7B יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל דורש פחות זיכרון מכרטיס המסך?

לא. בזמן ריצה הוא מחשב רק 2.7 מיליארד פרמטרים, אבל כל 14 המיליארד חייבים לשבת בזיכרון הווידאו. המשקל בדיוק המקורי תופס כמעט 27 גיגה בייט.

למה מופיעה שגיאת ארכיטקטורה בטעינה?

ספריית הטרנספורמרס בגרסאות ישנות לא מכירה את השם של המודל הזה. צריך להתקין את הגרסה העדכנית ישירות מהפרויקט בגיטהאב כפי שהמפתחים מציינים.

איך מריצים

כדי להריץ אותו בפורמט המקורי צריך כרטיס מסך שמסוגל להחזיק קרוב ל־27 גיגה בייט בזיכרון, מה שמכוון בדרך כלל לכרטיסים מקצועיים או שרתים ייעודיים. מי שאין לו חומרה כזו יכול לבחור בגרסת הקוונטיזציה בארבעה ביט שהמפתחים הזכירו, שמורידה את דרישות הזיכרון ומאפשרת ריצה על כרטיסים ביתיים חזקים.

מבחינת קוד, הוא רץ דרך ספריית הטרנספורמרס הרגילה, אבל דורש גרסה עדכנית ישירות מהקוד כדי לזהות את הארכיטקטורה. אם השרת שלכם לא מחזיק מספיק זיכרון וידאו בשביל הקבצים הגדולים, עדיף להשתמש בפתרון חיצוני ולא לנסות לדחוף אותו בכוח לחומרה קטנה.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-MoE-A2.7B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית ולא כרישיון קוד פתוח סטנדרטי. במצב כזה חובה לקרוא את התנאים המצורפים בקובץ הרישיון המקורי לפני שמשלבים אותו במוצר או שירות מסחרי, כדי לא להפר מגבלות שימוש או הפצה.

הרישיון המלא בעמוד המודל ↗