GPT
Q

Qwen2.5-14B-Instruct-1M

קוד פתוח

Qwenapache-2.02025-01-23

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה שמביאה חלון של מיליון טוקנים לגודל ביניים של 14 מיליארד פרמטרים. היא מיועדת למי שחייב לעבד מסמכי ענק מקומית בלי לטפס למודלים כבדים בהרבה.

  • 15Bפרמטרים
  • 1,010,000טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 72,329הורדות בחודש

מה זה

המודל לוקח את סדרת Qwen2.5 בגרסת 14.7 מיליארד פרמטרים ומרחיב את טווח הקלט מ־128 אלף טוקנים למיליון שלם, תוך שמירה על יכולת יצירה של עד 8,192 טוקנים בתשובה. הוא שומר על אותה ארכיטקטורת בסיס של 48 שכבות עם מנגנון Grouped Query Attention, אך מכוון לעיבוד טקסטים ארוכים במיוחד בלי לאבד את היכולות במשימות קצרות.

ההבדל המשמעותי מול מודלים מקבילים הוא שילוב של שיטות אקסטרפולציה ותשומת לב דלילה. המפתחים יצרו גרסה מותאמת של vLLM שמאפשרת להאיץ את העיבוד פי שלושה עד פי שבעה בטקסטים שמגיעים לקצה החלון, בהשוואה לריצה רגילה.

מתאים ל

  • ניתוח תיקי מסמכים מלאים

    מאפשר לטעון מאות עמודים של דוחות טכניים או משפטיים בבת אחת, בתנאי שהם באנגלית, ולשאול שאלות על כל המידע.

  • תחקור מאגרי קוד ענקיים

    קריאה של פרויקטים שלמים בתוך הפרומפט לצורך מעקב אחרי תלויות, מציאת באגים או ארכיטקטורה לרוחב אלפי קבצים.

  • סיכום הקלטות ותמלולים

    עיבוד של עשרות שעות תמלול ברצף אחד בלי לחתוך את השיחה למקטעים קטנים ובלי לאבד את ההקשר הכללי.

איפה זה נופל

הבעיה המרכזית היא ירידה ברמת הדיוק ברגע שחורגים מ־262,144 טוקנים בסביבות ריצה רגילות שלא משתמשות בקוד המותאם של הפרויקט. מעבר לכך, המודל מוגדר רשמית עבור אנגלית בלבד, כך שביצועים בעברית על פני מיליון טוקנים לא נבדקו ועלולים לסבול מהזיות ומאיטיות. ניהול הזיכרון דורש כוונון רגיש מאוד של גודל המנות, וכל חריגה מובילה מיד לשגיאות מחסור בזיכרון במאיץ.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי אחד?

לא בהקשר המלא. משקלי המודל עצמם שוקלים 27.5 גיגה בייט בדיוק של bfloat16, אבל ניהול הזיכרון של מיליון טוקנים דורש לפחות 320 גיגה בייט של זיכרון וידאו. כרטיס בודד יספיק רק לפרומפטים קצרים מאוד ורחוקים מהמקסימום.

למה חייבים להתקין גרסה מיוחדת של vLLM?

המודל משתמש בשיטות מיוחדות של תשומת לב דלילה כדי לעמוד בעומס החישובי של מיליון טוקנים. הרצה בספריות סטנדרטיות תביא לירידה בדיוק מעבר ל־256 אלף טוקנים ותהיה איטית פי כמה.

איך מריצים

כדי לנצל את מלוא מיליון הטוקנים תצטרכו מערך רציני של חומרה. המפתחים מציינים דרישה של לפחות 320 גיגה בייט של זיכרון וידאו, מה שאומר שרת עם מספר כרטיסי Ampere או Hopper דוגמת שמונה מאיצים, בחיבור מקבילי דרך vLLM.

בנוסף, נדרשת התקנה ידנית של ענף פיתוח מותאם מגיטהאב כדי שההרצה תעבוד בצורה תקינה. אם השרת שלכם לא מחזיק את כמות הזיכרון הזו או שאתם צריכים את ההקשר המלא רק לפעולות בודדות, עדיף בהחלט לפנות לממשק API מנוהל במקום להחזיק תשתית כזו בעצמכם.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-14B-Instruct-1M")
print(pipe("שלום"))

הרישיון

הקוד והמשקלים משוחררים תחת רישיון Apache 2.0 המלא. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו בחופשיות, כל עוד שומרים על הודעת זכויות היוצרים ונוסח הרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗