GPT
Q

Qwen2.5-7B-Instruct-1M

קוד פתוח

Qwenapache-2.02025-01-23

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסה שמביאה חלון הקשר של מיליון טוקנים למודל שפוי של 7.6 מיליארד פרמטרים. היא מתאימה למי שרוצה לדחוף מסמכים ענקיים לזיכרון בלי להחזיק מפלצת של מאות מיליארדי משקלים.

  • 7.6Bפרמטרים
  • 1,010,000טוקנים בהקשר
  • 14.2 GBמשקל הקבצים
  • 227,867הורדות בחודש

מה זה

מדובר במודל שפה בגודל 7.6 מיליארד פרמטרים שתוכנן לקבל טקסט באורך של עד 1,010,000 טוקנים, ולייצר תשובות באורך של עד 8,192 טוקנים בכל פעם. הוא שומר על היכולות המקוריות של סדרת המודלים במשימות קצרות, אבל קיבל אימון נוסף כדי להתמודד עם כמויות מידע גדולות בהרבה מגרסת ברירת המחדל שתומכת רק ב־128 אלף טוקנים.

ההבדל המשמעותי מול רוב המודלים בגודל הזה הוא היכולת לחפש ולעבד מידע ברצפים ענקיים מקצה לקצה. במקום לפרק טקסטים לחתיכות קטנות או להסתמך על חיפוש סמנטי חיצוני, אפשר להזין קבצים שלמים ישירות לקונטקסט. המודל בנוי על ארכיטקטורת טרנספורמר עם 28 שכבות, ומשתמש במנגנון חלוקת תשומת לב של 28 ראשי שאילתות וארבעה ראשי מפתחות וערכים כדי לצמצם את תפיסת הזיכרון.

מתאים ל

  • ניתוח מסמכים טכניים ארוכים

    מאפשר לטעון מאות עמודים של תיעוד או מפרטים בבת אחת בלי לחתוך אותם לחלקים קטנים.

  • סריקת מאגרי קוד

    מתאים להזנה של פרויקטים שלמים כדי לאתר שגיאות, שינויי ארכיטקטורה או קשרים בין קבצים שונים.

  • תחקור פרוטוקולים ותמלילים

    מספק יכולת לשאול שאלות על שעות של תמלולים או דוחות מרוכזים בבקשה אחת.

איפה זה נופל

אם אין לכם שרת עם כמה כרטיסים גרפיים חזקים, לא תוכלו להגיע לקצה גבול היכולת שלו. שמירת הזיכרון של המפתחות והערכים ברצפים ארוכים תזרוק שגיאות זיכרון מיד. בנוסף, חלון הפלט מוגבל ל־8,192 טוקנים, כך שאי אפשר להשתמש בו כדי לכתוב מחדש ספרים שלמים. נקודה קריטית נוספת היא התלות בקוד ייעודי של מנוע ההרצה, בלי המימוש המותאם של מנגנון הקשב, הביצועים שלו נופלים משמעותית ברצפים ארוכים מ־256 אלף טוקנים.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי בודד?

אפשר להריץ אותו על כרטיס בודד רק למשימות קצרות עם הקשר רגיל. אם תנסו להעמיס עליו מאות אלפי טוקנים, הזיכרון של הכרטיס ייגמר מיד. ניצול מלוא החלון דורש לפחות 120 גיגה בייט זיכרון כרטיסי מסך.

למה צריך גרסה מיוחדת של vLLM בשבילו?

מנוע הרגיל יאבד מהדיוק שלו ברגע שתעברו רבע מיליון טוקנים. הגרסה המותאמת כוללת אלגוריתמים של תשומת לב דלילה שמאיצים את הקריאה עד פי שבעה ושומרים על התשובות מדויקות.

האם הוא יודע לכתוב טקסטים באורך מיליון טוקנים?

לא, חלון הקלט שלו מגיע למיליון טוקנים אבל הפלט מוגבל ל־8,192 טוקנים בכל הרצה. הוא נועד לקרוא כמויות אדירות של חומר ולתמצת או לחלץ מתוכו תשובה ממוקדת.

איך מריצים

המשקל הגולמי של הקבצים הוא 14.2 גיגה בייט בדיוק של bfloat16, אבל אל תתנו למספר הזה להטעות אתכם. אם אתם רוצים לנצל את מלוא ההקשר של מיליון טוקנים, תצטרכו לפחות 120 גיגה בייט של זיכרון כרטיסי מסך, שמחולקים לרוב על פני ארבעה מעבדים גרפיים מארכיטקטורת Ampere או Hopper.

בפועל אי אפשר פשוט לפתוח אותו בספריית קוד רגילה ולקוות לטוב. החבר'ה שפיתחו אותו דורשים להוריד ענף פיתוח ייעודי של תשתית vLLM שמממש תשומת לב דלילה. אם תנסו להריץ אותו על תשתית הרצה ישנה, הדיוק שלו מתחיל להישחק ברגע שעוברים 262,144 טוקנים.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen2.5-7B-Instruct-1M")
print(pipe("שלום"))

הרישיון

המודל משוחרר תחת רישיון Apache 2.0 מלא. זה אומר שמותר להשתמש בו לצרכים מסחריים, לשנות אותו, לבנות מעליו מוצרים סגורים ולהפיץ אותם בלי לשלם תמלוגים. התנאי היחיד הוא שמירה על הצהרת הרישיון ומתן קרדיט ליוצרים המקוריים בקוד או בהפצה שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗