GPT
Q

Qwen1.5-7B-Chat

קוד פתוח

Qwenother2024-01-30

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת שיחה בגודל ביניים שמגיעה עם תמיכה מובנית בשיחות ארוכות במיוחד. היא פונה למי שצריך מודל עצמאי בלי לטעון קוד צד שלישי לא מוכר בספריות הקיימות.

  • 7.7Bפרמטרים
  • 32,768טוקנים בהקשר
  • 14.4 GBמשקל הקבצים
  • 12,896הורדות בחודש

מה זה

מדובר בגרסת בטא לקראת סדרת הדור הבא של הפרויקט, שעברה כוונון ייעודי לשיחות והעדפות אנושיות בעזרת שילוב של אימון מונחה ואופטימיזציית העדפה ישירה. בשונה מגרסאות ישנות יותר של אותה משפחה, הוא נתמך ישירות בתוך ספריית הטרנספורמרים הרשמית ללא צורך בהרצת קוד מרוחק, ומחזיק חלון הקשר יציב באורך של 32,768 טוקנים בכל הגדלים בסדרה.

הוא יושב על ארכיטקטורת בלוקים מודרנית עם טוקנייזר מעודכן לקוד ולשפות רבות, אבל בגרסת הבטא הזו בחר הצוות שלא להפעיל בו מנגנונים כמו חלוקת שאילתות לקבוצות, שנשמרה רק לגדלים גדולים יותר. בפועל אתם מקבלים מודל שיחה שמתמודד היטב עם טקסטים ארוכים מהרגיל לגודל שלו, אך דורש תשתית זיכרון סטנדרטית בלי קיצורי הדרך הארכיטקטוניים המתקדמים.

מתאים ל

  • ניתוח מסמכים טכניים ארוכים

    חלון של 32 אלף טוקנים מאפשר להזין קבצים ומפרטים שלמים ישירות לשיחה רציפה.

  • בוט שיחה עצמאי ומאובטח

    הוא רץ מקומית בלי לטעון קוד חיצוני ומאפשר שליטה מלאה בנתונים ובשיחות.

  • הרצה מקומית במכונות ביניים

    קיימות עבורו גרסאות מכומתות מוכנות שמתאימות לכרטיסים גרפיים פשוטים ולמעבדים.

איפה זה נופל

המודל הזה הוא גרסת בטא מוקדמת, והמפתחים מזהירים במפורש מתופעות של מעבר פתאומי ולא רצוי בין שפות בזמן יצירת הטקסט. כדי לנסות למנוע את הבאגים האלה, הם ממליצים להיצמד בדיוק להגדרות הריצה המקוריות שמגיעות בקובץ התצורה. בנוסף, חלון ההקשר המלא דורש משאבים כבדים מאוד ללא המנגנונים המקלים שנשמרו לדגמים הגדולים.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

למה מופיעה שגיאת מפתח בזמן טעינת המודל?

הארכיטקטורה דורשת ספריית טרנספורמרים בגרסה 4.37.0 לפחות. אם הגרסה ישנה יותר, הקוד פשוט לא מזהה את מבנה המודל החדש ונכשל מיד בהתחלה.

מה לעשות כשהמודל מתחיל לערבב שפות באמצע תשובה?

המפתחים מודעים לבעיה הזו וממליצים להשתמש בפרמטרים המדויקים שנמצאים בקובץ התצורה של המודל כדי לייצב את הפלט ולמנוע את התופעה.

איך מריצים

כדי להריץ אותו במשקל המקורי שלו, כמעט 15 גיגה בייט בפורמט חצי דיוק, תצטרכו כרטיס גרפי עם 16 עד 24 גיגה בייט של זיכרון ייעודי כדי להשאיר מקום גם להקשר הארוך. חובה לוודא שגרסת הספרייה אצלכם היא 4.37.0 לפחות, אחרת תקבלו שגיאת מפתח על ארכיטקטורת המודל.

אם השרת שלכם לא כולל חומרה מתאימה, המפתחים מציעים מראש גרסאות מכומתות בפורמטים שונים שמתאימים למעבדים רגילים או כרטיסים צנועים יותר, ורק אם אתם צריכים ביצועים מיידיים בתוך מוצר בלי לנהל שרתים ועומסים עדיף לפנות לפתרון מנוהל חיצוני.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-7B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כמותאם אישית ולא כרישיון קוד פתוח סטנדרטי. במצב כזה חובה לבדוק את תנאי השימוש המדויקים במאגר המקורי לפני שמשלבים אותו במוצר מסחרי, כדי לוודא שאין הגבלות שימוש, דרישות דיווח או תנאים מסחריים מיוחדים לגבי מספר המשתמשים.

הרישיון המלא בעמוד המודל ↗