GPT
Q

Qwen1.5-0.5B-Chat

קוד פתוח

Qwenother2024-01-31

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

יש כאן גם סקירה על Qwen עצמו.

גרסת שיחה זעירה ששוקלת רק 1.2 גיגה בייט ומיועדת לעבוד מקומית על מעבדים חלשים. היא נותנת חלון הקשר ענק יחסית למשקל שלה, בלי צורך להריץ קוד מרוחק.

  • 620Mפרמטרים
  • 32,768טוקנים בהקשר
  • 1.2 GBמשקל הקבצים
  • 71,372הורדות בחודש

מה זה

זהו הדגם הקטן ביותר בסדרת הבטא Qwen1.5, עם כ־620 מיליון פרמטרים בלבד. הוא עבר כוונון ייעודי לשיחה באמצעות הוראות מונחות ואופטימיזציית העדפות ישירה, מה שמאפשר לו להחזיר תשובות ישירות במבנה של צ'אט. המודל נתמך ישירות בספריית transformers ללא צורך בהרצת קוד חיצוני של צד שלישי.

למרות הגודל הזעיר, המפתחים שמרו על חלון הקשר של 32,768 טוקנים, בדיוק כמו בדגמים הענקיים בסדרה. עם זאת, בגרסה הזו לא נכללו מנגנוני זיכרון יעילים כמו GQA שנשמרו לדגמים הגדולים יותר, כך שעבודה עם הקשרים מלאים עדיין תדרוש זיכרון עבודה משמעותי.

מתאים ל

  • בוט מקומי על מעבדי קצה

    שוקל 1.2 גיגה בייט בלבד ומאפשר מענה קולי או טקסטואלי מקומי בלי חיבור רשת ובלי צורך במאיץ גרפי יקר.

  • מיון וסיווג טקסטים קצרים

    רץ במהירות גבוהה ויכול להחזיר תיוגים בסיסיים על כמויות גדולות של נתונים בעלות חומרה אפסית.

  • סביבות פיתוח ובדיקות

    נטען בשניות בזיכרון ומאפשר לבדוק תהליכי עבודה של צ'אט והזנת תבניות שיחה לפני מעבר למודלים כבדים.

איפה זה נופל

עם 620 מיליון פרמטרים, כושר ההסקה וההבנה הלוגית של המודל מוגבלים מאוד. הכרטיס מודה במפורש בבעיות כמו code switching, כלומר נטייה לערבב שפות או לקפוץ לשפה אחרת באמצע משפט, וממליץ להשתמש בפרמטרי יצירה קבועים מראש כדי למזער תקלות. בנוסף, חלון של 32 אלף טוקנים על דגם כזה קטן עלול לייצר בלבול מהיר במעקב אחרי הנחיות ארוכות.

אותה משפחה

Qwen1.5 יצא ב־21 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם המודל תומך בעברית בצורה טובה?

הכרטיס מציין תמיכה רב־לשונית, אך שפת המודל הרשמית המוגדרת היא אנגלית בלבד. בנפח של 620 מיליון פרמטרים, היכולת שלו לייצר עברית רציפה או מורכבת חלשה מאוד, והוא צפוי לערבב מילים או לסבול מטעויות תחביר קשות.

האם אפשר לנצל באמת את כל 32 אלף הטוקנים?

התמיכה קיימת בארכיטקטורה, אבל בפועל מודל בגודל כזה מתקשה לשמור על קוהרנטיות לאורך טקסטים ארוכים. בנוסף, בהיעדר GQA בגרסה הזו, צריכת הזיכרון בעת מילוי כל ההקשר תקפוץ מעבר למשקל הבסיסי של הקבצים.

איך מריצים

הקבצים שוקלים 1.2 גיגה בייט בפורמט bfloat16, כך שאפשר להריץ אותו בלי שום בעיה על כל מעבד מודרני או מאיץ גרפי פשוט, כולל חומרת קצה ומחשבים ניידים. צריך לוודא שגרסת ספריית transformers היא 4.37.0 ומעלה כדי להימנע משגיאות בזיהוי הארכיטקטורה. יש גם גרסאות מקוונטטות כמו GGUF ו־AWQ שמאפשרות לחתוך את צריכת הזיכרון עוד יותר.

אם אתם צריכים רק פניות בודדות לשיחה מורכבת ועמוקה, עדיף להשתמש ב־API של דגמים גדולים בהרבה. היתרון בהרצה עצמית כאן קיים רק כשחייבים תגובה מקומית מהירה, פרטיות מלאה, או עבודה ללא רשת.

from transformers import pipeline

pipe = pipeline("text-generation", model="Qwen/Qwen1.5-0.5B-Chat")
print(pipe("שלום"))

הרישיון

הרישיון מוגדר כ־other ולא כרישיון קוד פתוח סטנדרטי כמו MIT או Apache. המשמעות היא שקיימים תנאי שימוש ייחודיים שחובה לבדוק בקובץ הרישיון המקורי של הפרויקט לפני שמשלבים אותו במוצר מסחרי, כדי לוודא שאין מגבלות הפצה או שימוש מסחרי שמסכנות אתכם.

הרישיון המלא בעמוד המודל ↗