GPT
Q

Qwen2-0.5B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-06-06

  • gguf
  • instruct
  • chat
  • text-generation
  • en

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל שיחה זעיר, שמיועדת למכשירים חלשים במיוחד או סביבות קצה ללא מעבד גרפי חזק. הוא מתאים למי שחייב מודל מקומי עם אפס עלויות תשתית וצריכת זיכרון מינימלית.

  • 4.0 GBמשקל הקבצים
  • 9,347הורדות בחודש
  • 77לייקים

מה זה

מדובר במודל שיחה מיושר שפותח על ארכיטקטורת שנאי עם Group Query Attention ומנגנון SwiGLU, ועבר אימון נוסף בהנחיות ואופטימיזציית העדפות. הייחוד כאן הוא הפורמט הדחוס שמאפשר עבודה ישירה מול llama.cpp בלי שרתי ענק, כשהוא מביא איתו טוקנייזר מותאם לשפות מרובות וקוד.

היוצרים מציגים בדיקות פרפלקסיטי על wikitext, שבהן רואים את מחיר הכיווץ. המודל המקורי עומד על ציון 15.11, גרסת q5_k_m שומרת על 15.24 שזה כמעט זהה, אבל כשיורדים לגרסאות דחוסות יותר כמו q2_k הציון קופץ ל־16.74, מה שאומר שהמודל מתחיל לאבד עקביות ולייצר טעויות בטקסט.

מתאים ל

  • מענה בסיסי במכשירי קצה

    משקל זעיר שמאפשר הרצה מקומית על מחשבים פשוטים ללא צורך באינטרנט או בשרת.

  • שרת מקומי דמוי OpenAI

    עבודה מול llama-server שמתחבר ישירות לספריות קוד קיימות בלי לשלם על טוקנים.

  • עיבוד פניות פשוטות בקוד

    מיון טקסטים או ניסוח תגובות קצרות באפליקציות פנימיות שדורשות מהירות ואפס עלות.

איפה זה נופל

עם חצי מיליארד פרמטרים, המודל הזה מתקשה מאוד במשימות מורכבות, נימוק עמוק או פתרון בעיות מתמטיות מסובכות. הוא נוטה להזיות ברגע שהשאלה דורשת ידע רחב, וטבלת המדידות מראה בבירור שרמות הכיווץ האגרסיביות פוגעות בו קשה. בנוסף, הכרטיס מציין אנגלית בלבד כשפה רשמית, כך שאין שום הבטחה לגבי איכות העבודה בעברית. אל תבנו עליו כתחליף למודלי ענק במשימות קריטיות.

אותה משפחה

Qwen2 יצא ב־13 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזו גרסת קובץ כדאי להוריד מתוך הרשימה?

לרוב השימושים מומלץ לקחת את q5_k_m, שמציגה ציון פרפלקסיטי של 15.24 שקרוב מאוד למקור ואינה תופסת הרבה מקום. אם המקום בזיכרון קריטי אפשר לרדת לגרסאות q4, אך מומלץ להימנע מגרסת q2_k שבה איכות הטקסט יורדת משמעותית.

האם המודל יצליח לענות בעברית תקינה?

כרטיס המודל מגדיר רשמית תמיכה באנגלית בלבד. למרות שהטוקנייזר כולל תמיכה בריבוי שפות, מודל קטן כל כך לא יספק עברית עשירה או מדויקת, ולכן חובה לבדוק אותו היטב לפני שמסתמכים עליו לשפה זו.

איך מריצים

ההרצה פשוטה מאוד ומתבססת על llama.cpp דרך כלי שורת הפקודה או שרת מקומי שמספק תאימות לממשק של OpenAI. הגודל הזעיר אומר שאין שום צורך בכרטיס מסך ייעודי, ואפשר להריץ אותו בקלות על מעבד רגיל, לפטופ פשוט או חומרת קצה. אם יש לכם כרטיס גרפי, אפשר להעביר אליו את כל 24 השכבות עם הדגל ngl 24 ולהפעיל flash attention לביצועים מהירים יותר.

ההבדל בין הקבצים השונים הוא רמת הקוונטיזציה. בגרסאות כמו q5_k_m או q8_0 מקבלים דיוק קרוב למקור, ובגרסאות כמו q4_0 או q2_k חוסכים זיכרון אבל משלמים ביציבות התשובות. אם אתם צריכים לוגיקה עמוקה, עדיף לפנות ל־API חיצוני ולא להסתמך על חומרה מקומית בגודל כזה.

ollama run hf.co/Qwen/Qwen2-0.5B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקבצים והפצה שלהם בתוך מוצר פרטי, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗