GPT
Q

Qwen2.5-3B-Instruct-GGUF

קוד פתוח

Qwenother2024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF מכווצת של מודל עם 3 מיליארד פרמטרים, שמיועדת לריצה מקומית קלה. היא מתאימה למי שרוצה מענה מהיר להוראות ויצירת פלט מובנה בלי להחזיק שרת יקר.

  • 23.5 GBמשקל הקבצים
  • 414,570הורדות בחודש
  • 181לייקים

מה זה

מדובר במודל שפה קומפקטי מסדרת Qwen2.5, שמגיע אחרי אימון המשך להוראות ומכוון למשימות טקסט, קוד ומתמטיקה. למרות שמדובר ב־3.09 מיליארד פרמטרים בלבד, היוצרים מדווחים על יכולת טובה בעבודה מול נתונים מובנים כמו טבלאות והפקת פלט בפורמט JSON, לצד עמידות טובה יותר להנחיות מערכת מורכבות.

מבחינת אורך השיחה, הוא תומך בהקשר מלא של עד 32,768 טוקנים ומסוגל לייצר עד 8,192 טוקנים ברצף. הוא כולל תמיכה מוצהרת ביותר מ־29 שפות, ביניהן ערבית, אנגלית וצרפתית, ומציע חלופה מעניינת לפיתוח מקומי כשאין צורך במודלים כבדים ומסורבלים יותר.

מתאים ל

  • הפקת JSON מטקסט חופשי

    הוא אומן במיוחד להחזרת נתונים מובנים ועבודה עם טבלאות, מה שמתאים לחילוץ מידע קל.

  • בוט מקומי על מחשב אישי

    רץ ישירות דרך llama.cpp בלי שרת חיצוני ומגיב מהר בהנחיות מערכת ושיחה שוטפת.

  • עוזר מקומי למשימות קוד פשוטות

    האימון כולל חיזוק בתכנות ובמתמטיקה, ומתאים לסקריפטים קצרים בלי צורך במודל ענק.

איפה זה נופל

מודל בגודל שלושה מיליארד פרמטרים מוגבל מובנית בהסקה מורכבת ובידע עולם מעמיק, גם אם כרטיס המודל מציין שיפורים במתמטיקה ובקוד. בנוסף, למרות שהוכרזה תמיכה בלמעלה מ־29 שפות, עברית לא מצוינת במפורש ברשימה של היצרן, כך שצריך לבדוק היטב את איכות הפלט בעברית לפני שבונים עליו משהו אמיתי.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אני צריך להוריד את כל הקבצים במאגר?

ממש לא. המאגר שוקל 23.5 ג'יגהבייט כי הוא כולל 8 גרסאות דחיסה שונות של המודל. מורידים רק קובץ GGUF אחד, למשל q4_K_M, לפי כמות הזיכרון שיש לכם.

האם המודל מבין ומייצר עברית כמו שצריך?

היצרן ציין תמיכה ביותר מ־29 שפות כמו אנגלית וערבית, אך עברית אינה מופיעה ברשימה המפורטת. ייתכן שהוא יבין משהו בסיסי, אך אי אפשר להסתמך עליו בלי בדיקה יסודית מראש.

איך מריצים

הפורמט הוא GGUF, מה שאומר שהרצה מקומית מתבצעת ישירות דרך llama.cpp, על המעבד או עם פריקה לכרטיס מסך. המאגר מכיל גרסאות קוונטיזציה שונות, מ־q2_K הצנומה ועד q8_0 המדויקת והכבדה יותר, כשבדרך כלל q4_K_M או q5_K_M נותנות פשרה טובה בין זיכרון לביצועים.

אין צורך להוריד את כל 23.5 הג'יגהבייט של המאגר, אלא מושכים רק את הקובץ הבודד שמתאים למגבלות הזיכרון שלכם. אם אתם צריכים לטפל באלפי פניות במקביל או שאין לכם כוח לנהל חומרה מקומית, עדיף לפנות ל־API ייעודי במקום להרים סביבה עצמאית.

ollama run hf.co/Qwen/Qwen2.5-3B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הרשמי במאגר מסומן כ־other. המשמעות היא שאין כאן רישיון קוד פתוח סטנדרטי, וחובה להיכנס לתיעוד או למאגר המקורי של Qwen כדי לבדוק את התנאים והמגבלות לשימוש מסחרי לפני שמשלבים אותו במוצר.

הרישיון המלא בעמוד המודל ↗