GPT
Q

Qwen2.5-0.5B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של מודל זעיר שמיועדת למכשירים חלשים או להרצה מקומית בלי כרטיס מסך כבד. הוא יודע לעבוד עם הוראות ומחזיר פלט מובנה גם במשאבים מינימליים.

  • 5.0 GBמשקל הקבצים
  • 189,474הורדות בחודש
  • 130לייקים

מה זה

מדובר במודל הוראות קטן מאוד עם פחות מחצי מיליארד פרמטרים, שהומר לפורמט GGUF כדי לרוץ ישירות על מעבדים רגילים דרך כלים כמו llama.cpp. למרות הגודל המזערי, הסדרה הזו כוללת שיפורים בהבנת קוד, פתרון מתמטיקה בסיסית ויצירת מבני נתונים כמו JSON, לצד עמידות טובה יותר להנחיות מערכת משתנות.

הוא תומך בהקשר מלא של 32,768 טוקנים ומסוגל לייצר עד 8,192 ברצף אחד, נתון חריג למשקל כזה. היוצרים מדווחים גם על תמיכה בלמעלה מ־29 שפות, כולל ערבית, אנגלית וצרפתית, אבל עברית לא מוזכרת ברשימה המפורטת בכרטיס.

מתאים ל

  • חילוץ נתונים ל־JSON

    הוא אומן להחזיר מבנים מוגדרים ויכול לרוץ על השרת המקומי כדי לפרק טקסט לשדות ברורים.

  • עוזר מקומי למכשיר קצה

    המשקל הקל מאפשר להריץ אותו ישירות על מחשב אישי או חומרה חלשה בלי חיבור לאינטרנט.

  • סיווג טקסט מהיר

    מתאים למיון הודעות או ניתוב פניות פשוט, בלי לייצר עלויות קריאה לשרתים חיצוניים.

איפה זה נופל

עם 0.49 מיליארד פרמטרים בלבד, אין כאן קסמים. הידע הכללי מוגבל מאוד, ורמות הכיווץ הנמוכות יותר כמו q2_K יפגעו עוד יותר בהיגיון וביציבות הפלט. הוא יתקשה מאוד במשימות הסקה מורכבות, והתמיכה בעברית אינה מובטחת ולא נבדקה רשמית בכרטיס המודל.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזה קובץ כדאי להוריד מתוך כל הגרסאות?

עבור שילוב טוב בין גודל לאיכות, קובץ כמו q4_K_M או q5_K_M הוא הבחירה המקובלת. גרסאות נמוכות כמו q2_K חוסכות מקום אך מאבדות דיוק, בעוד שגרסאות כמו q8_0 כבדות יותר בלי לתת יתרון שמצדיק את המשקל במודל כה קטן.

האם המודל יודע לעבוד בעברית?

הכרטיס מפרט תמיכה ב־29 שפות אך עברית אינה מופיעה ביניהן. סביר שהוא מסוגל לקלוט מילים בודדות, אך לא הייתי בונה עליו לייצור טקסט קולח או אמין בעברית בלי לבדוק אותו קודם.

איך מריצים

מורידים קובץ בודד באחת מרמות הדחיסה, למשל q5_K_M או q4_K_M, ומריצים אותו ישירות עם llama-cli בלי צורך בהתקנות מסובכות של פייתון. קובצי ה־GGUF הקלים תופסים שבריר זיכרון, כך שכל מחשב נייד ישן או שרת ענן פשוט מבוסס CPU יריץ אותו בלי להזיע.

אם אתם צריכים רק תיוג מהיר של טקסט או חילוץ מידע מקומי, אין טעם לשלם על API חיצוני. מצד שני, אם אתם מחפשים נימוק מעמיק או עברית מדויקת, עדיף לפנות למודלים ענקיים ברשת.

ollama run hf.co/Qwen/Qwen2.5-0.5B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להטמיע בתוך מוצר סגור ולהפיץ הלאה, כל עוד שומרים על הודעת זכויות היוצרים והרישיון המקורי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗