GPT
Q

Qwen2.5-1.5B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF קלה במיוחד שמיועדת לריצה מקומית על מחשבים פשוטים. היא מתאימה למי שרוצה מעקב אחר הוראות, קוד ומבנה נתונים בלי להחזיק שרת יקר.

  • 12.4 GBמשקל הקבצים
  • 189,951הורדות בחודש
  • 149לייקים

מה זה

מדובר במודל שפה קטן של 1.54 מיליארד פרמטרים שעבר אימון ייעודי להוראות ומגיע בפורמט GGUF. למרות הגודל המצומצם שלו, הוא מביא שיפורים ביכולות קידוד, מתמטיקה והבנה של מידע מובנה כמו טבלאות. הוא מתמודד טוב יותר מגרסאות קודמות עם פרומפטים מורכבים של מערכת ומסוגל להוציא פלט בפורמט JSON מדויק.

היתרון המעשי כאן הוא התמיכה בהקשר ארוך. המודל מוגדר עם חלון הקשר מלא של 32,768 טוקנים ומסוגל לייצר עד 8,192 טוקנים ברצף. בנוסף, הוא מאומן על יותר מ־29 שפות, כך שלא מדובר בכלי שמוגבל רק לאנגלית או סינית בלבד.

מתאים ל

  • חילוץ מידע ל־JSON

    הוא אומן במיוחד לפלוט מבנים מוגדרים כמו JSON, וגודלו מאפשר חילוץ מהיר וזול במכשיר מקומי.

  • בוט שיחה על חומרה חלשה

    המודל רץ חלק דרך llama.cpp ומספק מענה קליל למשתמש בלי לדרוש מעבד גרפי יקר.

  • ניתוח טקסטים ארוכים

    תמיכה בחלון הקשר של 32K מאפשרת להזין מסמכים שלמים ולייצר תקצירים של עד 8,000 טוקנים.

איפה זה נופל

זה עדיין מודל של 1.5 מיליארד פרמטרים בלבד. הוא לא יחליף מודלים ענקיים במשימות היגיון סבוכות או פתרון בעיות קוד עמוקות, ויש לו נטייה לטעויות כשהעסק נהיה מורכב מדי. בנוסף, למרות התמיכה המוצהרת בשפות רבות, עברית לא מוזכרת במפורש ברשימת השפות המרכזיות, כך שחובה לבדוק את איכות הפלט בעברית לפני שמסתמכים עליו.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם צריך להוריד את כל הקבצים ששוקלים 12.4 ג'יגה?

לא. המאגר מכיל גרסאות שונות של כימות כמו q4_K_M או q5_K_M. מורידים רק קובץ אחד שמתאים לרמת הדיוק ומשאבי החומרה שלכם.

איך המודל מתמודד עם עברית?

הכרטיס מציין תמיכה ביותר מ־29 שפות אך לא מציין עברית מפורשות. מומלץ לבדוק את איכות הפלט באופן ממוקד לפני שילוב שלו במערכת שמיועדת לדוברי עברית.

איך מריצים

את הקבצים מריצים ישירות דרך llama.cpp, מה שאומר שאפשר להריץ אותו כמעט על כל מעבד מודרני או כרטיס מסך בסיסי בלי להיחנק בזיכרון. אין צורך להוריד את כל 12 הקבצים ששוקלים יחד 12.4 ג'יגהבייט, אלא בוחרים קובץ כימות יחיד לפי הצורך, כמו q4_K_M לחסכון במשאבים או q8_0 לאיכות גבוהה יותר.

אם אתם צריכים רק מענה פשוט ושמירה על פרטיות על המחשב הנייד, הרצה מקומית כזו סוגרת את הפינה. לעומת זאת, אם אתם בונים מערכת עם עומס משתמשים גבוה שדורשת שרשור משימות כבד, עדיף להשתמש ב־API מנוהל במקום לנהל תשתית עצמאית.

ollama run hf.co/Qwen/Qwen2.5-1.5B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא Apache 2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה של המודל בתוך מוצרים, כל עוד שומרים על הודעת זכויות היוצרים המקורית ותנאי הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗