GPT
Q

Qwen/Qwen2.5-7B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF יעילה למודל שבעה מיליארד פרמטרים, שמצטיינת בהפקת קוד ובמבני JSON. היא פונה למי שרוצה להריץ מודל הוראות חזק מקומית בלי שרת כבד.

  • 52.4 GBמשקל הקבצים
  • 100,159הורדות בחודש
  • 177לייקים

מה זה

מדובר בגרסה מכווצת ומותאמת של מודל ההוראות מסדרת Qwen2.5, עם כ־7.61 מיליארד פרמטרים. המטרה כאן היא לאפשר עבודה מקומית דרך ספריות כמו llama.cpp, כשהדגש המרכזי של הסדרה הוא קפיצה משמעותית ביכולות תכנות, פתרון בעיות במתמטיקה והבנה טובה יותר של מידע מובנה כמו טבלאות.

בניגוד לגרסאות בסיס כלליות, הדגם הזה אומן להגיב טוב יותר להנחיות מערכת מגוונות ולהחזיר פלט מובנה, בעיקר בפורמט JSON. הוא תומך בהקשר בסיסי של 32,768 טוקנים ומסוגל לייצר טקסטים ארוכים של עד 8,192 טוקנים ברצף, לצד תמיכה בלמעלה מ־29 שפות שונות שכוללות אנגלית, ערבית, ספרדית, צרפתית ועוד.

מתאים ל

  • חילוץ מידע לפורמט JSON

    מתאים במיוחד לעיבוד טקסטים וטבלאות לפלט מובנה של JSON, תחום שבו היצרן שיפר משמעותית את הדיוק.

  • עוזר פיתוח מקומי לקוד

    רץ ישירות על תחנת העבודה ללא תלות ברשת, עם שיפור ייעודי בכתיבה ובפתרון בעיות תכנות.

  • צ'אטבוט מבוסס תפקיד באופליין

    המודל הותאם להיצמד להנחיות מערכת מורכבות, מה שמאפשר להריץ סוכן שיחה יציב דרך llama.cpp.

איפה זה נופל

למרות שהסדרה מציגה תמיכה בהקשר של 128K טוקנים, גרסת ה־GGUF הזו מוגבלת בפועל ל־32,768 טוקנים בלבד, כי הרחבת YARN אינה נתמכת כרגע דרך הפורמט הזה אלא רק ב־vLLM. בנוסף, למרות ההבטחה לתמיכה בריבוי שפות שכולל ערבית ושפות אירופיות ואסיאתיות, עברית לא מוזכרת כלל ברשימת השפות הנתמכות, מה שמחייב בדיקה זהירה של איכות הפלט בעברית לפני שילוב שלו במוצר.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

האם אפשר להשתמש במודל הזה לחלון הקשר של 128K טוקנים?

לא בגרסה הזו. קובצי ה־GGUF מוגבלים ל־32,768 טוקנים בלבד. הרחבה ל־131,072 טוקנים דורשת שימוש בטכנולוגיית YARN שנתמכת כרגע רק דרך מנוע vLLM ועם הגרסאות הרגילות של המודל.

איך מחברים את הקבצים המפוצלים שהורדתי מהמאגר?

חלק מהמשקלים חולקו לכמה קבצים עם סיומות ממוספרות כדי לעמוד במגבלות הגודל. כדי לאחד אותם לקובץ GGUF שלם שניתן להרצה, מריצים את הפקודה llama-gguf-split יחד עם הדגל merge, ומספקים את הנתיב לקובץ הראשון ואת שם קובץ היעד המבוקש.

איך מריצים

מריצים אותו בעיקר בעזרת llama.cpp או כלים תואמים שתומכים בפורמט GGUF. במאגר מציעים כמה רמות כיול שונות, החל מ־q2_K המאוד מכווץ ועד q8_0 הכבד, כשרמות כמו q4_K_M או q5_K_M מספקות בדרך כלל איזון הגיוני בין דרישות זיכרון לביצועים. כדי לעבוד איתו לא צריך חוות שרתים, ומחשב פיתוח עם כרטיס מסך מודרני בעל זיכרון סביר או מעבד חזק יספיק כדי לטעון את המשקלים הרלוונטיים.

שימו לב שבגלל מגבלות גודל, חלק מהקבצים הכבדים מחולקים לכמה חלקים ויש לאחד אותם עם llama-gguf-split לפני ההרצה. אם המטרה היא להריץ חלון הקשר עצום של 131,072 טוקנים, גרסת ה־GGUF הזו לא תתאים וכדאי לפנות למודל המקורי בסביבת vLLM עם YARN, או לשקול קריאה ל־API חיצוני.

ollama run hf.co/Qwen/Qwen2.5-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

המודל מופץ תחת רישיון apache-2.0. זהו רישיון קוד פתוח מתירני שמאפשר שימוש מסחרי, שינוי של הקוד והפצה חופשית, בתנאי ששומרים על הודעת זכויות היוצרים והרישיון המקורי. אפשר לשלב אותו במוצרים מסחריים בלי לחשוף את הקוד שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗