GPT
Q

Qwen/Qwen2.5-32B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF של מודל עם 32.5 מיליארד פרמטרים, שמכוונת לביצועים חזקים בקוד, מתמטיקה ופלט מובנה. היא מתאימה למי שרוצה להריץ מקומית יכולות של מודל גדול בלי להחזיק שרת מפלצתי.

  • 223 GBמשקל הקבצים
  • 4,748הורדות בחודש
  • 47לייקים

מה זה

מדובר במודל שפה עם ארכיטקטורת שנאי, שכולל 64 שכבות וקשב מסוג GQA. הוא אומן מראש ועבר התאמה להוראות, עם דגש ברור על פתרון בעיות תכנות, חשיבה מתמטית ויצירת טקסטים ארוכים של מעל 8,000 טוקנים. הגרסה הזו מגיעה בפורמט מכווץ שמיועד לעבודה ישירה מול מעבדים וכרטיסים גרפיים ביתיים או משרדיים.

היתרון שלו על פני מודלים ותיקים בגודל הזה הוא היכולת לבלוע קלט של עד 32,768 טוקנים באופן טבעי, לצד הבנה של נתונים מובנים כמו טבלאות והחזרת תשובות בפורמט JSON מדויק. הוא מתמודד טוב יותר עם הנחיות מערכת מורכבות ומציג תמיכה ביותר מ־29 שפות, כולל שפות כמו ערבית, אנגלית וספרדית, מה שהופך אותו לבחירה מעשית לבוטים מורכבים שלא נשברים משינויי ניסוח.

מתאים ל

  • חילוץ נתונים ל־JSON

    הוא מיומן ביצירת מבנה תקין ויכול לקחת טבלאות או טקסט חופשי ולהפוך אותם לפלט מובנה בלי לזייף שדות.

  • סיוע בכתיבת קוד מקומי

    התמחות ייעודית בתכנות ובמתמטיקה מאפשרת לו לפתור באגים ולכתוב סקריפטים בסביבה פרטית ומאובטחת.

  • בוטים מבוססי הנחיות ארוכות

    עמידות גבוהה לניסוחים מורכבים ב־System Prompt מסייעת לו לשמור על אפיון דמות וכללי שיחה לאורך זמן.

איפה זה נופל

בפורמט GGUF הנוכחי המודל מוגבל להקשר של 32,768 טוקנים בלבד. ההרחבה לעד 131,072 טוקנים נתמכת כרגע רק דרך vLLM עם שיטת YARN ולא זמינה כאן. אם יש לכם צורך בעיבוד מסמכים ארוכים פי כמה, הקבצים במאגר הזה פשוט לא יתנו לכם את המענה הדרוש.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מחברים את הקבצים המפוצלים של המודל?

משתמשים בכלי llama-gguf-split שנמצא בתיקיית הבנייה של llama.cpp ומריצים פקודת merge עם הנתיב לקובץ הראשון והנתיב לקובץ היעד. הפעולה מאחדת את כל המקטעים בעלי אותו שם לקובץ GGUF שלם אחד שאותו אפשר לטעון ישירות.

האם אפשר לעבוד עם הקשר של 128 אלף טוקנים בגרסה הזו?

לא. כרטיס המודל מציין בפירוש שגרסת ה־GGUF מוגבלת לחלון מלא של 32,768 טוקנים, וכי הרחבה מעבר לזה דורשת שימוש ב־vLLM עם הקבצים המקוריים שאינם בפורמט זה.

איך מריצים

מריצים אותו דרך llama.cpp, כשרצוי להוריד קובץ מכווץ ספציפי בעזרת huggingface-cli במקום למשוך את כל המאגר ששוקל 223 גיגה-בייט. הקבצים הגדולים מפוצלים למספר חלקים, כך שאחרי ההורדה צריך לאחד אותם עם הכלי llama-gguf-split לפני ההפעלה. יש מגוון רחב של כיולים, החל מ־q2_K הבסיסי ועד q8_0 הכבד, כאשר גרסאות הביניים כמו q4_K_M או q5_K_M מציעות את הפשרה ההגיונית ביותר.

בשביל להריץ 32 מיליארד פרמטרים בצורה סבירה צריך חומרה עם זיכרון גרפי משמעותי, או שילוב של כרטיס חזק והרבה זיכרון מערכת. אם אין לכם כרטיס עם לפחות 24 גיגה-בייט זיכרון כדי לפרוק אליו חלק ניכר מהשכבות, הזמנים שתקבלו בכל יצירת טקסט יהיו איטיים מאוד, ובמקרה כזה עדיף לשלם לפי קריאה למודל מרוחק.

ollama run hf.co/Qwen/Qwen2.5-32B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

67 קבצים במאגר, 223 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים פנימיים או מסחריים, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של הרישיון.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗