GPT
Q

Qwen/Qwen2.5-72B-Instruct-GGUF

קוד פתוח

Qwenother2024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסה מכווצת של המודל הגדול בסדרה, שמביאה ביצועים חזקים בקוד ובמבנה נתונים. היא מתאימה למי שרוצה להריץ מודל של 72 מיליארד פרמטרים על חומרה מקומית בלי לאבד דיוק.

  • 497 GBמשקל הקבצים
  • 8,946הורדות בחודש
  • 47לייקים

מה זה

המאגר הזה מציע גרסאות מכומתות בפורמט GGUF למודל הדגל של הסדרה, עם 72.7 מיליארד פרמטרים. השיפורים המרכזיים מתמקדים במתמטיקה, כתיבת קוד, הבנה של טבלאות ויצירת פלט מובנה, בעיקר JSON. הוא בנוי לעקוב אחרי הוראות מורכבות ומגיב טוב יותר להנחיות מערכת מגוונות שמגדירות תפקידים ותנאים לשיחה.

המודל תומך בהקשר של עד 32,768 טוקנים ומייצר עד 8,192 טוקנים ברצף. הוא כולל תמיכה ביותר מ־29 שפות, ביניהן אנגלית, ערבית, צרפתית, גרמנית וספרדית, עם ארכיטקטורה מודרנית שמשלבת מנגנוני קשב יעילים ומבנה של שמונים שכבות.

מתאים ל

  • חילוץ מידע ל־JSON

    מייצר פלט מובנה ומדויק מטבלאות ומסמכים מורכבים לפי הנחיות קשיחות.

  • סיוע בפיתוח תוכנה

    מתמחה בכתיבת קוד ובפתרון בעיות מתמטיות בזכות אימון ייעודי לתחומים האלה.

  • בוטים מבוססי תפקיד

    שומר על עקביות ומגיב היטב להנחיות מערכת ארוכות שמגדירות אופי ותרחישי שיחה.

איפה זה נופל

בפורמט ה־GGUF הנוכחי המודל מוגבל ל־32K טוקנים בלבד. ההרחבה ל־128K טוקנים נתמכת רק במודלים המקוריים שאינם GGUF ורק דרך vLLM, כך שמי שבונה על מסמכי ענק בהרצה מקומית ב־llama.cpp ייתקל במגבלה. מעבר לזה, עברית לא מוזכרת ברשימת השפות שנתמכות באופן רשמי בכרטיס המודל, ולכן חובה לבדוק היטב את איכות הפלט בעברית לפני שמסתמכים עליו.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

אפשר להגיע להקשר של 128K טוקנים עם הקבצים האלה?

לא בפורמט הזה. המפתחים מציינים במפורש שהרחבה מעבר ל־32K טוקנים דורשת vLLM ואת המודלים הרגילים, ולא עובדת כרגע בקבצי ה־GGUF.

למה הקובץ יורד בהרבה חלקים קטנים?

הקבצים של המודל שוקלים עשרות גיגה-בייט ומגבלות ההעלאה דרשו לחלק אותם. אחרי ההורדה צריך לאחד אותם לקובץ אחד באמצעות הפקודה llama-gguf-split שמגיעה עם llama.cpp.

איך מריצים

מריצים אותו בעיקר דרך llama.cpp, כשהקבצים מחולקים למספר חלקים בגלל הגודל שלהם ודורשים איחוד עם כלי ייעודי לפני ההפעלה. יש מגוון רמות כימות, החל מ־q2_K הבסיסי ועד q8_0, כשגרסאות כמו q4_K_M או q5_K_M נותנות בדרך כלל איזון שפוי. כדי לטעון 80 שכבות לזיכרון של כרטיסי מסך תצטרכו מערך רציני של חומרה עם עשרות גיגה-בייט של VRAM.

אם אין לכם תחנת עבודה חזקה או שרת עם כמה כרטיסים גרפיים ייעודיים, עדיף להשתמש ב־API מנוהל. הרצה של מודל במשקל כזה על מעבד רגיל תהיה איטית מדי לכל עבודה שוטפת.

ollama run hf.co/Qwen/Qwen2.5-72B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

149 קבצים במאגר, 497 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

הרישיון מוגדר כ־other בכרטיס המודל ולא מספק פרטים ברורים בעמוד עצמו. במצב כזה אי אפשר לדעת אם מותר להשתמש בו במוצר מסחרי, אם יש מגבלות על כמות משתמשים חודשית או דרישות ייחוס ספציפיות. מי שמתכנן להפיץ מוצר מסחרי חייב להיכנס לאתר הפרויקט ולבדוק את תנאי הרישיון המקוריים לפני שמשלבים אותו בקוד.

הרישיון המלא בעמוד המודל ↗