GPT
Q

Qwen/Qwen2.5-14B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-09-17

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת GGUF יעילה למודל 14 מיליארד פרמטרים שמתמחה בקוד, מתמטיקה ומעקב הוראות. פתרון מעולה להרצה מקומית על כרטיס מסך בודד בלי לשלם על API חיצוני.

  • 101 GBמשקל הקבצים
  • 19,809הורדות בחודש
  • 65לייקים

מה זה

המודל מציע פשרה מצוינת בין משקל לביצועים בסדרת Qwen2.5. עם 14.7 מיליארד פרמטרים ואימון ייעודי למשימות טכניות, הוא מתמודד בצורה מרשימה עם כתיבת קוד, פתרון בעיות מתמטיות והבנת נתונים מובנים כמו טבלאות. הדגש כאן הוא על יציבות במעקב אחר הנחיות מערכת וגמישות ביצירת פלטים מובנים, במיוחד בפורמט JSON.

בגרסה זו מקבלים תמיכה מובנית בחלון הקשר של 32,768 תווים ויכולת ייצור של עד 8,192 תווים ברצף. בנוסף, המודל עבר הכשרה על יותר מ־29 שפות שונות, כך שהוא מסוגל לתרגם ולעבד מידע רב־לשוני מעבר לאנגלית וסינית.

מתאים ל

  • חילוץ מידע ל־JSON

    מייצר פלטים מובנים בדיוק גבוה ומבין פורמטים קשיחים ישירות מתוך טקסטים ארוכים.

  • עוזר פיתוח מקומי

    מציע קוד ופותר בעיות תכנות על המחשב בלי להוציא קוד פנימי של החברה לרשת.

  • בוט שיחה מבוסס תפקיד

    עוקב בדייקנות אחרי הנחיות מערכת מורכבות ושומר על אופי הדמות לאורך שיחה ארוכה.

איפה זה נופל

למרות שהארכיטקטורה תומכת תיאורטית בהרחבה עד 128K תווים בעזרת YARN, בפורמט GGUF הנוכחי המודל מוגבל בפועל ל־32,768 תווים בלבד. מי שחייב הקשר מלא של מעל 32K יצטרך לעבוד עם המודל המקורי בסביבת vLLM ולא דרך llama.cpp. בנוסף, כרטיס המודל לא מפרט נתוני ציונים ישירים אלא מפנה לבלוג חיצוני, ולכן חובה לבדוק בעצמכם משימות מורכבות לפני שמשלבים אותו בזרימת עבודה רגישה.

אותה משפחה

Qwen2.5 יצא ב־29 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איך מחברים את הקבצים המפוצלים שהורדתי מהמאגר?

משתמשים בפקודה llama-gguf-split שמגיעה עם llama.cpp, ומעבירים לה את הדגל merge יחד עם הנתיב לחלק הראשון והשם של קובץ היעד המאוחד. לאחר מכן טוענים את הקובץ המאוחד לפקודת ההרצה הרגילה.

האם אפשר להשתמש כאן בחלון הקשר של 128K?

לא בגרסה הזו. הרחבה ל־128K דורשת YARN שנתמך נכון לעכשיו רק ב־vLLM עם המודלים שאינם בפורמט GGUF, כך שבתוך llama.cpp תוגבלו ל־32,768 תווים.

איך מריצים

מריצים אותו ישירות באמצעות llama.cpp על ידי הורדת קובץ ה־GGUF ברמת הקוונטיזציה המתאימה לכם, מ־q2_K הבסיסי ועד q8_0 המדויק. עבור קוונטיזציה ממוצעת כמו q4_K_M או q5_K_M, תצטרכו כרטיס מסך עם 12 עד 16 גיגה־בייט זיכרון כדי לטעון את כל השכבות וליהנות ממהירות סבירה.

חלק מהקבצים הגדולים מגיעים מפוצלים ומחייבים איחוד בעזרת הכלי llama-gguf-split לפני ההפעלה. אם אין לכם חומרה ייעודית עם מספיק זיכרון וידאו פנוי, או שאתם לא רוצים להתעסק בהגדרות שורת פקודה, עדיף להשתמש ב־API מוכן ברשת.

ollama run hf.co/Qwen/Qwen2.5-14B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הקבצים

35 קבצים במאגר, 101 GB סך הכול. הקישורים מובילים ישירות ל־Hugging Face.

הרישיון

המודל שוחרר תחת רישיון apache-2.0 חופשי ומתירני. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולשלב אותו במוצרים פנימיים או חיצוניים בלי לשלם תמלוגים, בכפוף לשמירה על הודעת זכויות היוצרים המקורית.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗