GPT
Q

Qwen2-7B-Instruct-GGUF

קוד פתוח

Qwenapache-2.02024-06-06

  • gguf
  • chat
  • text-generation
  • en
  • endpoints_compatible

יש כאן גם סקירה על Qwen עצמו.

גרסת קוונטיזציה של מודל שיחה עם 7 מיליארד פרמטרים שמותאמת להרצה מקומית. הוא נותן מענה חזק בקוד, במתמטיקה ובשפות, בלי לחייב שרתים כבדים.

  • 52.4 GBמשקל הקבצים
  • 4,660הורדות בחודש
  • 180לייקים

מה זה

המאגר הזה מציע את גרסת ההוראות של המודל בפורמט GGUF, שמיועד לעבודה ישירה מול מעבדים וכרטיסי מסך ביתיים. הארכיטקטורה מבוססת על טרנספורמר עם אקטיבציית SwiGLU, מנגנון Group Query Attention, וטוקנייזר מעודכן שמטפל בריבוי שפות ותכנות. האימון שילב כמות גדולה של נתונים מקדימים יחד עם כוונון עדין ואופטימיזציית העדפות ישירה, מה שמייצב את התשובות שלו בשיחה חופשית.

מבחני הפרפלקסיטי על wikitext מראים קפיצה ברורה ביחס למודלים קטנים יותר, עם ציון 7.93 ברמת דיוק מלאה של 16 ביט. מה שחשוב בפועל הוא שהירידה באיכות כמעט לא קיימת בגרסאות מכווצות: רמת q5_k_m מגיעה לציון 7.97, ורמת q8_0 עומדת על 7.94. רק כשמנסים לרדת לרמות קיצוניות כמו q2_k הציון קופץ ל־10.58 ומאבד חדות, כך שאין סיבה אמיתית לבחור בכיווץ אגרסיבי מדי.

מתאים ל

  • עוזר פיתוח מקומי

    אינטגרציה לתוך סביבת העבודה לכתיבת פונקציות והשלמת קוד אופליין, בלי תלות ברשת או תשלום לפי טוקן.

  • שרת צ'אט ארגוני פנימי

    הרצה על חומרה משרדית סבירה למענה על שאלות ועיבוד מסמכים באנגלית בלי להוציא מידע מחוץ לרשת.

  • בוט תמיכה בסיסי באנגלית

    מענה לפניות לקוחות פשוטות דרך ממשק OpenAI קיים, תוך שמירה על זמני תגובה קצרים ועלויות אפסיות.

איפה זה נופל

המאגר עצמו מסומן רשמית לשפה האנגלית בלבד, למרות ההבטחה לטוקנייזר רב־לשוני. המשמעות היא שבעברית או בשפות אחרות הוא עלול לייצר שגיאות תחביר, להזות עובדות או לפעול בקצב איטי בהרבה בגלל חלוקת מילים לא יעילה. בנוסף, מודל של שבעה מיליארד פרמטרים עדיין מוגבל בהסבר מהלכים לוגיים מורכבים במיוחד בהשוואה לגרסאות 72B שקיימות בסדרה, ולכן חייבים לבדוק אותו מקומית על טקסטים אמיתיים לפני שבונים עליו תהליך עסקי.

אותה משפחה

Qwen2 יצא ב־13 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן, והשאר בעמוד המפרסם.

שאלות
נפוצות

איזו גרסת קובץ כדאי להוריד מתוך המאגר?

הקובץ q5_k_m נותן את האיזון הטוב ביותר בין משקל לדיוק, עם ציון פרפלקסיטי של 7.97 לעומת 7.93 במקור. אם יש לכם שפע של זיכרון אפשר לקחת את q8_0, אבל ההבדל בתשובות כמעט בלתי מורגש. התרחקו מגרסאות כמו q2_k שמציגות ירידה חדה בביצועים.

האם אפשר להשתמש במודל הזה בעברית?

המאגר מוגדר רשמית לאנגלית בלבד, למרות שהמפתחים מציינים שיפור בטוקנייזר לשפות נוספות. בפועל הוא עשוי להבין עברית בסיסית, אך צפוי לפלוט ניסוחים משובשים או לייצר שגיאות במשימות מורכבות. כדאי להריץ עליו מבחן קצר עם קלטים מהמערכת שלכם כדי לראות אם התוצאה מספקת.

איך מריצים

מורידים קובץ בודד כמו qwen2-7b-instruct-q5_k_m.gguf בעזרת huggingface-cli ומריצים אותו ישירות מעל llama.cpp. אפשר להעלות אותו כשרת מקומי עם הפקודה llama-server, להעביר 24 או 28 שכבות לכרטיס המסך בעזרת דגל ngl, ולהפעיל flash attention לביצועים טובים. השרת פותח נקודת קצה שתואמת לפורמט של OpenAI, כך שאפשר לפנות אליו עם ספריית הפייתון הרגילה בלי לשנות את קוד הקליינט.

גרסת שבעה מיליארד ברמת כיווץ q5 תרוץ מצוין על כרטיס מסך מודרני עם 8 או 12 גיגה זיכרון, או אפילו על מעבד סביר בלי כרטיס ייעודי. מי שלא רוצה לנהל שרת מקומי, לתחזק גרסאות של llama.cpp או להקצות משאבי חומרה למשתמשים במקביל, יעדיף לצרוך מודל מרוחק דרך ספק ענן.

ollama run hf.co/Qwen/Qwen2-7B-Instruct-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הקוד והמשקלים זמינים תחת רישיון apache-2.0. מותר להשתמש בהם לצרכים מסחריים, לשנות את הקוד, לפתח מוצרים סגורים ולהפיץ אותם הלאה. התנאי העיקרי הוא שמירה על הודעת זכויות היוצרים וציון הרישיון המקורי, בלי אחריות משפטית מצד המפתחים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗