GPT
Q

Qwen2.5-32B-AGI-GGUF

קוד פתוח

bartowskiapache-2.02024-09-22

  • gguf
  • text-generation
  • zh
  • en
  • endpoints_compatible

גרסת GGUF מכווצת למודל של AiCloser על בסיס Qwen2.5 עם 32 מיליארד פרמטרים. היא נותנת ביצועים חזקים באנגלית ובסינית ומיועדת להרצה מקומית דרך llama.cpp.

  • 490 GBמשקל הקבצים
  • 7,218הורדות בחודש
  • 42לייקים

מה זה

מדובר במודל שמבוסס על שושלת Qwen2.5 בגודל של 32B, שאומן במקור על ידי AiCloser ועבר כימות לחבילת GGUF על ידי bartowski. המודל פועל במשימות יצירת טקסט ומיועד בעיקר לשימוש בשפות אנגלית וסינית. הכרטיס לא מספק תוצאות מדידה או מבחני ביצועים, כך שקשה לדעת במה השינוי של AiCloser עדיף על גרסת הבסיס הרשמית של Qwen2.5.

הייחוד כאן הוא בעיקר טכני ונוגע לאופן הכימות. הקבצים נוצרו באמצעות imatrix עם מאגר כיול ייעודי, וחלק מהגרסאות כוללות משקולות פלט והטמעה ברמת Q8_0 כדי לשמור על דיוק גבוה יותר. בנוסף קיימות כאן גרסאות ייעודיות לחומרת ARM שמאיצות את קצב העבודה על מעבדים נתמכים.

מתאים ל

  • פיתוח מקומי באנגלית

    מודל 32B מכווץ שמציע יכולות ניסוח טובות בלי תלות ברשת, בתנאי שיש כרטיס עם 24GB VRAM.

  • עיבוד טקסט בסינית

    המודל מותאם ומאומן ישירות לעבודה ברמה גבוהה בסינית, תחום שבו משפחת Qwen נחשבת לחזקה.

  • הסקה על שרתי ARM

    גרסאות Q4_0_X_X מותאמות ישירות להרצה מהירה על מעבדי ARM עם תמיכה בהוראות מתאימות.

איפה זה נופל

הכרטיס מציג תמיכה בשפות סינית ואנגלית בלבד, ואין בו שום תיעוד או הבטחה לתמיכה סבירה בעברית. בנוסף, חסר לחלוטין מידע על תהליך האימון של AiCloser, מה בדיוק שונה מגרסת המקור של Qwen, ואין מבחני ביצועים שמראים שהתוספת של השם AGI באמת מובילה לתוצאות טובות יותר.

בגרסאות המכווצות מתחת ל־4 ביט, במיוחד בפורמטים של 2 ביט שירדו עד 9.96GB, היוצר מציין במפורש שמדובר באיכות נמוכה מאוד. גרסאות אלה עלולות לייצר שגיאות חמורות והזיות, ולא מתאימות לשום שימוש שדורש אמינות.

שאלות
נפוצות

האם המודל תומך בעברית?

המודל מוגדר רשמית עבור אנגלית וסינית בלבד. כרטיס המודל לא מציין תמיכה בעברית, ולכן לא מומלץ להסתמך עליו למשימות הדורשות הבנה או כתיבה מדויקת בעברית בלי לבדוק זאת מראש.

איזה קובץ הכי כדאי להוריד מהרשימה?

לרוב המשתמשים מומלץ לבחור בגרסת Q4_K_M ששוקלת 19.85GB, שכן היא מציעה איזון אופטימלי בין שמירה על דיוק לגודל קובץ. לכרטיסי מסך עם פחות מ־20GB זיכרון, גרסאות כמו IQ3_M יכולות להתאים.

איך מריצים

טעינה מלאה של המודל לכרטיס מסך יחיד דורשת זיכרון VRAM משמעותי. הגרסה המומלצת לרוב השימושים היא Q4_K_M ששוקלת 19.85GB, ודורשת כרטיס עם 24GB VRAM כמו RTX 3090 או 4090 כדי לעבוד במהירות סבירה יחד עם זיכרון ההקשר. אם יש לכם פחות מזה, תצטרכו לפצל את הזיכרון בין המעבד לכרטיס המסך דרך LM Studio או llama.cpp, מה שיאט את הריצה משמעותית.

מי שמחפש לחסוך במקום יכול לרדת לגרסאות נמוכות כמו IQ3_M בנפח 14.81GB, שמתאימות לכרטיסי Nvidia ו־AMD דרך cuBLAS ו־rocBLAS אך לא נתמכות ב־Vulkan. אם אין לכם חומרה חזקה מקומית של לפחות 24GB זיכרון ייעודי, עדיף להשתמש בספק ענן ולא להיאבק עם חלוקת זיכרון איטית.

ollama run hf.co/bartowski/Qwen2.5-32B-AGI-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפרויקט מופץ תחת רישיון apache-2.0. הרישיון מאפשר שימוש חופשי, עריכה, הפצה ושימוש מסחרי בקוד ובמשקולות ללא תשלום תמלוגים. התנאי המרכזי הוא שמירה על הודעת זכויות היוצרים ועותק הרישיון המקורי בכל הפצה או שילוב שלו במוצר מסחרי.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗