GPT
Q

Qwen3.8-27B-BF16-INT4-W4A16-G32-AutoRound

קוד פתוח

goldhubapache-2.02026-08-14

  • safetensors
  • qwen3_5
  • 27b
  • qwen
  • qwen3.8

גרסה מכווצת בארבעה ביטים של מודל המולטימודל מקבוצת קוון, בלי מעצורים תאגידיים ועם שמירה על שכבות קריטיות. מתאים למי שצריך ניתוח תמונות והקשר ענק על חומרה מקומית נגישה.

  • 12Bפרמטרים
  • 262,144טוקנים בהקשר
  • 26.4 GBמשקל הקבצים
  • 67,245הורדות בחודש

מה זה

היוצרים לקחו מודל מולטימודל שמעבד טקסט, תמונה ווידאו, וביצעו בו קוונטיזציה של ארבעה ביטים למשקלים ושישה עשר ביטים לאקטיבציות בשיטת אוטו ראונד. במקום לכווץ הכל ולפגוע בתשומת הלב ובשכבות הראייה, השכבות הקריטיות הושארו בדיוק גבוה. התוצאה שוקלת עשרים ושישה נקודה ארבע גיגה בייט, בערך חצי מגודל המקור, בלי לרסק את יכולות הראייה או את חלון ההקשר המלא שמגיע למאתיים שישים ושניים אלף טוקנים.

במקום בדיקות סינתטיות רגילות, היוצרים בחנו את המודל על בניית גרף ידע מטקסטים קשים בעברית מספרות הקבלה והזוהר. לפי הנתונים שלהם, הוא עיבד את הטקסט בחמש מאות שלושים ואחת שניות מול שמונה מאות חמישים ושש שניות של דיפסיק וי ארבע פלאש, וחילץ מאה שמונים ושמונה ישויות לעומת מאה שלושים ותשע. במבחני קוד הוא ייצר מימוש פייתון עם ניתוח סיבוכיות מלא בקצב של כחמישים ושניים טוקנים לשנייה, ובכתיבה יצירתית ללא סירובים הגיע לקצב של כארבעים ושניים טוקנים לשנייה.

מתאים ל

  • בניית גרפי ידע מטקסט בעברית

    מחלץ ישויות ויחסים מטקסטים היסטוריים ומורכבים בעברית במהירות גבוהה וללא קטיעת קשרים.

  • ניתוח מסמכים חזותיים ארוכים

    מעבד שילוב של תמונות, וידאו וטקסט ארוך בזכות שכבות ראייה שלא נפגעו בכיווץ וחלון הקשר גדול.

  • יצירת תוכן ללא הגבלות

    מתאים לכתיבה טכנית ויצירתית שדורשת חופש מלא בלי התנצלויות או סירובים תאגידיים מובנים.

איפה זה נופל

גודל הקבצים כבד ביחס לקוונטיזציה רגילה של ארבעה ביטים, בדיוק בגלל השכבות שנשמרו בחצי דיוק. הרצה על כרטיס בודד של עשרים וארבעה גיגה בייט לא תעבוד באופן מעשי עם הקשר ארוך. מעבר לזה, המודל עבר כיוונון שמסיר מעצורי בטיחות וסירובים. המשמעות היא שאין לו מנגנוני הגנה מובנים מפני פליטת תוכן בעייתי או הנחיות פוגעניות, כך שאם אתם בונים מוצר שפונה לקהל רחב, חובת הסינון וההגנה נופלת עליכם לחלוטין.

שאלות
נפוצות

האם אפשר להריץ אותו על כרטיס מסך ביתי יחיד של 24GB?

לא מומלץ. הקבצים שוקלים עשרים ושישה נקודה ארבע גיגה בייט בגלל השכבות שנשמרו בדיוק גבוה, ולכן הוא לא ייכנס לזיכרון של כרטיס בודד יחד עם ההקשר שלו. המפתחים ממליצים במפורש על שני כרטיסים של עשרים וארבעה גיגה בייט בחלוקת עומס.

איך המודל מתמודד עם טקסטים קשים בעברית?

היוצרים בדקו אותו ישירות על טקסטים קבליים מורכבים באורך של כמעט שני מיליון תווים. במבחן הזה הוא חילץ יותר ישויות וקשרים בהשוואה למודלים מתחרים, וייצר גרף עקבי בלי שבירת רצף המשמעות.

איך מריצים

כדי להריץ אותו כמו שצריך צריך שני כרטיסי מסך עם עשרים וארבעה גיגה בייט זיכרון כל אחד, כמו צמד כרטיסי שלוש אפס תשע אפס. השכבות שנשמרו בדיוק גבוה מונעות ממנו להידחס לכרטיס צרכני יחיד. מריצים אותו דרך ספריות כמו וי אל אל אם או אס ג'י לאנג עם תמיכה בקוד מרוחק ומקביליות של שני מעבדים גרפיים, כשהוא תומך גם בחיזוי מרובה טוקנים להאצת הקצב.

אם אין לכם מערך של שני כרטיסים חזקים עם קירור מתאים וזיכרון מספק, עדיף להשתמש בפתרון ענן או בממשק חיצוני. ניסיון לדחוף אותו למאיץ יחיד יחייב חיתוך אגרסיבי של חלון ההקשר ויבטל את היתרון שבגללו שמרתם על השכבות האלה.

pip install -U huggingface_hub
hf download goldhub/Qwen3.8-27B-BF16-INT4-W4A16-G32-AutoRound

הרישיון

המודל מפורסם תחת רישיון אפאצ'י שתיים אפס. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים סגורים. הדרישה העיקרית היא שמירה על הודעות זכויות היוצרים והצהרת הרישיון המקורית בקוד או בתוכנה שמפיצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗