GPT
O

AtomicChat/Ornith-1.5-35B-A3B-GGUF

קוד פתוח

AtomicChatmit2026-08-19

  • gguf
  • llama.cpp
  • ornith
  • imatrix
  • quantized

זהו מודל שפה ותמונה עם ארכיטקטורת מומחים דלילה, שמשתמש רק ב־3 מיליארד פרמטרים פעילים מתוך 35 מיליארד. הוא מאפשר לקבל ביצועים ודיוק של מודל ענק עם מהירות חישוב של מודל קטן.

  • 276 GBמשקל הקבצים
  • 83,997הורדות בחודש
  • 57לייקים

מה זה

מדובר בהמרה מותאמת אישית של מודל המומחים Ornith-1.5, שכולל תמיכה בקלט של טקסט ותמונה יחד. הוא מחזיק 256 מומחים בסך הכל ומפעיל רק 8 מהם בכל טוקן, כך שצוואר הבקבוק העיקרי עובר מכוח העיבוד של המעבד הגרפי אל נפח הזיכרון ורוחב הפס. ארכיטקטורת הקשב שלו היא היברידית, עם קשב מלא בעשר שכבות בלבד וקשב לינארי ביתר שלושים השכבות, לצד חלון הקשר ענק שמגיע עד 262,144 טוקנים.

המפרסמים בנו כאן קוונטיזציות ייעודיות לכל טנסור בנפרד, ולא הסתפקו בהגדרות ברירת המחדל של llama.cpp. הבדיקות שהם צירפו מראות יתרון ברור לשכבות המותאמות. למשל, הגרסה המותאמת בגודל ארבעה ביטים, AD-Q4_K-IQ4_XS, שוקלת כמעט גיגהבייט פחות מגרסת Q4_K_M הרגילה, ומורידה את סטיית המידע ב־34 אחוזים מול מודל הבסיס. זה אומר שמקבלים תשובות שקרובות בהרבה לדיוק המקורי בלי לשלם בזיכרון נוסף.

מתאים ל

  • ניתוח מסמכים חזותיים

    הבנת תרשימים ודוחות ויזואליים, בזכות שילוב עיבוד תמונה וקשב ארוך.

  • מערכות שיחה מהירות

    מענה קולי או טקסטואלי בזמן אמת, שמנצל את מהירות החישוב של 3B פרמטרים.

  • שרתים עם זיכרון בינוני

    הרצה מקומית על תחנת עבודה בודדת, תוך פריסת מומחים בין ה־GPU ל־RAM.

איפה זה נופל

ארכיטקטורת מומחים דלילה רגישה מאוד לדחיסה, והמרות נמוכות גורמות לנתב המומחים לפספס ולשלוח שאלות למומחה הלא נכון. כתוצאה מכך, ברמות דחיסה של 3 ו־2 ביטים הדיוק של הטוקן המוביל צונח מ־95 אחוזים לאזור ה־84 אחוזים, והשגיאה מצטברת מהר.

בעבודה עם תמונות, חובה להגדיר ידנית את הפרמטר image-min-tokens לערך של 1024. בלי זה, תמונות צפופות כמו צילומי מסך וגרפים מקבלות מעט מדי טוקנים, והמודל פשוט ממציא פרטים על בסיס ידע מוקדם במקום לקרוא את התמונה. בנוסף, אי אפשר להפעיל במקביל פיענוח ספקולטיבי ויכולות ראייה ממוחשבת בתוך llama.cpp.

אותה משפחה

Ornith-1.5 יצא ב־2 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

איזה קובץ הכי משתלם להוריד?

אם יש לכם כרטיס עם 24 גיגהבייט, לכו על AD-Q4_K-IQ4_XS. הוא שוקל 20.1 גיגהבייט, משאיר מקום לחלון הקשר, ומציג חיתוך של 34 אחוזים בסטייה לעומת קובץ ה־Q4 הרגיל. לכרטיסי 32 גיגהבייט, AD-Q6_K מציג ביצועים כמעט זהים ל־8 ביט אך חוסך כמעט שמונה גיגהבייט.

למה המודל ממציא פרטים כשאני שולח לו תרשים?

הוא כנראה קיבל מעט מדי טוקנים לראייה. כדי לתקן את זה, אתם חייבים להעביר את הדגל image-min-tokens עם ערך של 1024, אחרת הוא מתעלם מפרטי התמונה ועונה מתוך ידע כללי.

אפשר להפעיל חיזוי טוקנים מהיר יחד עם תמונות?

כרגע לא ב־llama.cpp. שילוב של ראש הניבוי הרב-טוקני יחד עם מעבד התמונה אינו נתמך במקביל, ולכן תצטרכו לבחור אם אתם רוצים מהירות כפולה בטקסט בלבד, או יכולות ראייה ללא פיענוח ספקולטיבי.

איך מריצים

בשביל להריץ אותו כמו שצריך, הדרישות תלויות בעיקר בנפח הזיכרון הגרפי. לגרסה המאוזנת של 4 ביטים צריך כרטיס עם 24 גיגהבייט זיכרון כדי להשאיר מקום גם להקשר, כאשר לגרסת 8 ביטים מלאה תצטרכו 48 גיגהבייט. אם יש לכם כרטיס קטן יותר, למשל של 12 או 16 גיגהבייט, הטריק פה הוא להריץ את שכבות המומחים על זיכרון המחשב באמצעות הדגל cpu-moe, כי רק 3 מיליארד פרמטרים מחושבים בכל רגע והחישוב עצמו נשאר קל.

אם אין לכם כרטיס גרפי מתאים עם לפחות 16 עד 24 גיגהבייט זיכרון מהיר, עדיף לפנות ל־API חיצוני. הרצה של מודל בגודל הזה כשהמומחים זולגים לזיכרון איטי תייצר צוואר בקבוק משמעותי, שפשוט יהרוס את מהירות התגובה למשתמש.

ollama run hf.co/AtomicChat/Ornith-1.5-35B-A3B-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הרישיון הוא MIT, וזה אומר חופש כמעט מוחלט. מותר להשתמש במודל לצרכים מסחריים, לשנות אותו, להטמיע אותו במוצרים סגורים ולהפיץ אותו הלאה, בלי לשלם תמלוגים. הדרישה היחידה היא לכלול את הודעת זכויות היוצרים ואת נוסח הרישיון המקורי יחד עם הקוד או המוצר שלכם.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗