GPT
E

ERNIE-4.5-21B-A3B-Thinking-GGUF

קוד פתוח

unslothapache-2.02025-09-10

  • transformers
  • gguf
  • ERNIE4.5
  • text-generation
  • en

גרסת חשיבה מכווצת של באידו שמפעילה רק שלושה מיליארד פרמטרים מתוך עשרים ואחד בכל טוקן. היא מביאה חלון הקשר ענק ויכולת הסקת מסקנות בלי להעמיס על החומרה.

  • 343 GBמשקל הקבצים
  • 3,764הורדות בחודש
  • 58לייקים

מה זה

מדובר במודל MoE שעבר אימון מתקדם כדי לחדד תהליכי חשיבה עמוקים, מתמטיקה, קוד ושימוש בכלים. מתוך עשרים ואחד מיליארד פרמטרים בסך הכל, רק שלושה מיליארד מופעלים בפועל עבור כל טוקן, מה שמאפשר לו לרוץ מהר יחסית לגודלו המלא תוך שימוש בשישים וארבעה מומחים שונים. חלון ההקשר שלו מגיע ל־131,072 טוקנים, כך שאפשר לזרוק פנימה מסמכים ארוכים למדי.

המודל כולל תמיכה מובנית בקריאה לפונקציות וביצוע משימות שדורשות לוגיקה רב שלבית. הוא נבנה כדי להתחרות במודלים קלים שמתמקדים בחשיבה מאומצת, כשבאידו הרחיבו במכוון את אורך שרשרת החשיבה שלו לפני מתן התשובה הסופית כדי לשפר דיוק.

מתאים ל

  • פתרון בעיות קוד מורכבות

    ארכיטקטורת החשיבה המורחבת מאפשרת לתכנן ולפתור באגים אלגוריתמיים שלב אחר שלב.

  • סוכן אוטונומי להפעלת כלים

    התמיכה המובנית ב־function calling מתאימה למערכות שצריכות לנתח מצב ולהפעיל API חיצוני.

  • ניתוח מסמכים טכניים באנגלית

    חלון הקשר של 128K מאפשר עיבוד מאמרים ארוכים ודוחות ללא צורך בחיתוך מוקדם.

איפה זה נופל

המודל אומן רק על אנגלית וסינית, כך שאין לצפות לביצועים סבירים בעברית בלי בדיקה מקיפה מראש. בנוסף, כיוון שמדובר בגרסת חשיבה שמייצרת שרשרת מחשבה ארוכה לפני שהיא פולטת פלט, זמן ההמתנה לטוקן ראשון ולסיום הפלט ארוך משמעותית ממודלים רגילים, מה שלא מתאים לממשקי צ'אט מהירים בזמן אמת.

שאלות
נפוצות

האם המודל יפעל טוב עם פרומפטים בעברית?

התיעוד מגדיר תמיכה באנגלית ובסינית בלבד. הוא עשוי להבין מילים בודדות בעברית, אבל הוא לא מתאים לעבודה שוטפת בשפה הזו.

כמה זיכרון GPU באמת צריך כדי להריץ אותו?

לפי הוראות ההרצה בשרת עם FastDeploy דרוש כרטיס של 80GB VRAM. שימוש בגרסאות מכווצות או בספריות אחרות עשוי לדרוש פחות, אך ידרוש התאמות.

איך מריצים

הכרטיס מציין דרישה לכרטיס מסך בודד של 80GB כדי להרים את המודל המקורי דרך FastDeploy 2.2, למשל על A100 או H100. עבור הרצה עם transformers נדרשת לפחות גרסה 4.54.0, ואפשר לעבוד גם עם vLLM אם כי התמיכה במפענחי החשיבה והכלים שם עדיין בפיתוח.

אם אין לכם שרת ייעודי עם נפח זיכרון גרפי כזה, הרצה מקומית של הגרסאות המלאות פשוט תחנוק את המכונה. במצב כזה עדיף לצרוך את היכולות דרך API מרוחק במקום להשקיע בשרתים יקרים לעיבוד מקומי.

ollama run hf.co/unsloth/ERNIE-4.5-21B-A3B-Thinking-GGUF:Q4_K_M

איזו גרסה

אותו מודל בכמה רמות דחיסה. ככל שהמספר נמוך יותר הקובץ קטן יותר ורץ על פחות זיכרון, והתשובות נהיות פחות מדויקות. רוב האנשים רוצים את הגדולה ביותר שנכנסת להם בזיכרון.

הרישיון

הפצה תחת רישיון Apache 2.0 המאפשר שימוש מסחרי מלא, שינוי הקוד והפצה מחדש ללא תמלוגים, כל עוד שומרים על הודעת זכויות היוצרים של Baidu.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗