GPT
L

llm-jp-4-32b-a3b-thinking

קוד פתוח

llm-jpapache-2.02026-03-16

  • transformers
  • safetensors
  • qwen3_moe
  • text-generation
  • conversational

מודל תערובת מומחים דו-לשוני לאנגלית ויפנית שמפעיל רק 3.8 מיליארד פרמטרים בכל שלב חשיבה. פתרון מתאים למי שצריך עיבוד מעמיק של טקסט יפני בלי לשלם בזמן חישוב של מודל ענק.

  • 32Bפרמטרים
  • 65,536טוקנים בהקשר
  • 59.9 GBמשקל הקבצים
  • 3,080הורדות בחודש

מה זה

הארכיטקטורה מבוססת על מודל מומחים של 32 מיליארד פרמטרים בסך הכול, מתוכם מופעלים בפועל רק 3.8 מיליארד פרמטרים בכל טוקן דרך 8 מומחים פעילים מתוך 128. הוא עבר אימון מקדים ואימון אמצע על 11.7 טריליון טוקנים, ולאחר מכן כוונון עדין בהנחיה ואופטימיזציית העדפות ישירה בלי למידת חיזוק. חלון ההקשר עומד על 65,536 טוקנים, מה שמאפשר להזין מסמכים ארוכים לתוך תהליך החשיבה.

במדדי MT-Bench שנמדדו מול שופט אוטומטי, המודל הגיע לציון של 7.82 ביפנית ו־7.86 באנגלית ברמת חשיבה בינונית. הציונים האלה מציבים אותו מעל גרסת ה־8B של אותה סדרה ועוקפים את gpt-4o במבחן היפני, אבל הוא עדיין רחוק ממודלי קצה מסחריים כמו gpt-5.4 שנבדק שם. ההבדל בינו לבין מודלי 32B רגילים הוא החיסכון בכוח המחשוב בזמן ריצה, שנובע ממבנה הניתוב הדליל.

מתאים ל

  • ניתוח מסמכים ביפנית

    חלון הקשר של 65,536 טוקנים ואימון עמוק על קורפוסים ביפנית מאפשרים עיבוד מסמכים ארוכים.

  • הסקה חסכונית במשאבים

    מבנה מומחים שמפעיל 3.8 מיליארד פרמטרים בלבד בזמן ריצה מקצר את זמני התגובה בהשוואה למודל צפוף.

  • מחקר על שרשראות חשיבה

    שחרור חופשי של משקולות עם שכבת חשיבה מובנית מאפשר לבחון התנהגות מודלים תחת כוונון DPO.

איפה זה נופל

יוצרי המודל מצהירים בפירוש שהשחרור נמצא בשלבי מחקר ופיתוח מוקדמים, ושהוא לא עבר התאמה מספקת כדי להבטיח בטיחות או יישור מלא עם כוונת המשתמש. הוא אומן רק באנגלית וביפנית, כך שאין מה לצפות לביצועים סבירים בעברית. בנוסף, הוא לא כולל אימון מבוסס חיזוקים אלא רק DPO ו־SFT, ולכן חובה לבדוק ולסנן את הפלטים שלו ידנית לפני שמשלבים אותו במערכת שפונה למשתמשי קצה.

אותה משפחה

llm-jp-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל תומך בטקסט בעברית?

הוא אומן בלעדית על אנגלית ויפנית, ולכן הוא לא מתאים לעיבוד או יצירה של עברית. שימוש בעברית יוביל לפלטים שגויים או להזיות, ולא מומלץ לבנות עליו משימות בשפה זו.

למה צריך כל כך הרבה זיכרון אם הוא מפעיל מעט פרמטרים?

בארכיטקטורת תערובת מומחים, הניתוב דורש שכל 128 המומחים יישבו בזיכרון הכרטיס בו-זמנית. בזמן חישוב הטוקן המעבד נוגע רק בחלק קטן מהם, מה שמאיץ את הריצה, אך טביעת הרגל ב־VRAM נשארת בגודל של מודל 32B מלא.

איך מריצים

המשקל הכולל של הקבצים מגיע ל־59.9 ג'יגה-בייט בפורמט bfloat16, כך שתצטרכו לפחות 64 ג'יגה-בייט של זיכרון כרטיס מסך פנוי כדי לטעון אותו במלואו, או שרת עם מספר מאיצים. אף שרק כ־3.8 מיליארד פרמטרים מחושבים בכל צעד, כל 32 מיליארד הפרמטרים חייבים לשבת בזיכרון ה־VRAM לצורך הניתוב.

אם אין לכם כרטיסים מקצועיים או שרת ייעודי עם מספיק זיכרון מהיר, עדיף להשתמש בפתרון ענן או בגרסת ה־8B הצפופה של הסדרה. תבנית השיחה נבנתה בהתאמה למבנה של OpenAI Harmony, אך הטוקנייזר עצמו מבוסס Unigram של הפרויקט, ולכן חובה להשתמש בטוקנייזר הרשמי דרך ספריית transformers ולא בספריות צד שלישי רגילות.

from transformers import pipeline

pipe = pipeline("text-generation", model="llm-jp/llm-jp-4-32b-a3b-thinking")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 המוכר. מותר להשתמש בו לצרכים מסחריים, לשנות אותו, לארח אותו ולשלב אותו במוצרים חופשיים או סגורים, בתנאי ששומרים על הודעות זכויות היוצרים והרישיון המקורי בקבצים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗