GPT
L

llm-jp-4-8b-thinking

קוד פתוח

llm-jpapache-2.02026-03-16

  • transformers
  • safetensors
  • llama
  • text-generation
  • conversational

מודל פתוח בגודל 8.6 מיליארד פרמטרים שמתמקד ביפנית ובאנגלית עם יכולות חשיבה מובנות. הוא מיועד למי שצריך עיבוד שיחה והיגיון דו־לשוני בחומרה מקומית נגישה.

  • 8.6Bפרמטרים
  • 65,536טוקנים בהקשר
  • 16.0 GBמשקל הקבצים
  • 14,212הורדות בחודש

מה זה

הפיתוח הזה מגיע מהמכון הלאומי למידע ביפן, כחלק מסדרת מודלים מאומנים על 11.7 טריליון טוקנים. הוא עובר אימון מקדים, המשך אימון, ולאחר מכן כוונון עדין והתאמת העדפות ישירה ללא שלב חיזוק נוסף. הארכיטקטורה מבוססת על מבנה דחוס עם חלון הקשר של 65,536 טוקנים, ותבנית השיחה נבנתה בהשראת הפורמט של אופנאיי.

במבחני MT-Bench שנבדקו באמצעות שופט אוטומטי חיצוני, הוא מקבל 7.54 ביפנית ו־7.79 באנגלית במצב חשיבה בינוני. התוצאות האלה מציבות אותו קרוב מאוד לביצועים של מודלים פתוחים כבדים ממנו בהרבה, כמו gpt-oss-20b, ואף עוקפות אותם בחלק ממבחני ההוראות והבטיחות ביפנית.

מתאים ל

  • עיבוד מסמכים ביפנית

    ניתוח טקסטים ארוכים ביפנית ואנגלית בתוך חלון הקשר של 65 אלף טוקנים ללא תלות בענן חיצוני.

  • בוט שיחה דו־לשוני

    מענה לשאלות מורכבות תוך שימוש במנגנון החשיבה המובנה שמשפר פתרון בעיות במספר שלבים.

  • מחקר והתאמה מקומית

    בסיס לאימון נוסף הודות לרישיון הפתוח ושחרור חלקי של מערכי הנתונים ששימשו לבנייתו.

איפה זה נופל

היוצרים מציינים במפורש שהמודל נמצא בשלבי מחקר מוקדמים, ולא עבר התאמה מחמירה שתבטיח עמידה בכללי בטיחות או כוונת משתמש. מעבר לזה, הוא אומן רק על יפנית ואנגלית, ולכן אין לו שום תמיכה מעשית בעברית או בשפות אחרות. לא הייתי משלב אותו במערכת מול לקוחות בלי שכבת סינון ובדיקה קפדנית של הפלטים.

אותה משפחה

llm-jp-4 יצא ב־3 גרסאות שיש להן עמוד כאן. אלה האחרות, לפי כמה מורידים אותן.

שאלות
נפוצות

האם המודל הזה מתאים לעבודה בעברית?

לא. המודל אומן מראש על אנגלית ויפנית בלבד, והטוקנייזר שלו לא נבנה עבור עברית. הוא לא יידע לייצר טקסט עברי קריא או עקבי.

מה המשמעות של מצבי הנימוק השונים בבדיקות?

התוצאות במפרט מראות שמתן מרחב חשיבה בינוני מעלה את ציוני השיחה והדיוק מול משימות מורכבות. זה דורש יותר טוקנים לפלט ומאט את המענה, אבל משפר את איכות התשובה בפועל.

איך מריצים

המשקל הכולל של הקבצים עומד על 16 ג'יגה־בייט בדיוק bfloat16, כך שצריך כרטיס מסך יחיד עם לפחות 24 ג'יגה זיכרון כדי להריץ אותו בצורה יציבה, במיוחד אם מנצלים חלק משמעותי מחלון ההקשר. הוא נתמך ישירות בספריית transformers הרגילה, אבל הטוקנייזר שלו ייחודי ודורש שימוש ישיר במימוש שמגיע במאגר ולא בספריות צד שלישי כלליות.

אם יש לכם שרת מקומי עם מאיץ מתאים, ההרצה פשוטה ונותנת פרטיות מלאה. אם אתם צריכים רק שאילתות בודדות או שאין לכם כרטיס מתאים, שירות ענן שמחזיק מודל ייעודי יהיה זול ופשוט יותר מתחזוקת שרת ייעודי עבורו.

from transformers import pipeline

pipe = pipeline("text-generation", model="llm-jp/llm-jp-4-8b-thinking")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש בו לצרכים מסחריים, לשנות את המשקלים, לשלב אותו במוצר סגור ולהפיץ אותו בחופשיות, כל עוד שומרים על הודעת זכויות היוצרים ומצרפים עותק של תנאי הרישיון המקוריים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗