GPT
B

Baichuan-M2-32B

קוד פתוח

baichuan-incapache-2.02025-08-10

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • chat

מודל עם 33 מיליארד פרמטרים שעבר התאמה עמוקה לעולם הרפואי. הוא מיועד למי שצריך יכולות אבחון וחשיבה קלינית בקוד פתוח.

  • 33Bפרמטרים
  • 131,072טוקנים בהקשר
  • 62.5 GBמשקל הקבצים
  • 1,719הורדות בחודש

מה זה

המודל מבוסס על הארכיטקטורה של Qwen2.5 בגרסת 32B, אבל עבר אימון ייעודי עם מערכת אימות רפואית המדמה חולים ומקרים קליניים. במקום להישאר מודל שפה כללי שמנחש מונחים, הוא אומן לחשוב כמו רופא, לתשאל מטופלים ולשמור על דיוק מקצועי בשלבי ביניים של למידת חיזוק.

במדד HealthBench הוא מגיע לציון 60.1 ולציון 34.7 בחלק הקשה, ועוקף מודלים עצומים בהרבה כמו Deepseek-R1-0528 וגרסאות פתוחות שונות. במקביל הוא שומר על רמה גבוהה במשימות כלליות, עם 83.4 ב־AIME24, כך שההתמחות הרפואית לא מחקה את יכולות ההיגיון והמתמטיקה הבסיסיות שלו.

מתאים ל

  • סימולטור למתמחים ברפואה

    הוא אומן מול מדמי מטופלים ומסוגל לנהל דיאלוג קליני שבודק אבחנות מורכבות.

  • מערכת תמיכה בהחלטות

    מציג ציון של 34.7 ב־HealthBench-Hard ומסייע לרופאים בהצלבת נתונים.

  • ייעוץ בריאות ראשוני באנגלית

    מבצע אימות רב ממדי שמונע הטעיה בתשובות ומזהה צורך בשאלות המשך.

איפה זה נופל

היוצרים מדגישים במפורש שהתוצרים מיועדים למחקר, הדרכה או ייעוץ כללי בלבד, ואסור להסתמך עליהם כאבחון רפואי או תחליף לטיפול מקצועי. בנוסף, האימון התמקד באנגלית ובסינית בלבד, כך שכל ניסיון לתשאל אותו בעברית עלול להוביל לטעויות תרגום מסוכנות במונחים קליניים עדינים.

שאלות
נפוצות

האם אפשר להשתמש בו לניתוח תיקים רפואיים בעברית?

המודל הוכשר אך ורק באנגלית ובסינית. הוא אמנם מבוסס על תשתית רחבה, אך שימוש קליני בשפה שלא נתמכה רשמית כרוך בהזיות ובפענוח שגוי של מושגים קריטיים.

איזה כוח מחשוב נחוץ להרצה מקומית בלי גרסאות מכווצות?

המשקלים דורשים יותר משישים ג'יגה בייט זיכרון גרפי בפורמט bfloat16. להרצה סבירה עם חלון הקשר פעיל תצטרכו שרת עם זוג כרטיסי A100 או H100, אלא אם תעברו לגרסת ה־4 ביט שמסתפקת בכרטיס בודד.

איך מריצים

במשקל מלא של bfloat16 הקבצים תופסים 62.5 ג'יגה בייט, מה שמחייב שני כרטיסי עיבוד מתקדמים עם זיכרון משותף של לפחות שמונים ג'יגה בייט כדי להריץ שרת מקומי. מי שרוצה לחסוך חומרה יכול להשתמש בגרסת 4 ביט שמיועדת לכרטיס RTX4090 יחיד, או בגרסת שמונה ביט לפלטפורמות Ascend.

מריצים אותו ישירות עם vLLM מגרסה 0.9.0 ומעלה או עם SGLang מגרסה 0.4.6.post1, תוך הגדרת מפענח החשיבה של qwen3. אם אתם עובדים עם SGLang, קיימת גם אפשרות להאצת הסקת מסקנות ספקולטיבית בעזרת מודל טיוטה פנימי.

from transformers import pipeline

pipe = pipeline("text-generation", model="baichuan-inc/Baichuan-M2-32B")
print(pipe("שלום"))

הרישיון

הרישיון הוא Apache 2.0 מלא. אפשר להשתמש במודל לצרכים מסחריים, לשלב אותו באפליקציות, לשנות את המשקלים ולהפיץ אותו בחופשיות, כל עוד שומרים על תנאי הרישיון המקורי והצהרת זכויות היוצרים.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש
  • שימוש בפטנטים

הרישיון המלא בעמוד המודל ↗