GPT
F

Fathom-R1-14B

קוד פתוח

FractalAIResearchmit2025-05-13

  • transformers
  • safetensors
  • qwen2
  • text-generation
  • conversational

מודל הסקת מסקנות מתמטי בגודל 15 מיליארד פרמטרים, שנבנה על בסיס דיסטיליזציה של DeepSeek ומכוון להוציא תוצאות ברמת אולימפיאדה בחלון ריצה של עד 16 אלף טוקנים בלבד.

  • 15Bפרמטרים
  • 131,072טוקנים בהקשר
  • 27.5 GBמשקל הקבצים
  • 227הורדות בחודש

מה זה

הצוות של FractalAI לקח את Deepseek-R1-Distilled-Qwen-14B ואימן אותו מחדש בעלות של 499 דולר בלבד. המטרה היתה לפתור בעיה מוכרת במודלי חשיבה: הצורך בשרשראות מחשבה ארוכות ובזבזניות של 32 אלף או 64 אלף טוקנים כדי להגיע לדיוק גבוה. הם עשו את זה באמצעות שילוב בין למידת תוכנית לימודים איטרטיבית לבין אימון על שרשראות הפתרון הקצרות ביותר האפשריות, ובסוף מיזגו את המשקלים.

במבחני AIME 2025 ו־HMMT 25 המודל עוקף מודלים סגורים כמו o1-mini ו־o3-mini-low בריצה בודדת, עם דיוק של 52.71% ב־AIME. כשמריצים דגימה מרובה של 64 תשובות עם הצבעת רוב, הדיוק קופץ ל־76.7%, תוצאה שמתחרה ב־o4-mini במצב נמוך. מעבר למתמטיקה נרשם שיפור של כחמישה אחוזים גם במבחן GPQA-Diamond, אף שמאגר האימון כלל בעיות מתמטיות בלבד.

מתאים ל

  • פתרון בעיות מתמטיות קשות

    מיועד למערכות שבודקות או פותרות תרגילי אולימפיאדה ומבחנים כמותיים שדורשים הסקת מסקנות רב-שלבית.

  • בדיקת תשובות בהצבעת רוב

    מתאים לצינורות עיבוד שמריצים עשרות דגימות במקביל כדי לחלץ תשובה סופית מדויקת לשאלות מדעיות מורכבות.

  • אימון מודלים קטנים יותר

    מייצר שרשראות חשיבה תמציתיות של עד 16 אלף טוקנים, מה שמאפשר להשתמש בפלטים שלו לדיסטיליזציה זולה.

איפה זה נופל

המודל אומן כמעט אך ורק על מתמטיקה תחרותית. הוא לא נבדק על כתיבת קוד כללי, סיכום טקסטים או משימות שיחה רגילות. אין שום מידע על תמיכה בעברית, וסביר להניח שהיכולת שלו לפתור שאלות מנוסחות בעברית ירודה מאוד. בנוסף, כדי להגיע למספרים הגבוהים שהחוקרים מתגאים בהם צריך לדגום 64 פתרונות שונים לכל שאלה, מה שמייקר את זמן הריצה פי עשרות מונים בהשוואה לפלט יחיד.

שאלות
נפוצות

האם המודל מתאים לשימוש כעוזר אישי כללי או צ'אט?

לא. הוא עבר כוונון ייעודי לפתרון בעיות מתמטיות קשות באמצעות שרשראות חשיבה. שימוש בו לשיחה רגילה, מענה למיילים או ניתוח טקסט יפיק תוצאות פחות טובות ממודלים כלליים בגודל דומה.

מה ההבדל בין הגרסה הזו לגרסת Fathom-R1-14B-RS?

גרסת RS כוללת שלב אימון בלמידת חיזוק שהוריד עוד יותר את אורך התשובה הממוצעת בכמה אחוזים, אך עלתה כפול לאימון. הגרסה הנוכחית התבססה על כוונון ישיר ומיזוג מודלים, ומציגה ביצועי pass@1 מעט עדיפים במבחנים מסוימים.

איך מריצים

בדיוק המקורי של bfloat16 הקבצים שוקלים 27.5 גיגה-בייט. תצטרכו כרטיס מקצועי עם 40 עד 80 גיגה זיכרון, כמו A100, בעיקר כי המודל מייצר פלטים ארוכים של אלפי טוקנים שממלאים את זיכרון ה־KV במהירות. שימוש בקוונטיזציה ל־4 או 8 ביט יאפשר להריץ אותו על כרטיס ביתי כמו RTX 3090 או 4090.

ההרצה מתבצעת ישירות דרך ספריית transformers הרגילה בארכיטקטורת Qwen2. אם אתם צריכים את הביצועים המרביים שדווחו, תצטרכו להגדיר טמפרטורה של 0.6, דגימת top_p של 0.95 ולהריץ עשרות דגימות במקביל כדי לבצע הצבעת רוב. אם אין לכם תשתית כרטיסים חזקה לחישוב מקבילי כזה, קריאה ל־API של מודל סגור תהיה זולה ופשוטה בהרבה.

from transformers import pipeline

pipe = pipeline("text-generation", model="FractalAIResearch/Fathom-R1-14B")
print(pipe("שלום"))

הרישיון

המודל שוחרר ברישיון MIT מלא. אתם יכולים להשתמש בו לצרכים מסחריים, לשנות אותו, להפיץ אותו ולהטמיע אותו במוצרים שלכם בלי תשלום תמלוגים. התנאי היחיד הוא שמירת הודעת זכויות היוצרים והרישיון המקורי בקוד או בהפצה.

  • שימוש מסחרי
  • שינוי הקוד
  • הפצה מחדש

הרישיון המלא בעמוד המודל ↗