GPT

מודלים ותשתית · קוד פתוח

הלוגו של RedPajama

RedPajama

הפרויקט משחזר את מערך הנתונים של מודל LLaMA כדי לאפשר אימון מודלים בקוד פתוח מלא. המטרה המרכזית היא לספק אלטרנטיבה פתוחה למודלים סגורים שנמצאים מאחורי ממשקי פיתוח מסחריים, לצורכי מחקר ופיתוח עצמאי.

בניגוד לנתונים המקוריים של מטא ששוחררו למחקר בלבד, המאגר הזה נבנה מראש כדי להתאים ליישומים מסחריים. הוא כולל את מתכון הסינון ועיבוד הנתונים המלא, כך שכל אחד יכול להוריד את החומרים או לשחזר את התהליך באופן עצמאי.

  • מודלים ותשתית
  • קוד פתוח
  • ממשק באנגלית

דירוג הקהילה

עוד לא דורג

תהיו הראשונים לדרג.

התחברות עם גוגל

דירוג אחד לכל אדם לכל כלי, ולכן צריך חשבון. אנחנו שומרים גיבוב של מזהה החשבון ואת השם הפרטי, ולא את הדוא״ל, לא את שם המשפחה ולא את התמונה.

לא נשלח אליכם דבר ולא נפרסם דבר בשמכם.

איך הדירוג עובד+

הדירוג פתוח רק למי שמחובר עם חשבון גוגל, דירוג אחד לכל אדם לכל כלי. זו הדרך שלנו לוודא שמדובר באדם אמיתי: היא אינה מוכיחה שהמדרג השתמש בכלי, וזה הבדל שכדאי לזכור כשקוראים ממוצע.

מי שכותב ביקורת מוצג בשמו הפרטי בלבד, כפי שהוא מופיע בחשבון גוגל. מעבר לזה לא נשמר דבר: לא שם משפחה, לא כתובת דוא״ל ולא תמונה: רק גיבוב חד־כיווני של מזהה החשבון, שמאפשר לכם לשנות את הדירוג שלכם ולא מאפשר לנו לדעת מי אתם.

ביקורת אינה יכולה להכיל קישורים, כתובות דוא״ל, מספרי טלפון או שמות משתמש. זה לא סינון תוכן, זה מה שמונע ממקום כזה להפוך ללוח מודעות.

תמחור
קוד פתוח
קטגוריה
מודלים ותשתית
שפת האתר
אנגלית
כתובת
together.xyz
נבדק
2026-09-09

הסקירה

מורידים כ־3TB של קבצים דחוסים מ־Hugging Face, פותחים אותם על הדיסק לנפח של 5TB, ומקבלים מאגר אימון שמכיל 1.2 טריליון טוקנים. זה הבסיס של RedPajama, מיזם קוד פתוח של חברת Together בשיתוף גופי מחקר כמו Stanford CRFM ו־LAION. המטרה כאן מוגדרת היטב, והיא לשחזר במדויק את מתכון הנתונים ששימש לאימון LLaMA המקורי של חברת Meta AI. במקום להסתמך על מודלים סגורים שנשענים על נתונים סודיים, הפרויקט פותח לציבור את כל תהליך הסינון, הניקוי והכנת המידע כדי שכל גוף יוכל לאמן מודלים מתחרים באופן שקוף לחלוטין.

החומר הגולמי חולק לשבע גזרות מידע שונות שכוללות עמודי רשת, ספרים ומאמרים מדעיים. חלק הארי מגיע מ־CommonCrawl, שעבר סינון קפדני באמצעות מסווג לינארי שנועד לשמור בעיקר עמודים שדומים בסגנונם לערכי Wikipedia. במקביל נכנסו קודים מ־GitHub לאחר בדיקת רישיונות, וכן דיונים מאתר StackExchange אחרי ניקוי תבניות קבועות. כל הנתונים והמסננים מפורסמים ב־GitHub לצד לוח מחוונים בשם Meerkat שנועד לחקור את הפיזור הפנימי של הנתונים.

מה מבדיל אותו ממודלים סגורים

מה שבאמת מפריע כאן הוא שקוראים רבים מבלבלים בין מאגר נתונים גולמי לבין מוצר עבודה מוכן למשרד. RedPajama נולד כדי לפתור את הבעיה המסחרית של LLaMA המקורי, שהוגבל למחקר אקדמי בלבד. RedPajama אינו כלי פרודוקטיביות לעובד הבודד, אלא מאגר תשתיתי שנועד לבניית מודלים פתוחים לשימוש מסחרי חופשי. המיזם מתמקד בשלושה שלבים שמתחילים בדאטה, ממשיכים באימון מודל בסיס על גבי מחשבי-על, ומסתיימים בכוונון בעזרת הוראות משתמש שנאספו מ־OpenChatKit כדי להביא את התוצר לרמת שיחה שוטפת ובטוחה.

זה דורש תשתית כבדה.

אם אתם מחפשים ממשק שיעזור לכם לנסח מיילים, לתמצת ישיבות או לנהל משימות בעסק, תתרחקו מהפרויקט הזה. לא הייתי משתמש בזה לשום משימה יומיומית במשרד. המאגר מתאים אך ורק לחוקרי למידה עמוקה, מהנדסי נתונים וצוותי פיתוח שרוצים לאמן מודל משלהם מאפס או לבצע התאמות עמוקות בלי תלות ברישיונות של תאגידי ענק. אם אין לכם אשכול מחשוב רציני עם כרטיסי מסך ייעודיים, אין לכם מה לעשות עם 5TB של טקסט מסונן.

כמה עולה להשתמש בתשתיות

הנתונים עצמם והקוד לסינון שלהם זמינים להורדה בחינם לגמרי דרך Hugging Face ו־GitHub. יחד עם זאת, הרצה של מודלים או אימון שלהם דרך שרתי הענן של חברת Together כרוכים בתשלום שמתחיל מחיוב לפי מיליון טוקנים ב־Serverless Inference ומגיע לעלויות גבוהות בהרבה באשכולות GPU ייעודיים. במסלול השרתים המשותפים המחיר מתחיל מאפס דולר עבור מודלים זעירים מסוימים כמו Ternary Bonsai 27B, ומטפס עד 3.00 דולר למיליון טוקני קלט ו־15.00 דולר לפלט במודלים גדולים כמו Kimi K3.

התמחור מבוסס על צריכה.

רוב המפתחים ישלמו סביב 0.15 דולר לקלט ו־0.60 דולר לפלט עבור מודלים כמו gpt-oss-120B, או 1.04 דולר לקלט ופלט במודל Llama 3.3 70B. יש הנחות משמעותיות על שמירת קלט בזיכרון מטמון, שמורידות את העלות לכמה סנטים בודדים, אבל אימון מודל שלם על 1.2 טריליון טוקנים ידרוש תקציבי מחשוב ענקיים שנמדדים באלפי דולרים ומעלה. בנוסף, האתר של החברה מציע פתרונות אחסון ואימון ייעודיים שמתומחרים בהתאמה אישית דרך פנייה למכירות, ולא מציג מחירון קבוע מראש עבור הקמת אשכול חומרה פרטי.

עברית לא מוזכרת במסמכים.

בכל החומר שפורסם סביב RedPajama אין שום אזכור לתמיכה בשפה העברית או לאיסוף מקורות ישראליים. המאגר מתמקד במקורות בינלאומיים גדולים כמו ויקיפדיה, סריקות רשת כלליות וספרות פתוחה, כך שסביר להניח שחלקה של העברית בתוך 1.2 טריליון הטוקנים שולי עד אפסי. מי שבונה על התשתית הזו כדי לפתח מודל שיבין עברית ברמה גבוהה יצטרך להזריק בעצמו כמויות עצומות של תוכן מקומי, לסנן אותו באותן שיטות, ולהשקיע זמן נוסף בניקוי והתאמה.

מרכיבי המיזם

  1. 01שחזור נתוני האימון
  2. 02הפעלת מסנני איכות
  3. 03חלוקה לשבע גזרות
  4. 04בדיקת רישיונות קוד
  5. 05אימון מודלי בסיס
  6. 06כוונון בעזרת הוראות
  • מאגר נתוניםקוד פתוח חינמי
  • תשתית ענןתשלום לפי שימוש
  • תמיכה בעבריתלא צוינה כלל

מאגר הבסיס של RedPajama הוא מאגר פתוח לחלוטין של 1.2 טריליון טוקנים שנוצר על פי המתכון המתואר במאמר של LLaMA.

הודעת ההשקה בבלוג של Together

מה RedPajama
עושה

הנתונים מחולקים לשבעה מקורות שעברו סינון והסרת כפילויות, כולל CommonCrawl עם 878 מיליארד טוקנים, C4 עם 175 מיליארד, גיטהאב עם 59 מיליארד, ומאגרי מאמרים וספרים. גודל המאגר המלא הוא 1.2 טריליון טוקנים, שתופסים כחמישה טרה-בייט בדיסק ללא דחיסה וכשלושה טרה-בייט להורדה מכווצת דרך Hugging Face.

הצוות שחרר גם דגימה אקראית קטנה יותר לבדיקות, לצד סביבת ניתוח אינטראקטיבית מבוססת Meerkat שכוללת וקטורי ייצוג לחלק של גיטהאב. כל קוד קדם-העיבוד ומסנני האיכות מפורסמים בגיטהאב ומאפשרים הרצה מקומית של תהליך ההכנה.

כמה זה
עולה

הורדת המאגר וקוד הסינון עצמם פתוחים לחלוטין ללא תשלום, אך האתר של החברה אינו מפרסם מחיר ספציפי עבור מודל או אימון שקשור ישירות לפרויקט הזה.

קוד פתוח $0.30$0.06$1.20$3.00$15.00$0.14

המספרים נקראו מעמוד התמחור של RedPajama ב־2026-09-09. תמחור משתנה. לפני החלטה כדאי לפתוח את עמוד התמחור עצמו.

למי זה
מתאים

המאגר מתאים לצוותי פיתוח, מהנדסי למידת מכונה וחוקרים שרוצים לאמן מודל שפה משלהם מאפס לשימוש מסחרי, ומוכנים להתמודד עם הורדה וניהול של טרה-בייטים של מידע גולמי.

מי שמחפש ממשק שיחה מוכן לעבודה יומיומית, כלי כתיבה מהיר לפרודוקטיביות במשרד או בוט שמתחבר ישירות לשירותי ענן בלי לנהל תשתית אימון, לא ימצא כאן שום שימוש.

מה לבדוק
לפני שמתחייבים

לפני שמתחילים להוריד חמישה טרה-בייט, צריך לבדוק אם יש לכם את תשתית האחסון וכוח החישוב הנדרש כדי לאמן מודלים על כמות נתונים כזו. כמו כן, הטקסטים מבוססים ברובם המוחלט על מקורות באנגלית כמו ויקיפדיה, מאמרי arXiv וקוד תוכנה, כך שאין כאן התאמה או ערובה לביצועים בעברית. היבט נוסף הוא זכויות יוצרים, המאגר מסנן רישיונות בקוד ומאמרים, אבל שימוש מסחרי בחומרים שנסרקו מהרשת עדיין דורש בדיקה משפטית שלכם מול התוכן בפועל.

מה אומרים
המשתמשים

עוד אף אחד לא כתב על RedPajama כאן. אם השתמשתם בRedPajama, השורה הראשונה היא שלכם.

להשאיר חוות דעת אנחנו לא מוחקים ביקורת שלילית, ולא מסמנים אף כלי כמומלץ בתשלום.

מה RedPajama
אומר על עצמו

RedPajama, a project to create leading open-source models, starts by reproducing LLaMA training dataset of over 1.2 trillion tokens

מהאתר של RedPajama, נקרא ב־2026-09-09. הטקסט הוא שלהם.

אנחנו לא מתרגמים תיאורי שיווק ומגישים אותם ככתיבה שלנו. שיטת העבודה.

שאלות
נפוצות

האם מקבלים כאן מודל שפה שאפשר להריץ מיד?

החומרים הנוכחיים כוללים את מערך הנתונים הגולמי בלבד ולא משקולות מודל מוכנות. הפרויקט כולל תוכניות לאימון מודלים בסיסיים וגרסאות מונחות פקודות בהמשך, אך השחרור הראשוני מורכב מטקסטים לאימון.

איך אפשר לגשת לקבצים בלי להוריד את כל הנפח?

ניתן לגשת למאגר דרך Hugging Face ולהוריד דגימה אקראית קטנה יותר שנועדה לבדיקות ראשוניות, במקום להתמודד עם שלושה טרה-בייט מכווצים.

מה RedPajama עושה?

הפרויקט משחזר את מערך הנתונים של מודל LLaMA כדי לאפשר אימון מודלים בקוד פתוח מלא. המטרה המרכזית היא לספק אלטרנטיבה פתוחה למודלים סגורים שנמצאים מאחורי ממשקי פיתוח מסחריים, לצורכי מחקר ופיתוח עצמאי. בניגוד לנתונים המקוריים של מטא ששוחררו למחקר בלבד, המאגר הזה נבנה מראש כדי להתאים ליישומים מסחריים. הוא כולל את מתכון הסינון ועיבוד הנתונים המלא, כך שכל אחד יכול להוריד את החומרים או לשחזר את התהליך באופן עצמאי.

האם RedPajama חינמי?

לפי מה שהאתר של RedPajama מפרסם, קוד פתוח. תנאים משתנים. כדאי לאמת מול עמוד התמחור שלו.

האם RedPajama תומך בעברית?

האתר של RedPajama מוגש באנגלית. זה לא אומר שהכלי לא יעבוד עם טקסט בעברית, אבל זה כן אומר שהוא לא נבנה סביבה.

יש חלופות ל־RedPajama?

כן. באתר יש 101 כלים בקטגוריית מודלים ותשתית, וחלקם מוצגים בתחתית העמוד הזה. ההשוואה שכדאי לעשות היא בין תמחור, שפת הממשק והתאמה למה שאתם צריכים לעשות, לא בין רשימות תכונות.

כלים דומיםבמודלים ותשתית

כל 101 הכלים
  • הלוגו של Replicate קוד פתוח

    Replicate

    הרצת מודלים של בינה מלאכותית בקוד דרך ממשק פשוט וללא ניהול שרתים.

    מודלים ותשתית replicate.com
  • הלוגו של Rewind קוד פתוח

    Rewind

    ריכוז מאות כלי בינה מלאכותית ומודלים פתוחים בממשק אחד דרך הדפדפן וקריאות קוד.

    מודלים ותשתית rewind.ai
  • הלוגו של Rivestack בתשלום

    Rivestack

    אירוח מנוהל של בסיס נתונים פוסטגרס עם הרחבת וקטורים ייעודית על אחסון מהיר

    מודלים ותשתית rivestack.io
  • הלוגו של RWKV 5 לא צוין

    RWKV 5

    מודל שפה בקוד פתוח המשלב אימון מקבילי עם הרצה חסכונית במשאבים.

    מודלים ותשתית rwkv.com
  • הלוגו של SambaNova קוד פתוח

    SambaNova

    תשתית חומרה ושבבי RDU שמאיצים הרצת מודלי שפה ענקיים וסוכני בינה מלאכותית.

    מודלים ותשתית sambanova.ai
  • הלוגו של Sho קוד פתוח

    Sho

    מודל שפה קומפקטי שמנתח טקסט, דיבור ותמונה ומתמחה במשימות חשיבה מדעיות.

    מודלים ותשתית microsoft.com