GPT
A

ASMR-Archive-Processed

קוד פתוח

OmniAICreatoragpl-3.02025-06-21

  • speech
  • audio
  • japanese
  • asmr
  • anime

מאגר ענק של קולות דיבור ולחישה ביפנית מעולמות ה־ASMR, שעבר ניקוי רעשים ותמלול אוטומטי. הוא מיועד למי שמאמן מודלי דיבור או זיהוי קולי וצריך נפח עצום של קולות קרובים למיקרופון.

  • 14,823הורדות בחודש
  • 96לייקים

מה זה

הנתונים מבוססים על ארכיונים קודמים של תוכני ASMR ביפנית, ומכילים מעל 33,922 שעות של אודיו מעובד. תהליך ההכנה כלל סינון קבצים קצרים או באיכות ירודה, המרה אחידה לפורמט FLAC ב־44.1kHz סטריאו ב־24 ביט, והפרדת קולות מרעשי רקע באמצעות MelBand Roformer. לאחר מכן האודיו עבר נרמול עוצמה ב־ffmpeg וחיתוך מקטעי דיבור עם Silero-VAD.

התמלול בוצע באמצעות המודל anime-whisper ולאחר מכן עבר ליטוש ותיקון שגיאות על ידי מודל השפה gemini-2.5-flash כדי לשפר את הניסוח, לצד בדיקות מרחק עריכה שנועדו לבלום הזיות. המקטעים עורבבו, והמזהים שלהם גובבו כדי להקשות על שחזור היצירות המקוריות המוגנות בזכויות יוצרים לפי החוק היפני.

מתאים ל

  • אימון מודלי TTS ללחישות

    יצירת קולות סינתטיים אינטימיים, דיבור שקט או לחישות ביפנית באיכות אודיו גבוהה.

  • כוונון זיהוי דיבור (ASR)

    שיפור מודלי תמלול על יפנית דיבורית, כולל התמודדות עם הגייה רכה וקולות נשיפה.

  • הפרדת קול מרעש

    בדיקה ואימון של אלגוריתמים לסינון אפקטים קוליים והשארת דיבור בלבד.

איפה זה נופל

ההטיה הבולטת ביותר היא שפה ומגדר, שכן כל התוכן ביפנית ורובו המכריע מורכב מקולות נשיים. חלק ניכר מחומרי המקור הוגדר במקור כתוכן למבוגרים (NSFW), כך שהוא לא מתאים למערכות שדורשות תוכן נקי. בנוסף, למרות הניקוי, חלק מהקטעים עדיין מכילים אפקטים קוליים שנשארו ברקע או דיבור חופף של כמה דוברים. התמלולים לא עברו בדיקה אנושית ידנית ומסתמכים לגמרי על מודלי AI, ולכן הם כוללים שגיאות.

שאלות
נפוצות

האם מותר להשתמש במאגר למוצר מסחרי?

זה בעייתי מאוד. הרישיון המדווח הוא AGPL-3.0 שמחייב פתיחת קוד לכל נגזרת, והיוצרים מציינים במפורש שהחומר מיועד למחקר אקדמי וחינוכי. מעבר לכך, מדובר בתוכן מוגן בזכויות יוצרים שעורבב כדי להגביל את שחזורו, כך ששימוש מסחרי חושף אתכם לתביעות.

האם הדאטהסט כולל הקלטות בעברית או באנגלית?

לא. המאגר מכיל דיבור ביפנית בלבד, שהגיע מתוכני ASMR יפניים. אם אתם צריכים לאמן מודלים לשפות אחרות, החומר הזה לא רלוונטי עבורכם.

איך התבצע תמלול הקבצים?

האודיו חולק למקטעים ותומלל תחילה באמצעות המודל anime-whisper. לאחר מכן, התוצאה הועברה במלואה למודל השפה gemini-2.5-flash לתיקון שגיאות תחביר ודיוק, לצד מנגנוני סינון שדחו שינויים דרסטיים מדי.

האם המאגר ממשיך להתעדכן בחומרים חדשים?

לא כרגע. באפריל 2026 המאגר הגיע לתקרת נפח האחסון החינמי של Hugging Face, ומאחר שההרחבה כרוכה בתשלום חודשי, המפתחים הודיעו על הקפאת העלאת קבצים חדשים.

איך טוענים

המאגר ארוז בפורמט WebDataset ומחולק לכמעט 19 אלף קובצי tar, המסודרים לפי תיקיות של שנים וחודשים מ־2016 עד 2022. כל קובץ ארכיון כולל לרוב 1,024 דגימות, כאשר לכל דגימה יש שלישיית קבצים תואמת: אודיו flac, תמלול txt ומטא-דאטה ב־json. הגישה חופשית ללא צורך באישור מיוחד, אך העדכונים של היוצרים הוקפאו לאחר שהגיעו למגבלת האחסון הציבורי ב־Hugging Face.

from datasets import load_dataset

ds = load_dataset("OmniAICreator/ASMR-Archive-Processed")

הרישיון

המאגר מופץ תחת רישיון AGPL-3.0 שירש ממקורותיו. מדובר ברישיון קוד פתוח תובעני במיוחד, שמחייב שיתוף של כל עבודה נגזרת או שירות שרץ על בסיסו תחת אותו הרישיון בדיוק ובקוד פתוח. אם אתם מתכננים לאמן מודל למוצר מסחרי סגור, זה מסוכן מאוד מבחינה משפטית.

הרישיון המלא ב־Hugging Face ↗