התחרות בעולם הבינה המלאכותית הקולית מגיעה לשיא חדש: ימים ספורים לאחר שגוגל הציגה את מודל התמלול שלה, חברת מטא משיבה אש ומשיקה את Muse Voice Transcribe. המודל החדש מהווה את מודל התפיסה הקולית הראשון של החברה הפועל בזמן אמת, ונועד להפוך דיבור מורכב ואנושי לטקסט מלוטש ומדויק ללא שגיאות.
Muse Voice Transcribe is MSL's first real-time audio perception model — rolling out today. SOTA in streaming speech-to-text, it handles speaker diarization, and endpointing natively in a single model. pic.twitter.com/LViMDSkbim
— Mark Zuckerberg (@finkd) September 1, 2026

דברו אליו: גוגל חשפה מודל AI חדש שהולך להבין כל מילה שלכם
השהיה חכמה ומעבר בין שפות
המערכת מעבדת את השמע בפולסים זעירים של 80 מילי-שניות ומבוססת על מנגנון "השהיה מותאמת" (Adaptive Delay). המודל מחליט אוטונומית כמה זמן להמתין: מילים שגרתיות מתומללות מיידית, בעוד שבמונחים מורכבים הוא ממתין שבריר שנייה נוסף כדי להבטיח דיוק מרבי. בנוסף, המודל תומך ב"החלפת קוד" (מעבר בין שפות באמצע משפט) ומסוגל לקבל מראש את רשימת אנשי הקשר, המיקומים ומילות המפתח של המשתמש כדי למנוע שגיאות איות בשמות מוכרים.
בניגוד למערכות מסורתיות הדורשות עיבוד מאוחר, מטא שילבה באותו מודל זיהוי דיבור שוטף, זיהוי נקודת העצירה של הדובר והפרדה אוטומטית בין למעלה מ-20 דוברים שונים בו-זמנית. המערכת מסוגלת לתמלל שיחות והרצאות של למעלה משעה ברצף, תוך הצמדת תוויות מדויקות לכל דובר בזמן אמת. המודל אומן על יותר מ-70 שפות, כאשר 25 מתוכן עברו אימות קפדני לקראת ההשקה.
קיצור דרך במק ושמירה על פרטיות
היכולות החדשות כבר הוטמעו באפליקציית Meta AI למחשבי מק ובסביבת התכנות Muse Code. משתמשי מק יכולים להפעיל את ההכתבה הקולית מול כל חלון או שדה טקסט פתוח על המסך בלחיצה ממושכת על מקש ה-Fn במקלדת. המערכת סורקת את ההקשר של החלון המוצג ומאפשרת לנסח מסמכים, להשיב למיילים או לכתוב קוד מתוך דיבור חופשי.
עבור מפתחים וארגונים, המודל זמין החל מהיום דרך ה-Meta Model API. מטא מציעה גם מסלול ייעודי עם "אפס שמירת נתונים", המבטיח כי קובצי השמע והתמלילים אינם נשמרים בשרתי החברה לאחר העיבוד – תנאי קריטי עבור גופים רפואיים, משפטיים ופיננסיים.
