ענקית הטכנולוגיה גוגל ממשיכה להרחיב את סדרת מודלי הבינה המלאכותית שלה והציגה אמש (רביעי) פריצת דרך משמעותית בתחום זיהוי הדיבור. החברה הכריזה על Gemini 3.5 Transcribe, מודל קולי ייעודי שתוכנן להמיר שמע לטקסט מדויק, ערוך ומפוסק בזמן אמת. בניגוד למערכות מסורתיות שמתקשות ברעשי רקע ובשגיאות דיבור, המודל החדש מבין את כוונת המשתמש ומפיק טקסט מוכן לקריאה ללא צורך בהגהה ידנית.
Gemini 3.5 Transcribe is our latest speech-to-text model for precise and intelligent transcriptions. 🧵 pic.twitter.com/24IDhwBtl7
— Google DeepMind (@GoogleDeepMind) August 26, 2026
מחיקת גמגומים ותיקון טעויות בזמן אמת
החידוש הבולט במודל הוא היכולת לבצע "ניקוי חכם" של הדיבור האנושי. המערכת מסננת באופן עצמאי מילות מילוי והיסוסים, ויודעת להתמודד עם תיקונים עצמיים באמצע משפט, כמו "ניפגש ביום שלישי, בעצם ביום רביעי". לפי נתוני בדיקה עצמאיים, המודל מציג שיעור שגיאות מילים (WER) נמוך במיוחד של 2.6% בעיבוד קבצים ו-4% בשידור חי, ומציג מהירות תגובה גבוהה ב-70% בהשוואה לדור הקודם.
בנוסף לדיוק הגבוה, המערכת מזהה ומתמללת באופן אוטומטי יותר מ-85 שפות וניבים מקומיים, כולל תמיכה מלאה ומדויקת בשפה העברית כפי שנצפה בבדיקות המעבדה ב-Google AI Studio. המודל מסוגל לבצע הפרדה בין עד שלושה דוברים שונים בהקלטה ולהצמיד לכל משפט חותמת זמן מדויקת ברמת המילה הבודדת, מה שהופך אותו לכלי אידיאלי לסיכום ישיבות וראיונות עבודה.
🗣️💬 Say hello to Gemini 3.5 Transcribe, a speech-to-text model that actually understands your codebase.
Watch how this latest model filters out spoken hesitation while grounding technical terms, file names, and code variables precisely against the active context while building… pic.twitter.com/BA76I3rZGD
— Google AI Developers (@googleaidevs) August 26, 2026
תכנות בקול וזיהוי צורת דיבור
חידוש מרתק עבור קהילת הפיתוח הוא היכולת לבצע "תכנות באווירה" (Vibe Coding): בניית אפליקציות שלמות וכתיבת קוד באמצעות הנחיות קוליות בלבד ב-Google AI Studio. בנוסף, המודל משתלב בסביבת Google Antigravity ומצליב את תמליל הדיבור עם תוכן המסך והמסמכים הפתוחים כדי להבטיח דיוק מושלם. המערכת מסוגלת גם ללמוד ז'רגון מקצועי מותאם אישית, מונחים טכניים מורכבים ומספרים סידוריים, מה שהופך אותה לשימושית במיוחד במגזרי הרפואה, המשפט והפיננסים.
במכשירי אנדרואיד, המודל מניע את תכונת ה-Rambler במקלדת Gboard של גוגל, ומאפשר להפוך מחשבות מדוברות למסמך מעוצב, לתקן שגיאות ולשנות סגנון כתיבה בקול בלבד. במחשבי מק, הייחודיות של המודל מתבטאת בהבנת הקשר המסך ושליטה ישירה במיקום סמן העכבר. המערכת מסוגלת לסרוק קבצים פתוחים במחשב, לתמצת מסמכים מקומיים ואף להפיק תמונות היכן שסמן העכבר עומד – באמצעות הנחיות קוליות חופשיות המפעילות מודלים כבדים אחרים ברקע.
בגזרת הזמינות, גוגל פותחת את המודל לשימוש מיידי עבור מפתחים ב-Google AI Studio ובסביבת Google Antigravity, וכן ללקוחות עסקיים בפלטפורמת Gemini Enterprise דרך ממשקי API לשידור חי ולעיבוד קבצים. עבור המשתמשים הפרטיים, הפיצ'ר זמין כבר כעת באפליקציית המק באנגלית ובמקלדת Gboard באנדרואיד במדינות נבחרות, וצפוי להתרחב בקרוב לדפדפן כרום כדי לאפשר הכתבה קולית בכל שדה טקסט ברשת.
