ToolQuestor Logo

12+ công cụ tốt nhất cho Chuyển giọng nói thành văn bản năm 2026

Cập nhật lần cuối: 25 tháng 8, 2026

Nói thường nhanh hơn gõ, nhưng kết quả vẫn cần được chuyển thành văn bản viết. Công cụ Chuyển giọng nói thành văn bản phiên âm lời nói thành văn bản theo thời gian thực hoặc từ bản ghi âm.

Chuyên gia và sinh viên sử dụng chuyển giọng nói thành văn bản để ghi chú, bản nháp hoặc đọc chính tả mà không cần gõ thủ công.

AssemblyAI logo AssemblyAI, Wispr Flow logo Wispr FlowLetterly logo Letterly là những công cụ tốt nhất cho Chuyển giọng nói thành văn bản. Vì vậy, hãy cùng xem xét kỹ hơn cả 12+ công cụ.

Chuyển giọng nói thành văn bản tools

AssemblyAI cung cấp cho nhà phát triển một cách để chuyển âm thanh và video thành văn bản cũng như thông tin chi tiết mà không cần xây dựng mô hình nhận dạng giọng nói từ đầu.

AssemblyAI screenshot

Bạn có thể gửi một bản ghi hoàn chỉnh để xử lý hàng loạt, phát trực tuyến âm thanh trực tiếp để có phụ đề thời gian thực hoặc sử dụng Sync API khi bạn chỉ cần một bản phiên âm nhanh từ một đoạn clip ngắn trong một lệnh gọi.

Mô hình Universal-3.5 Pro được thiết kế cho các cuộc trò chuyện thực tế, hoạt động trên 18 ngôn ngữ, gắn nhãn cho các người nói khác nhau và nhận dạng chính xác các từ ngữ y tế và kỹ thuật.

Ngoài bản phiên âm, Speech Understanding có thể tóm tắt âm thanh, phát hiện cảm xúc và chủ đề, dịch ngôn ngữ và trích xuất tên, ngày tháng cũng như các chi tiết khác.

Tất cả được tính phí theo giờ âm thanh được xử lý, bắt đầu khoảng $0.15 mỗi giờ, với các tính năng bổ sung được định giá như các tiện ích nhỏ.

Các nhóm xây dựng agent giọng nói thay vào đó có thể sử dụng Voice Agent API với giá $4.50 mỗi giờ, đã bao gồm mô hình nhận dạng giọng nói, mô hình ngôn ngữ tập trung vào hội thoại và chuyển văn bản thành giọng nói cùng nhau.

Thay vì gõ, Wispr Flow cho phép bạn chỉ cần nói, và nó biến cả lời nói lan man hoặc tự sửa lỗi thành văn bản sạch, trau chuốt được chèn trực tiếp vào bất kỳ ứng dụng nào bạn đang mở.

Wispr Flow screenshot

Nó chạy toàn hệ thống trên Mac, Windows, iOS và Android, vì vậy email, tin nhắn trò chuyện, ghi chú và thậm chí cả bình luận mã đều có thể được đọc chính tả mà không cần sao chép và dán.

Ngoài đọc chính tả, nó cung cấp trình ghi chú cuộc họp xác định người nói, từ điển cá nhân cho tên và thuật ngữ chuyên môn, và snippet mở rộng một cụm từ ngắn thành một tin nhắn đầy đủ được viết sẵn.

Miễn phí có giá 0 USD mỗi tháng và bao gồm các tính năng cơ bản với một số giới hạn hàng tuần về từ và cuộc họp.

Pro có giá 15 USD mỗi người dùng mỗi tháng, giảm xuống 12 USD mỗi tháng cho gói năm, và loại bỏ các giới hạn này đồng thời thêm các mô hình AI mạnh hơn.

Enterprise có giá theo yêu cầu và mang đến các tính năng bảo mật như SSO và SOC 2 cho các tổ chức lớn hơn.

Thay vì gõ ghi chú hoặc email, Letterly cho phép bạn chỉ cần nói và trả lại văn bản đã được làm sạch và sắp xếp. Các từ đệm biến mất, ngữ pháp được sửa và những suy nghĩ lan man của bạn trở thành các đoạn văn hoặc gạch đầu dòng có cấu trúc.

Letterly screenshot

Ứng dụng bao gồm ghi chú hàng ngày, bản ghi âm cuộc họp nhiều người nói và đọc chính tả trực tiếp vào các công cụ như Gmail, Slack và Notion, tất cả bằng hơn 90 ngôn ngữ.

Ứng dụng chạy trên web, iOS, Android, macOS và Windows, với ghi chú đồng bộ trực tiếp trên mọi thiết bị bạn sử dụng.

Có ba tùy chọn giá: Gói Hàng tháng ở mức 19,99 đô la, gói Hàng năm ở mức 79,99 đô la với bản dùng thử miễn phí 7 ngày và tùy chọn Trọn đời ở mức 199,99 đô la thanh toán một lần.

Cả ba gói đều có bản ghi âm không giới hạn, viết lại không giới hạn bằng AI và truy cập trên các thiết bị không giới hạn, vì vậy vấn đề chính là bạn muốn cam kết trong bao lâu.

Voibe thay bàn phím bằng giọng nói của bạn trên Mac và Windows. Giữ một phím tắt, nói bình thường, và ứng dụng sẽ chèn văn bản rõ ràng, đúng dấu câu trực tiếp vào bất kỳ ứng dụng nào bạn đang sử dụng, từ trình soạn thảo mã đến email.

Voibe screenshot

Bên trong, ứng dụng sử dụng các mô hình mã nguồn mở dựa trên Whisper, không phải AI độc quyền của các công ty công nghệ lớn, và không bao giờ lưu trữ hay huấn luyện trên âm thanh của bạn. Các máy Mac Apple Silicon có thể chạy toàn bộ mọi thứ ngoại tuyến, trong khi Windows dựa vào đường truyền đám mây không lưu trữ dữ liệu.

Các nhà phát triển có một chế độ dành cho nhà phát triển (Developer Mode) quét không gian làm việc cục bộ để các tên tệp và biến khi nói ra được phân giải chính xác bên trong Cursor, VS Code và Windsurf, điều này rất hữu ích cho quy trình làm việc lập trình với AI.

Về giá cả, các chuyên gia có thể chọn gói hàng tháng ở mức $7,50, gói hàng năm ở mức $59 với bốn tháng miễn phí, hoặc mua một lần trọn đời ở mức $149. Nhóm từ ba người trở lên tiết kiệm khoảng 20 phần trăm, nhóm lớn hơn từ mười người trở lên có thể yêu cầu các điều khoản tùy chỉnh, và mọi gói đều bắt đầu với dùng thử miễn phí và đảm bảo hoàn tiền trong 30 ngày.

Việc gõ phím thường làm chậm con người hơn là suy nghĩ, và VoiceTypr được xây dựng dựa trên ý tưởng đó. Đây là một ứng dụng đọc chính tả bằng giọng nói mã nguồn mở dành cho macOS và Windows, chuyển lời nói thành văn bản trong bất kỳ ứng dụng nào bạn đang sử dụng.

VoiceTypr screenshot

Giữ một phím nóng toàn cầu, nói tự nhiên và thả ra. Các từ xuất hiện ngay lập tức tại con trỏ của bạn, cho dù đó là trình soạn thảo mã, ứng dụng email hay ứng dụng trò chuyện.

Phiên âm diễn ra trên thiết bị của bạn theo mặc định, sử dụng các mô hình Whisper mã nguồn mở, vì vậy không cần kết nối internet để ghi lại lời nói của bạn.

Khi bạn muốn nhiều hơn, một bước tăng cường AI tùy chọn có thể định hình lại lời nói thô thành một yêu cầu, email, ghi chú hoặc thông điệp commit trau chuốt, được hỗ trợ bởi các mô hình đám mây như Groq hoặc OpenAI.

Ngoài ra còn có CLI và API Agent, để các nhà phát triển có thể đưa trực tiếp đầu vào bằng giọng nói vào các tập lệnh hoặc tác nhân AI thay vì phải gõ mọi thứ bằng tay.

Giá là một lần mua trọn đời thay vì đăng ký, bắt đầu từ 39 đô la cho một thiết bị và lên đến 99 đô la cho bốn thiết bị, với bản dùng thử miễn phí 3 ngày và cửa sổ hoàn tiền 7 ngày để dùng thử trước.

Monologue chuyển lời nói của bạn thành văn bản sạch, được định dạng thay vì một bản ghi thô. Nó cắt bỏ từ đệm, chỉnh lại cách diễn đạt và định hình đầu ra để phù hợp với bất kỳ ứng dụng nào bạn đang gõ.

Monologue screenshot

Ứng dụng khả dụng trên Mac, iPhone, iPad và Apple Watch, với từ điển, chế độ và ghi chú của bạn được đồng bộ ở mọi nơi.

Bản dùng thử miễn phí bao gồm 1.000 từ đọc chính tả và 10 ghi chú đã ghi âm để bạn có thể dùng thử trước khi trả phí.

Ngoài ra, Pro có giá 15 đô la mỗi tháng hoặc 144 đô la mỗi năm, tương đương khoảng 12 đô la mỗi tháng và xóa bỏ mọi giới hạn sử dụng.

Pro cũng bổ sung ghi chú cuộc họp không có bot và hỗ trợ đầy đủ trên mọi thiết bị Apple.

Monologue được bao gồm trong gói đăng ký Every rộng hơn, và nó cung cấp API, CLI và hỗ trợ MCP cho các nhà phát triển muốn ghi chú bên trong các tác nhân lập trình của họ.

Thay vì gõ, Aqua Voice cho phép bạn nói. Giữ một phím trong bất kỳ ứng dụng nào, nói tự nhiên, và lời nói của bạn sẽ xuất hiện thành văn bản gọn gàng, có định dạng trong chốc lát, sẵn sàng cho trình soạn mã, email hoặc ứng dụng trò chuyện.

Aqua Voice screenshot

Công cụ được hỗ trợ bởi Avalon, một mô hình nhận dạng giọng nói được đào tạo đặc biệt về cách mọi người nói chuyện với máy tính và trợ lý AI, vì vậy nó nhận dạng các thuật ngữ mã và tên kỹ thuật đáng tin cậy hơn phần mềm đọc chính tả điển hình.

Bất kỳ ai cũng có thể bắt đầu miễn phí với gói Starter và 1.000 từ. Chuyển sang Pro có giá 10 đô la một tháng, hoặc 8 đô la một tháng nếu thanh toán theo năm, và xóa giới hạn từ trong khi thêm hướng dẫn tùy chỉnh.

Gói Max có giá 30 đô la một tháng, hoặc 24 đô la một tháng theo năm, và mang lại luồng phát trực tiếp cùng với các lệnh thoại như gửi tin nhắn. Các nhóm trả 15 đô la mỗi người dùng hàng tháng, hoặc 12 đô la hàng năm, với một hóa đơn dùng chung.

Khách hàng Enterprise nhận được giá tùy chỉnh cùng với đăng nhập một lần, không lưu trữ dữ liệu và báo cáo chi tiết cho các tổ chức lớn hơn.

Ưu đãi giảm 70% cho sinh viên áp dụng cho Pro và Max, và tất cả các gói đều cho phép hủy bất cứ lúc nào.

Thay vì gõ, VoiceInk cho phép bạn chỉ cần nói trên Mac hoặc iPhone. Nhấn phím tắt, nói điều bạn cần, và văn bản sạch, sẵn sàng sử dụng xuất hiện tại vị trí con trỏ của bạn.

VoiceInk screenshot

Theo mặc định, xử lý giọng nói diễn ra cục bộ trên thiết bị của bạn, giữ âm thanh của bạn ở chế độ riêng tư, mặc dù các mô hình đám mây tùy chọn có sẵn nếu bạn cung cấp khóa API của riêng mình.

Tính năng Modes của nó nhận diện ứng dụng bạn đang sử dụng, như Slack hoặc Gmail, và tự động điều chỉnh mô hình chuyển giọng nói và phong cách viết cho phù hợp với ngữ cảnh đó.

Không có đăng ký ở đây. Solo giá $29 cho một Mac, Personal giá $49 cho hai Mac, Extended giá $69 cho ba Mac, và nhóm có thể nhận giấy phép Startup 10 chỗ ngồi với giá $199.

Mọi tùy chọn đều đi kèm cập nhật trọn đời và cửa sổ hoàn tiền 14 ngày, một lần thanh toán là vĩnh viễn.

Là mã nguồn mở, nó cũng được định hình tích cực bởi một cộng đồng người dùng nhiệt tình.

Thay vì gõ, Superwhisper cho phép bạn nói và lời nói của bạn xuất hiện dưới dạng văn bản sạch, được định dạng trong bất kỳ ứng dụng nào bạn đang sử dụng, trên Mac, Windows hoặc iPhone.

Superwhisper screenshot

Đằng sau hậu trường, nó ghi âm giọng nói của bạn, chuyển đổi thành văn bản, sau đó chạy qua mô hình AI tuân theo chế độ bạn đã chọn, cho dù đó là ghi chú nhanh, email trang trọng hay tóm tắt cuộc họp.

Bạn quyết định mức độ riêng tư. Mô hình cục bộ giữ mọi thứ trên thiết bị của bạn, trong khi mô hình đám mây và khóa API của riêng bạn mở ra kết quả mạnh mẽ hơn khi bạn muốn.

Bắt đầu không tốn kém gì. Gói miễn phí bao gồm đọc chính tả cốt lõi, ghi âm cuộc họp và hỗ trợ hơn 100 ngôn ngữ.

Nâng cấp lên Pro có giá 8,49 đô la mỗi tháng hoặc 84,99 đô la mỗi năm, gần như miễn phí hai tháng, thêm dịch thuật, chuyển đổi tệp và truy cập mô hình không giới hạn. Một tùy chọn trọn đời cũng có sẵn với khoản thanh toán một lần 249,99 đô la.

Các nhóm có nhu cầu lớn hơn có thể chuyển sang Enterprise, một gói có giá tùy chỉnh được xây dựng dựa trên chứng nhận bảo mật, hóa đơn tập trung và giá theo khối lượng.

Thay vì gõ từng tin nhắn, Typeless cho phép bạn nói và trả lại văn bản đã được viết rõ ràng. Giữ phím tắt trên máy tính, hoặc nút thoại trên điện thoại, ứng dụng sẽ điền văn bản cho bạn.

Typeless screenshot

Nó âm thầm loại bỏ những câu ậm ừ, từ lặp lại và khởi đầu sai, sau đó sắp xếp kết quả thành câu, bước hoặc đoạn văn khớp với điều bạn đang muốn nói.

Bạn có thể sử dụng nó ở hầu hết mọi nơi trên thiết bị, dù là email công việc, trò chuyện nhóm hay tài liệu dài, và trải nghiệm luôn nhất quán trên macOS, Windows, iOS và Android.

Bắt đầu miễn phí, với 8.000 từ được bảo hiểm mỗi tuần ở độ chính xác tiêu chuẩn. Chuyển sang Pro có giá $12 cho mỗi thành viên hàng tháng trong gói năm, hoặc $30 nếu bạn trả theo tháng, đồng thời gỡ bỏ giới hạn từ và tăng tốc cho nhóm.

Các công ty lớn hơn có thể hỏi về giá Enterprise, gói này thêm đăng nhập một lần, dấu vết kiểm toán và hỗ trợ ưu tiên.

Với hỗ trợ hơn 100 ngôn ngữ và thói quen học cách bạn viết, nó phù hợp với cả ghi chú ngắn hàng ngày lẫn các bài viết dài hơn.

Thay vì gõ chữ, Willow Voice cho phép bạn chỉ cần nói và nó biến lời nói của bạn thành văn bản trau chuốt, được định dạng bên trong bất kỳ ứng dụng nào bạn đang sử dụng, từ email đến trò chuyện hay ghi chú.

Willow Voice screenshot

Ứng dụng có sẵn trên Mac, Windows và iPhone và học phong cách viết của bạn theo thời gian để các câu trả lời nghe như chính bạn viết.

Bắt đầu hoàn toàn miễn phí. Gói miễn phí bao gồm phiên âm không giới hạn với mô hình Frontier Mini, cá nhân hóa cơ bản và 20 lượt sử dụng trợ lý viết Scribe mỗi tuần.

Nâng cấp lên Pro mang đến mô hình Frontier Pro chính xác hơn, Scribe không giới hạn, phiên âm nhanh hơn và truy cập trên iPhone, với giá 15 đô la cho mỗi người dùng mỗi tháng hoặc 12 đô la khi thanh toán theo năm.

Gói Business bổ sung các tính năng nhóm như từ điển dùng chung, thanh toán tập trung và bảo mật mạnh hơn như SOC 2 và không lưu trữ dữ liệu, với giá 35 đô la mỗi tháng hoặc 28 đô la khi thanh toán theo năm.

Các tổ chức lớn hơn có thể chuyển sang Enterprise, gói này bổ sung đăng nhập một lần, hỗ trợ chuyên biệt và các kiểm soát nâng cao với giá tùy chỉnh.

Thay vì cung cấp cho bạn một bản ghi âm thô với đầy các từ đệm và câu dở dang, AudioPen viết lại lời nói của bạn thành văn bản mà bạn có thể gửi hoặc xuất bản ngay lập tức.

AudioPen screenshot

Bạn chọn từ các phong cách viết được cài sẵn như công việc, email, hoặc ghi chú thông thường, hoặc dạy cho nó giọng điệu của riêng bạn bằng cách cung cấp các mẫu văn bản của bạn.

Nó hoạt động trên nhiều thiết bị, bao gồm ứng dụng Mac với phím tắt gõ nhanh, bàn phím iOS, ứng dụng Android và tiện ích Chrome cho trình duyệt.

Thay vì đăng ký, AudioPen bán quyền truy cập dưới dạng các lượt trả một lần. Ba tháng có giá $33, một năm là $99, và hai năm là $159, mỗi lần chỉ tính phí một lần.

Mọi gói đều bao gồm các công cụ giống nhau, viết lại bằng AI không giới hạn, tải lên tệp âm thanh, SuperSummaries, các thư mục và thẻ được tổ chức, và tích hợp qua Zapier và webhook.

Các bản ghi âm được xóa khỏi máy chủ nhanh chóng và ghi chú của bạn không bao giờ được sử dụng để huấn luyện mô hình AI, điều này giúp toàn bộ quá trình nhanh chóng và riêng tư.

ElevenLabs nổi tiếng nhất với khả năng tạo giọng nói AI nghe thật giống con người, có nhịp dừng, ngữ điệu và cảm xúc tự nhiên thay vì giọng máy đều đều. Ngoài giọng nói, nó có thể sao chép giọng nói từ một đoạn mẫu ngắn, lồng tiếng video sang hàng chục ngôn ngữ, tạo nhạc và hiệu ứng âm thanh, đồng thời chạy trợ lý giọng nói trò chuyện với khách hàng qua điện thoại hoặc chat.

ElevenLabs screenshot

Có ba cách chính để sử dụng. ElevenCreative là studio trên web dành cho nhà sáng tạo nội dung làm podcast, quảng cáo và video ngắn. ElevenAgents cho phép bạn thiết kế và ra mắt chatbot giọng nói và chat hội thoại mà không cần viết mã. ElevenAPI mở ra cùng công nghệ cho nhà phát triển thông qua REST API với SDK Python và JavaScript được chuẩn bị sẵn.

Gói Miễn phí cung cấp 10.000 tín dụng mỗi tháng để bất kỳ ai cũng có thể thử các tính năng cơ bản mà không mất phí. Starter giá $6/tháng và thêm giấy phép thương mại cùng sao chép giọng nói tức thì. Creator, gói phổ biến nhất, thường có giá $22/tháng, đôi khi được ưu đãi ở mức $11 cho tháng đầu tiên, và bao gồm sao chép giọng nói chuyên nghiệp với hạn mức tín dụng lớn hơn nhiều.

Nhu cầu lớn hơn được đáp ứng bởi Pro ở mức $99/tháng, Scale ở mức $299/tháng với chỗ ngồi workspace dùng chung, và Business ở mức $990/tháng với mười chỗ ngồi và giọng nói chi phí thấp, độ trễ thấp. Giá Enterprise được trao đổi trực tiếp với đội ngũ ElevenLabs và bao gồm bảo mật tùy chỉnh cùng hỗ trợ ưu tiên.

Vì mọi gói đều sử dụng chung các mô hình giọng nói và âm thanh cơ bản, chất lượng không giảm khi bạn mở rộng quy mô, dù bạn sản xuất một video đơn lẻ hay chạy hàng nghìn cuộc gọi khách hàng trực tiếp.

Deepgram cung cấp cho các nhà phát triển một nền tảng duy nhất cho chuyển giọng nói thành văn bản, chuyển văn bản thành giọng nói và tác tử giọng nói thời gian thực, thay vì phải kết hợp các công cụ riêng biệt.

Deepgram screenshot

Các mô hình Nova-3 và Flux của nó phiên âm âm thanh nhanh chóng và chính xác trong hơn 45 ngôn ngữ, với nhãn người nói, định dạng và che giấu thông tin cá nhân được tích hợp sẵn.

Về phía giọng nói, các mô hình giọng nói Aura tạo ra các phản hồi tự nhiên nhanh chóng, và Giao diện lập trình ứng dụng Tác tử giọng nói (Voice Agent API) kết nối nghe, suy luận và nói thành một cuộc trò chuyện mượt mà, độ trễ thấp.

Người dùng mới bắt đầu với gói Pay As You Go, bao gồm tín dụng miễn phí $200 và chỉ tính phí cho mức sử dụng thực tế sau đó.

Gói Growth phù hợp với các nhóm bận rộn hơn với $4.000 trở lên mỗi năm dưới dạng tín dụng trả trước, mang lại mức giá thấp hơn cho hầu hết các dịch vụ và giới hạn đồng thời cao hơn.

Các tổ chức lớn hơn có thể chuyển sang gói Enterprise, một gói có giá tùy chỉnh thông qua đội ngũ bán hàng, thêm hỗ trợ chuyên trách, mô hình tùy chỉnh và các tùy chọn tự lưu trữ để kiểm soát dữ liệu chặt chẽ hơn.

Hầu hết các trợ lý giọng nói đọc văn bản một cách máy móc mà không thực sự cảm nhận được thời điểm. Hume AI có cách tiếp cận khác, xây dựng Giao diện Giọng nói Đồng cảm lắng nghe tông giọng và cảm xúc, sau đó phản hồi bằng giọng nói thực sự phù hợp với cảm giác của cuộc trò chuyện.

Hume AI screenshot

Mô hình chuyển văn bản thành giọng nói Octave hoạt động theo cách tương tự, sử dụng ngữ cảnh để điều chỉnh cao độ, nhịp độ và sự nhấn mạnh thay vì đọc bằng giọng đều đều, máy móc.

Có gói miễn phí với 10.000 ký tự nói và 5 phút hội thoại bằng giọng nói mỗi tháng, đủ để dùng thử.

Từ đó, Starter bắt đầu ở mức 3 đô la một tháng, với Creator, Pro, Scale và Business mỗi gói đều tăng mức sử dụng, tốc độ yêu cầu và giảm giá vượt mức.

Các doanh nghiệp cần nhiều hơn có thể chuyển sang gói Enterprise tùy chỉnh, bao gồm số ghế nhóm không giới hạn, hỗ trợ qua Slack và tuân thủ SOC 2 Type II, GDPR và HIPAA.

Vì lớp giọng nói của Hume hoạt động với các mô hình bên ngoài như Claude, GPT và Gemini, các nhóm có thể thay đổi bộ não đằng sau trợ lý mà không thay đổi âm thanh.