Từ việc tăng điểm đến thanh toán: Ảo giác nhu cầu của Model Fusion
Tác giả:Yiping & David,IOSG
Một, Model Fusion là gì?
Vào tháng 6 năm 2026, thị trường AI đã chứng kiến hai sản phẩm mang tên "Fusion" trong chưa đầy ba tuần.
Vào ngày 12 tháng 6, OpenRouter phát hành Fusion Router, với tiêu đề Vượt qua hiệu suất biên giới với Fusion. Trong bài đánh giá nghiên cứu sâu DRACO của mình, nhóm mô hình bao gồm Fable 5 và GPT-5.5 đã đạt 69.0 điểm, vượt qua 65.3 điểm của mô hình đơn Fable 5. Điểm bán hàng mà OpenRouter đưa ra rất rõ ràng: khi mô hình đơn không đủ tốt, hãy để nhiều mô hình trả lời cùng một câu hỏi, sau đó để mô hình đánh giá so sánh và tổng hợp.

Vào ngày 29 tháng 6, Cognition phát hành Devin Fusion, nhưng tiêu đề lại là Hiệu suất biên giới với chi phí thấp hơn 35%. Nó không để nhiều mô hình lặp lại toàn bộ nhiệm vụ, mà để mô hình tiên tiến chịu trách nhiệm lập kế hoạch và phán đoán, giao công việc kiểm tra, sửa đổi cơ học cho một trợ lý rẻ hơn, và trong quá trình thực hiện, chuyển đổi mô hình một cách linh hoạt.

Cùng một từ, chỉ đến hai bộ logic kinh tế trái ngược. OpenRouter sử dụng nhiều tính toán để mua giới hạn cao hơn; Cognition cố gắng giảm thiểu tính toán đắt đỏ, đồng thời giữ nguyên chất lượng hiện có. Sự tương phản này còn rõ ràng hơn bất kỳ bảng xếp hạng mô hình nào. Đề tài công nghệ của mô hình fusion thực sự có giá trị: nhiều lần thử nghiệm có cơ hội vượt qua một lần thử nghiệm. Nhưng thị trường thực sự thưởng cho những ai không chỉ "gọi nhiều mô hình hơn", mà là ai có thể chi ít tiền hơn và giao hàng nhanh hơn sau khi đáp ứng ngưỡng chất lượng.
▲ Hình 1: Cùng một tháng, hai loại Fusion
Bài viết này giới hạn Model Fusion là một kiến trúc hẹp: nhiều mô hình trả lời song song cho cùng một nhiệm vụ, mô hình đánh giá so sánh kết quả, cuối cùng một mô hình đưa ra câu trả lời. Devin Fusion không thuộc định nghĩa này, nó gần hơn với định tuyến động và ủy thác nhiệm vụ. Lý do đưa nó vào phần đầu là vì thị trường đang coi "Fusion" như một thuật ngữ chung cho tất cả các sắp xếp nhiều mô hình, trong khi sản phẩm thực sự hiệu quả thường đang xa rời khái niệm hẹp về mô hình fusion.
Đánh giá của chúng tôi có phần bi quan: Model Fusion là một bảo hiểm chất lượng đắt đỏ. Nó có thể cải thiện hiệu suất tuyệt đối của một số nhiệm vụ, nhưng rất ít có thể thực sự đẩy ranh giới hiệu quả chi phí - chất lượng - độ trễ ra ngoài. Những nhiệm vụ thực sự đáng để mua bảo hiểm này rất hiếm. Nó sẽ tồn tại, nhưng có khả năng trở thành một chức năng kích hoạt thấp, thay vì kiến trúc mặc định, và khó có thể trở thành một loại độc lập.
Hai, hiện tại có những lựa chọn mô hình nào?
Thảo luận về Fusion rất dễ bị dẫn dắt vào bảng xếp hạng độ chính xác, nhưng các doanh nghiệp không mua thứ hạng bảng xếp hạng. Doanh nghiệp mua là kết quả đủ điều kiện của một nhiệm vụ, đồng thời phải tính đến giá cả, độ trễ, quyền riêng tư và tính ổn định. Chỉ cần mô hình rẻ hơn đã
vượt qua đường biên chấp nhận của doanh nghiệp, việc tiếp tục trả tiền cho "thông minh hơn" có thể không có ý nghĩa kinh tế. Hiệu quả chi phí mới là dòng chính thực sự của thị trường mô hình.
▲ Hình 2: Trí tuệ mô hình và chi phí đơn nhiệm, trục hoành là thang logarit
Điều đáng chú ý nhất trong hình không phải là điểm cao nhất ở góc trên bên phải, mà là những điểm lệch khỏi xu hướng giá - khả năng: chúng cung cấp khả năng đủ với giá thấp hơn, là những ngoại lệ hiệu quả trên tải công việc cụ thể. Chỉ số tổng hợp không thể trực tiếp trả lời mô hình nào phù hợp nhất cho kiểm tra mã, nghiên cứu tiếng Trung hoặc triển khai có quy định, nhưng nó tiết lộ một hướng đi: cung cấp mô hình đang trở thành hàng hóa, "mô hình mạnh nhất" và "lựa chọn tối ưu" đang tách rời.
Đối mặt với cùng một khoảng cách chất lượng, hiện tại thị trường có bốn cách mua chính.
Cách đầu tiên là nâng cấp trực tiếp lên mô hình đơn mạnh hơn. Nó đơn giản nhất và dễ kiểm toán nhất; chỉ cần mức tăng giá biên của mô hình cao cấp thấp hơn chi phí sai sót hoặc làm lại, điều này thường vẫn là lựa chọn hàng đầu. Cách thứ hai là tăng cường tính toán khi kiểm tra trên cùng một mô hình, chẳng hạn như kéo dài suy luận, self-consistency hoặc lấy mẫu nhiều lần. Cách thứ ba là định tuyến, chuỗi và ủy thác nhiệm vụ: trước tiên sử dụng mô hình rẻ hơn để xử lý các phần có thể xác minh hoặc cơ học, chỉ nâng cấp khi gặp khó khăn. Cách thứ tư mới là Model Fusion theo nghĩa hẹp: để nhiều mô hình trả lời cùng một vấn đề, sau đó để mô hình đánh giá và tổng hợp tạo ra câu trả lời cuối cùng.
Cả bốn cách đều có thể "đổi chất lượng bằng nhiều tính toán hơn", sự khác biệt nằm ở việc tính toán được chi tiêu ở đâu. Mô hình đơn mở rộng mua suy luận sâu hơn, định tuyến mua phân bổ tài nguyên chính xác hơn, Fusion thì mua nhiều câu trả lời ứng cử hơn. Ba phương pháp đầu tiên tập trung ngân sách vào những khâu có khả năng thay đổi kết quả nhất; Fusion lại trả tiền cho ý kiến lặp lại trước, sau đó cược vào mô hình đánh giá có thể tìm ra sự khác biệt hiệu quả từ đó. Các mô hình ứng cử chỉ có thể vượt qua ba phương án đầu tiên nếu chúng mang lại đủ thông tin độc lập và mô hình đánh giá có thể nhận diện những thông tin này.
Định tuyến đã chứng minh rằng sự khác biệt về khả năng giữa các mô hình trước tiên là một cơ hội lập lịch. RouteLLM đã giảm chi phí hơn 2 lần trong một số đánh giá mà không làm mất chất lượng; Switchcraft đạt độ chính xác 82.9% với mức giảm chi phí 84%, theo tính toán trong bài báo, có thể tiết kiệm hơn 3,600 đô la cho mỗi triệu yêu cầu. Kết quả vẫn cần được tái hiện trên lưu lượng của chính doanh nghiệp, nhưng logic kinh tế rất rõ ràng: không cần phải để nhiều mô hình họp, chỉ cần giao mỗi nhiệm vụ cho mô hình đủ điều kiện rẻ nhất.
Điều này có nghĩa là, thị trường sẽ trước tiên sử dụng nâng cấp, định tuyến và xác minh để giải quyết khoảng cách chất lượng; chỉ khi những phương pháp này vẫn không đủ, mới có lý do để mua thêm câu trả lời ứng cử cho Fusion.
Ba, tại sao việc nâng điểm không đồng nghĩa với giá trị?
Bởi vì Fusion phải vượt qua ba ngưỡng: chất lượng gia tăng phải bao phủ chi phí và độ trễ mới, các mô hình ứng cử phải cung cấp thông tin độc lập, và mô hình đánh giá phải ổn định nhận diện câu trả lời tốt hơn. Bất kỳ một yếu tố nào không thành công, việc nâng điểm cũng không thể chuyển hóa thành giá trị sản xuất. Chi phí tính toán: cần tăng bao nhiêu ngân sách và độ trễ? Việc nâng điểm của Fusion trước tiên là một khoản chi tiêu tính toán xác định. OpenRouter sẽ gọi song song nhiều mô hình panel, sau đó để mô hình đánh giá và tổng hợp tạo ra câu trả lời. Ba nhóm đối chứng của DRACO đều đã nâng điểm: Fable 5 + GPT-5.5 từ 65.3 lên 69.0; Opus 4.8 tự hợp nhất từ 58.8 lên 65.5; nhóm ba mô hình chi phí thấp từ 60.3 lên 64.7.
Nhưng sự cải thiện của Opus tự hợp nhất lớn hơn, cho thấy lợi ích có thể đến từ tìm kiếm và lấy mẫu bổ sung, chứ không phải từ sự bổ sung kiến thức giữa các mô hình. So sánh công bằng nên xem xét self-consistency, suy luận dài hơn và mô hình đơn mạnh dưới cùng một ngân sách token. Nghiên cứu hiện tại cũng cho thấy: nhiều tác nhân trong khoảng 20 lần khối lượng tính toán tối đa chỉ nâng cao 7.1 điểm phần trăm; khi ngân sách giống nhau, debate và Mixture-of-Agents chỉ cao hơn self-consistency 1.3 và 2.7 điểm phần trăm, một nghiên cứu khác về reasoning-token phát hiện ra rằng mô hình đơn giữ nguyên hoặc tốt hơn. Nhiều "lợi ích hợp tác" sẽ biến mất sau khi đối chiếu chi phí tính toán.
▲ Hình 3: Sự nâng điểm và chi phí sản phẩm của OpenRouter
Chi phí mặc định của panel 3 mô hình của OpenRouter khoảng 4-5 lần so với chi phí tạo thông thường, tốc độ chậm hơn 2-3 lần, nhưng không công bố đầy đủ token, chi phí và độ trễ của các cấu hình DRACO, không thể đánh giá liệu việc nâng 3.7 điểm có đáng giá hay không. Đánh giá cũng chỉ có 100 nhiệm vụ văn bản thuần tiếng Anh, các cấu hình liên quan đến Fable chỉ hoàn thành 93 nhiệm vụ; việc thay đổi mô hình đánh giá có thể khiến điểm tuyệt đối di chuyển 10-25 điểm phần trăm. Nó chứng minh rằng Fusion có thể nâng điểm, nhưng không chứng minh rằng Fusion cải thiện ROI sản xuất.
Việc gọi có chọn lọc chỉ có thể làm giảm chi phí. Theo ước tính khoảng mà OpenRouter công bố, tỷ lệ kích hoạt là 1%, chi phí tổng thể khoảng 1.03-1.04 lần; 10% là 1.30-1.40 lần; 25% đã đạt 1.75-2.00 lần.
▲ Hình 4: Tính kinh tế tổng thể của việc gọi Fusion có chọn lọc
Những yêu cầu khó nhất có khả năng kích hoạt Fusion nhiều nhất, nhưng hệ thống phải chờ các thành viên panel chậm nhất, sau đó hoàn thành đánh giá và tạo ra một cách tuần tự, do đó độ trễ cuối tập trung vào những nhiệm vụ có giá trị nhất. Việc gọi từ nhiều nhà cung cấp cũng mở rộng diện lỗi, độ phức tạp kiểm toán và sự phơi bày quyền riêng tư. Chi phí của Fusion không chỉ là giá API, mà còn bao gồm thời gian chờ và rủi ro hệ thống mới.
Thông tin bổ sung: Nhiều mô hình có thực sự cung cấp thông tin khác nhau không?
Giá trị của Fusion phụ thuộc vào việc các mô hình ứng cử có mang lại thông tin độc lập hay không, nhưng các mô hình khác nhau thường chia sẻ tài liệu đào tạo, nguồn trang web và giả định sai. Trong các nhiệm vụ nghiên cứu, điều này có thể dẫn đến "rửa trôi trích dẫn": nhiều mô hình truy nguyên đến cùng một nguồn, nhưng được đóng gói thành nhiều bằng chứng độc lập. Nếu hệ thống không giữ lại nguồn gốc claim-level và đường dẫn tìm kiếm, khi số lượng mô hình tăng lên, chi phí API gần như tăng theo tuyến tính, nhưng sự đa dạng bằng chứng chưa chắc đã tăng lên.
Josef Chen, đồng sáng lập và CEO của KAIKAKU.AI, trong bài báo năm 2026 Khi nào việc kết hợp các mô hình ngôn ngữ có ích? đã nghiên cứu 67 mô hình từ 21 nhà cung cấp dịch vụ. Trong nhiệm vụ toán học mở, xác suất dự đoán tất cả các mô hình cùng trả lời sai là 2.3%, nhưng thực tế đạt 5.2%------khoảng 2.3 lần so với dự đoán; tỷ lệ thất bại chung trong nhiệm vụ mã hóa và phiên bản trả lời tự do GPQA-Diamond còn tăng lên 7.9% và 12.7%. Thay đổi sang 100 câu hỏi GPQA-Diamond, khoảng 13 câu hỏi sẽ khiến tất cả các mô hình ứng cử cùng trả lời sai, không có câu trả lời đúng nào để lựa chọn cho việc bỏ phiếu, đánh giá hoặc tổng hợp. Sự khác biệt của các mô hình trên các câu hỏi dễ sẽ khuếch đại giá trị kết hợp, trong khi trên các câu hỏi khó cần bảo hiểm nhất, chúng có thể cùng thất bại. Đánh giá độ tin cậy: Hệ thống có thể nhận diện và tổng hợp câu trả lời tốt hơn không? Ngay cả khi các câu trả lời ứng cử bổ sung, giá trị vẫn phụ thuộc vào mô hình đánh giá. Khi các ứng cử viên đồng nhất, mô hình đánh giá có thể nhầm lẫn lỗi liên quan thành độ tin cậy cao; khi các ứng cử viên khác biệt, nó lại phải có đủ kiến thức chuyên môn để chọn đúng. Mô hình tổng hợp cũng có thể xóa bỏ ý kiến của số ít quan trọng, hoặc biến sự khác biệt thực sự thành kết luận chắc chắn.
Trong các nhiệm vụ mã, trình biên dịch, kiểm tra và phân tích tĩnh thường đáng tin cậy hơn so với ý kiến của một mô hình khác; trong các nhiệm vụ sáng tạo, mô hình đánh giá và tổng hợp lại dễ dàng biến sự khác biệt thành câu trả lời trung bình. Mô hình đánh giá mạnh nhất trong LitBench chỉ có tỷ lệ đồng nhất với sở thích viết sáng tạo của con người là 73%. Khi nhiệm vụ đã có các xác minh bên ngoài rẻ hơn, hoặc "tốt" phụ thuộc vào đánh giá chủ quan, việc nâng điểm của Fusion rất khó chuyển hóa thành giá trị có thể thanh toán.
Bốn, ai sẽ trả tiền cho Fusion?
Nhu cầu về Fusion phụ thuộc vào hai ngưỡng: liệu nhiệm vụ có thể hưởng lợi từ nhiều mô hình hay không, và liệu lợi ích này có đủ để tạo ra sự thanh toán liên tục hay không. Ngưỡng đầu tiên là vấn đề kỹ thuật, ngưỡng thứ hai mới là vấn đề thị trường. Từ tính ứng dụng kỹ thuật đến tính hợp lý kinh tế Xác suất sửa lỗi thành công × tổn thất có thể tránh được cho mỗi lỗi, phải lớn hơn chi phí API mới, độ trễ, độ phức tạp vận hành và rủi ro quyền riêng tư.
Điểm chuẩn không thể trả lời câu hỏi lợi nhuận này. Fusion chỉ có thể thành công khi chi phí sai sót cao, các mô hình ứng cử cung cấp các đường dẫn tìm kiếm bổ sung, thiếu các xác minh bên ngoài rẻ hơn, và doanh nghiệp có thể chấp nhận độ trễ và rủi ro nhà cung cấp bổ sung; kết quả cuối cùng vẫn cần được xác nhận bởi con người hoặc bằng chứng bên ngoài.
▲ Hình 5: Từ tính ứng dụng kỹ thuật đến nhu cầu bền vững
Các trường hợp chính phù hợp với những điều kiện này là nghiên cứu và thẩm định có giá trị cao, đánh giá kiến trúc và an ninh, cũng như "ý kiến thứ hai" trước các quyết định không thể đảo ngược. Điểm chung của chúng là các ràng buộc không hoàn chỉnh, chi phí bỏ lỡ cao, và một dòng suy nghĩ độc lập có giá trị. Ngược lại, mã thông thường, ứng dụng tiêu dùng thời gian thực, quy trình làm việc có lợi nhuận thấp với lưu lượng cao, và các nhiệm vụ có thể được xác minh trực tiếp bằng kiểm tra hoặc quy tắc, thường không cần Fusion. Các cơ quan quản lý cũng có thể từ chối panel nhiều nhà cung cấp do yêu cầu về ranh giới dữ liệu và kiểm toán.
Từ ý chí trả tiền đến nhu cầu bền vững
Có ích về mặt kỹ thuật có thể mang lại ý chí trả tiền cao, nhưng không đồng nghĩa với nhu cầu có thể mở rộng. Để hình thành nhu cầu bền vững, tổn thất do sai sót phải có thể định lượng, nhiệm vụ phải xảy ra lặp đi lặp lại, trong tổ chức phải có người phụ trách ngân sách rõ ràng, Fusion cũng phải liên tục vượt qua các chuyên gia con người, mô hình đơn mạnh và xác minh bên ngoài. Nhưng ngân sách thẩm định thường chảy về phía các nhà phân tích và nguồn đáng tin cậy, ngân sách an ninh chảy về phía kiểm toán chuyên nghiệp, và các quyết định không thể đảo ngược xảy ra quá ít.
Do đó, chúng tôi không lạc quan về các công ty chỉ làm wrapper nhiều mô hình, chạy panel mặc định, hoặc coi thuật toán lựa chọn mô hình tĩnh như một lợi thế cạnh tranh. Kết nối API dễ sao chép, chiến lược cố định cũng sẽ nhanh chóng mất hiệu lực khi khả năng và giá của mô hình thay đổi; nếu không biết sai sót có giá trị bao nhiêu, Fusion thực sự đã sửa được bao nhiêu lần, thì không thể định giá cho bảo hiểm này. Những bên có khả năng thu thập giá trị thực sự hơn là những bên nắm giữ kết quả thực tế: các cổng và nền tảng agent, ứng dụng theo chiều dọc, chủ sở hữu quy trình làm việc, cũng như các sản phẩm đánh giá và quan sát. Họ biết chi phí sai sót, có thể quan sát kết quả, và cũng có thể tối ưu hóa chiến lược kích hoạt. Điều thực sự khó sao chép không phải là danh sách panel, mà là đánh giá khi nào không gọi Fusion. Xác thực thị trường Thị trường công khai vẫn chưa đủ để đánh giá quy mô nhu cầu về Fusion, nhưng đã có thể thấy cách nó được sử dụng. Perplexity Model Council chỉ mở cho người dùng Max với 200 đô la mỗi tháng và người dùng Enterprise Max, người dùng chọn ba mô hình trên trang web, dùng cho nghiên cứu đầu tư, quyết định phức tạp và xác minh thông tin; các trường hợp người dùng công khai bao gồm việc tích hợp Model Council vào quy trình nghiên cứu chứng khoán thông qua tự động hóa trình duyệt. Hermes Mixture of Agents thì biến Fusion thành mô hình ảo có thể chọn trong agent: người dùng có thể chỉ nâng cấp một vấn đề khó qua /moa, hoặc có thể liên tục kích hoạt trong phiên phức tạp, với nhiều mô hình tham chiếu cung cấp phân tích, sau đó để aggregator gọi công cụ và hoàn thành nhiệm vụ. Hermes sau đó đã giảm tần suất fan-out mặc định, tái sử dụng ý kiến mô hình của vòng trước để kiểm soát chi phí. Những trường hợp này cho thấy, nhu cầu thực sự về Fusion tập trung vào các nhiệm vụ khó khăn ít xảy ra như nghiên cứu, gỡ lỗi, đánh giá và quyết định quan trọng, cách sử dụng điển hình là nâng cấp chủ động khi mô hình đơn gặp bế tắc, thay vì quy trình tự động hóa tần suất cao mặc định. Bằng chứng hiện có chứng minh rằng nhu cầu này tồn tại, nhưng thông tin công khai vẫn chưa đủ để đánh giá liệu nó có thể hình thành một thị trường thanh toán độc lập và quy mô hay không.
Năm, tương lai của Fusion
Giá suy luận giảm có vẻ có lợi cho Fusion, nhưng cũng sẽ đồng thời giảm chi phí của mô hình đơn mạnh, định tuyến và xác minh bên ngoài. Fusion không cạnh tranh với một lần gọi mô hình hôm qua, mà là với thế hệ mô hình đơn tiếp theo đang cải thiện không ngừng và chuẩn mực sắp xếp.
Devin Fusion của Cognition đã thể hiện hướng đi của cuộc cạnh tranh này: giữ mô hình đắt tiền cho giai đoạn phán đoán, giao công việc có thể xác minh và cơ học cho các mô hình rẻ hơn. Trong tự kiểm tra của nhà sản xuất, tổng điểm của Fusion + Fable 5 đã tăng nhẹ từ 57.0 lên 57.6, chi phí trung bình giảm từ 5.12 đô la xuống 3.00 đô la; nhưng trong 5 trường hợp được công bố, chi phí đều giảm từ 25%-62%, trong khi điểm nhiệm vụ dao động từ +12 đến -27. Cấu trúc ES6 rõ ràng, kiểm tra đầy đủ từ 98 điểm lên 100 điểm; chức năng React/Redux phụ thuộc vào hiểu biết tương tác và nhu cầu ngầm bị ủy thác sai, thì từ 54 điểm giảm xuống 27 điểm.
▲ Hình 6: Điểm nhiệm vụ và chi phí của Devin Fusion
Đây là những trường hợp được nhà sản xuất chọn, không đại diện cho phân bố tổng thể, nhưng chỉ ra rõ ràng: khả năng cốt lõi của hệ thống nhiều mô hình trong tương lai không phải là gọi nhiều mô hình hơn, mà là xác định ranh giới giảm cấp đúng. Các nhiệm vụ có thể xác minh và cơ học có thể giao cho các mô hình rẻ hơn, trong khi các nhiệm vụ tập trung vào phán đoán phải để lại cho các mô hình tiên tiến. OpenRouter bán "thông minh hơn", Cognition bán "thông minh tương đương, chi phí thấp hơn"; giả thuyết thứ hai gần hơn với hướng đi lâu dài. Một hệ thống càng gần với kinh tế sản xuất, thì càng không giống Model Fusion theo nghĩa hẹp, mà càng giống với định tuyến, ủy thác và xác minh.
Cuối tháng 7, các phương tiện truyền thông báo cáo rằng Stripe đang thương thảo để mua OpenRouter với khoảng 10 tỷ đô la, giao dịch vẫn chưa được xác nhận. Tín hiệu này không nên được hiểu là Fusion đã nhận được xác thực từ thị trường: giá trị cốt lõi của OpenRouter không phải là một loại panel nào, mà là lớp gọi trung lập kết nối hơn 5 triệu nhà phát triển với hơn 400 mô hình. Stripe đã cung cấp thanh toán, thuế và quản lý rủi ro cho OpenRouter, và cho phép các nhà phát triển tạo tài khoản, lấy API key và kết nối thanh toán trực tiếp qua Stripe Projects. Điều mà Stripe thực sự có thể mua là cổng giao dịch cho suy luận AI: OpenRouter nắm giữ lựa chọn mô hình, mức sử dụng token và chi phí, trong khi Stripe xử lý định giá, hóa đơn và thanh toán. Điều này cung cấp tín hiệu thị trường cho đánh giá giá trị trước đó: giá trị trong thời đại nhiều mô hình có khả năng nằm lại trong lớp điều phối có thể quan sát nhiệm vụ, phân bổ gọi và hoàn thành thanh toán, Fusion chỉ là một chiến lược nâng cấp chi phí cao trên đó.
Các hệ thống nhiều mô hình trong tương lai sẽ không mặc định triệu tập panel, mà sẽ ước lượng độ khó của nhiệm vụ, xác minh chi phí và tổn thất do sai sót; chỉ khi các mô hình đơn mạnh hơn, kéo dài suy luận và công cụ bên ngoài vẫn không đủ, mới vào tìm kiếm sự khác biệt giữa nhiều mô hình. Tỷ lệ kích hoạt, tỷ lệ thành công gia tăng và chi phí kết quả đơn vị đã được xác minh mới là các chỉ số sản phẩm có ý nghĩa. Fusion sẽ tồn tại như một chức năng kích hoạt thấp, chứ không trở thành kiến trúc mặc định hoặc loại độc lập.
Sáu, Nguồn
OpenRouter: Vượt qua hiệu suất biên giới với Fusion
Tài liệu Fusion Router của OpenRouter
Cognition: Devin Fusion --- Hiệu suất biên giới với chi phí thấp hơn 35%
Microsoft Research: Switchcraft --- Bộ định tuyến mô hình AI cho gọi công cụ Agentic
Khi nào việc kết hợp các mô hình ngôn ngữ có ích?
Lập luận đa tác nhân cải thiện hiệu quả tính toán
Mô hình LLM đơn vượt trội hơn hệ thống đa tác nhân trong suy luận đa bước dưới ngân sách token suy nghĩ bằng nhau
Mixture-of-Agents nâng cao khả năng của mô hình ngôn ngữ lớn
RouteLLM: Học cách định tuyến LLM với dữ liệu ưu tiên
LitBench: Một tiêu chuẩn cho đánh giá viết sáng tạo
So sánh mô hình phân tích nhân tạo
Giá của sự tiến bộ: Hiệu suất giá và tương lai của AI
Perplexity: Hội đồng mô hình là gì?
Ví dụ người dùng Perplexity: Hội đồng mô hình cho nghiên cứu tài chính
Hermes Agent: Tài liệu Mixture of Agents
Stripe cung cấp quyền truy cập mô hình AI toàn cầu cho OpenRouter
Axios: Điều gì đứng sau động thái OpenRouter được báo cáo của Stripe













