BTC $79,449.19 -0.63%
ETH $2,492.44 -0.41%
BNB $743.98 -1.81%
XRP $1.40 -1.45%
SOL $104.85 -1.58%
TRX $0.3365 +0.47%
DOGE $0.0895 -0.51%
ADA $0.2198 -0.54%
BCH $256.29 -1.76%
LINK $13.22 +7.76%
HYPE $87.84 -0.62%
AAVE $133.86 -1.11%
SUI $0.8143 +1.86%
XLM $0.1916 +2.57%
ZEC $1,198.94 +2.20%
BTC $79,449.19 -0.63%
ETH $2,492.44 -0.41%
BNB $743.98 -1.81%
XRP $1.40 -1.45%
SOL $104.85 -1.58%
TRX $0.3365 +0.47%
DOGE $0.0895 -0.51%
ADA $0.2198 -0.54%
BCH $256.29 -1.76%
LINK $13.22 +7.76%
HYPE $87.84 -0.62%
AAVE $133.86 -1.11%
SUI $0.8143 +1.86%
XLM $0.1916 +2.57%
ZEC $1,198.94 +2.20%

NeoTrade: Biến phản hồi giao dịch thực tế thành cải tiến tự thân có thể xác minh

Quan điểm cốt lõi
Summary: Khi thị trường thay đổi, AI có thể học cách cải thiện bản thân không?
Tin tức ngành nghề
2026-09-07 18:38:59
Khi thị trường thay đổi, AI có thể học cách cải thiện bản thân không?

Nếu một AI có thể theo dõi thị trường 24/7, phân tích tin tức và tự động đặt lệnh, liệu nó có thể phát hiện rằng: phương pháp mà nó đang thực hiện một cách thành thạo đã bắt đầu không còn hiệu quả?

Một thông tin từng dẫn đầu, giờ đây có thể đã bị giá cả tiêu hóa; một tín hiệu trước đây hiệu quả có thể đã mất đi lợi thế do sự gia tăng số lượng người tham gia. Agent vẫn phân tích đúng giờ và thực hiện nghiêm ngặt, nhưng thị trường đã thay đổi.

Lúc này, kinh nghiệm tích lũy từ việc hoạt động liên tục có thể giúp nó nhận diện vấn đề và điều chỉnh phương pháp? Hơn nữa, liệu nó có thể cải thiện khả năng tìm kiếm vấn đề và xác minh phương pháp của mình, để việc học lần sau trở nên hiệu quả hơn?

Đây chính là những câu hỏi mà NeoTrade đang khám phá.

Thị trường liên tục tạo ra những vấn đề mới, giao dịch thực tế cung cấp phản hồi bên ngoài, và điều mà NeoTrade muốn xây dựng là chuyển đổi những phản hồi này thành cơ chế tự cải tiến có thể xác minh.

Cuộc khám phá này hướng tới tự cải tiến đệ quy (tức là Recursive Self-Improvement, viết tắt là RSI): cho phép Agent trong quá trình hoàn thành nhiệm vụ, dần dần cải thiện cách làm việc của mình và khả năng tạo ra cải tiến lần sau.

Hiểu được hướng đi này có thể bắt đầu từ cách AI hoạt động ngày nay. Nhiều sản phẩm AI có cốt lõi là các mô hình ngôn ngữ lớn, chúng có được khả năng ngôn ngữ, kiến thức và suy luận thông qua đào tạo, và cũng có thể kết hợp đầu vào hiện tại để xử lý các vấn đề mới. Nhưng mô hình có thể tạo ra những câu trả lời có vẻ hợp lý nhưng không chính xác; trong cách sử dụng thông thường, một lần thành công hoặc thất bại cũng sẽ không tự động cập nhật tham số mô hình của nó, trở thành một khả năng mới lâu dài.

Agent thì nằm ngoài mô hình, bổ sung công cụ, bộ nhớ và quy trình hành động, cho phép hệ thống làm việc liên tục quanh mục tiêu. Ví dụ, thu thập thông tin thị trường, hình thành phán đoán, gọi giao diện giao dịch, và sau đó kiểm tra kết quả thực hiện. Hệ thống vận hành bên ngoài tổ chức những khả năng này chính là cái mà bài viết này gọi là harness. Mô hình cung cấp khả năng cơ bản, harness quyết định những khả năng này sẽ được sử dụng cho nhiệm vụ cụ thể như thế nào, và kinh nghiệm sẽ được giữ lại, kiểm tra và sử dụng lại ra sao.

Hướng công nghệ mà NeoTrade đang khám phá là thực hiện tự cải tiến đệ quy ở tầng harness của Agent, đây là một mục tiêu nghiên cứu cần được xác minh dần dần thông qua thử nghiệm.

Giao dịch cung cấp những nhiệm vụ cụ thể cho cuộc khám phá này, đồng thời cũng cung cấp những bài kiểm tra khắt khe.

Hãy tưởng tượng một Agent tham gia dự đoán thị trường dựa trên sự thay đổi của tin tức. Nó từng dựa vào một loại nguồn thông tin để phát hiện cơ hội: tin tức xuất hiện, thị trường chưa phản ứng đầy đủ, Agent hoàn thành phân tích và thực hiện giao dịch.

Sau một thời gian, tình hình đã thay đổi. Nhiều người tham gia bắt đầu chú ý đến cùng một nguồn thông tin, giá phản ứng nhanh hơn, cửa sổ giao dịch trước đây đã bị thu hẹp. Agent vẫn kịp thời thu thập tin tức, hoàn thành phân tích, phát lệnh, nhưng phương pháp hiệu quả trước đây đã mất đi một phần giá trị.

Vấn đề có thể nằm ở thời gian thông tin đến, các bước cần thiết để phán đoán, hoặc có thể nằm ở chi phí giao dịch. Chỉ đơn giản tăng tần suất thực hiện không thể xác định giải quyết bất kỳ vấn đề nào trong số đó.

Agent cần xem xét lại cách làm việc của mình: thông tin có còn kịp thời không? Các báo cáo khác nhau có chỉ là diễn đạt lại từ cùng một nguồn không? Giá đã phản ánh những thông tin này chưa? Lợi thế dự kiến từ phân tích có thể bao phủ chi phí giao dịch, trượt giá và chi phí suy luận không?

Những câu hỏi này giải thích tại sao NeoTrade quan tâm đến tự cải tiến.

Người tham gia trong thị trường sẽ học hỏi, chiến lược sẽ được sao chép, tính thanh khoản sẽ di chuyển, và cơ hội cũng sẽ thay đổi theo cạnh tranh. Giả thuyết thị trường thích ứng của Andrew Lo đã coi cạnh tranh, thích ứng và sự thay đổi của người tham gia là những yếu tố quan trọng để hiểu hiệu quả của thị trường. Nó cung cấp một góc nhìn hữu ích: hiệu quả của chiến lược phụ thuộc vào môi trường, và hiệu suất lịch sử cần được hiểu trong điều kiện mà nó xảy ra. Giả thuyết thị trường thích ứng

Vì vậy, một Agent giao dịch hoạt động lâu dài, vừa phải thực hiện những phương pháp đã được xác minh, vừa phải nhận diện khi nào những phương pháp này bắt đầu không còn hiệu quả, và điều chỉnh nguồn thông tin, phán đoán và cách thực hiện của mình.

"Chaos là bậc thang" có thể được coi là một phép ẩn dụ để hiểu quá trình này: tiếng ồn thông tin trong thị trường, trò chơi động và sự thay đổi môi trường sẽ phơi bày giới hạn khả năng của hệ thống. Thông tin không còn hiệu lực có thể thúc đẩy việc xác minh nguồn gốc, sai lệch trong phán đoán có thể thúc đẩy việc điều chỉnh xác suất, và tổn thất trong thực hiện có thể thúc đẩy việc tối ưu hóa quy trình.

Nhưng sự chuyển đổi này có một điều kiện tiên quyết: Agent có thể phân biệt tín hiệu và tiếng ồn, và xác minh xem sự thay đổi có hiệu quả hay không. Tính ngẫu nhiên sẽ không tự động tạo ra kiến thức, và biến động cũng không có nghĩa là lợi nhuận; chỉ có kinh nghiệm đã được kiểm chứng mới có thể trở thành nền tảng cho những cải tiến tiếp theo.

Khả năng thích ứng này chính là điểm khởi đầu cho việc NeoTrade khám phá RSI.

Cần làm rõ ý nghĩa của "đệ quy". Việc điều chỉnh tham số theo lãi lỗ gần đây, hoặc thêm một kinh nghiệm vào bộ nhớ, có thể là những học tập hữu ích, nhưng chưa đủ để chứng minh RSI.

Tự cải tiến đệ quy yêu cầu hệ thống cải thiện thêm cách tìm kiếm cải tiến của mình. Ví dụ, Agent phát hiện rằng việc xem lại của mình luôn nhầm lẫn xu hướng tăng với việc chiến lược hiệu quả, do đó cải thiện phương pháp đối chiếu; lại phát hiện rằng mình luôn lặp lại việc thử nghiệm những phương án đã thất bại, do đó cải thiện bộ nhớ thử nghiệm và quy trình lọc phương án. Phương pháp nghiên cứu mới sau đó tham gia vào vòng cải tiến tiếp theo, giúp hệ thống có cơ hội tìm ra những thay đổi hiệu quả hơn.

Agent cải tiến không chỉ là hiệu suất nhiệm vụ, mà còn bao gồm khả năng tạo ra cải tiến lần sau.

Điều này có ý nghĩa đối với AI, vượt ra ngoài giao dịch bản thân.

Agent được triển khai trong môi trường thực sẽ gặp phải những nhiệm vụ mà dữ liệu đào tạo không đủ bao phủ, công cụ liên tục thay đổi, và thói quen làm việc khác nhau của người dùng. Nếu mỗi lần môi trường thay đổi đều cần nhà phát triển phát hiện vấn đề từng mục, thiết kế lại quy trình, tốc độ thích ứng của hệ thống sẽ bị giới hạn bởi khả năng bảo trì thủ công.

Khái niệm RSI cung cấp một hướng đi đáng khám phá: cho phép hệ thống tham gia quan sát sự thất bại của chính nó, đưa ra giả thuyết, thiết kế thử nghiệm và giữ lại những cải tiến hiệu quả. Kinh nghiệm đã được xác minh có thể tham gia vào vòng làm việc tiếp theo, dần dần giảm thiểu chi phí lặp lại sai lầm và nghiên cứu.

Còn về mối quan hệ giữa khả năng này và trí thông minh tổng quát hơn, NeoTrade coi đây là một vấn đề mở đáng khám phá, liệu có thể phát hiện ra những thiếu sót của bản thân trong môi trường mới và cải thiện chính phương pháp học tập hay không, được một số nghiên cứu coi là một trong những tiêu chí để đo lường xem có đạt được AGI hay không (Levels of AGI).

Cuộc khám phá này đã có một số nền tảng nghiên cứu. Xung quanh việc tự cải tiến ở tầng harness, các ý tưởng hiện có có thể được phân loại thành ba loại chính:

Cải thiện hành vi thông qua phản ánh và bộ nhớ. Agent tổ chức phản hồi nhiệm vụ thành kinh nghiệm, và sử dụng lại trong các nhiệm vụ tiếp theo. Reflexion cho thấy không cần cập nhật trọng số mô hình, mà vẫn có thể cải thiện quyết định thông qua phản hồi ngôn ngữ và bộ nhớ. Đây là nền tảng quan trọng cho việc học liên tục, nhưng chỉ đơn giản tích lũy kinh nghiệm vẫn chưa đủ để gọi là cải tiến đệ quy. Reflexion

Tối ưu hóa tự động quy trình làm việc và tổ chức ngữ cảnh. Hệ thống cố gắng điều chỉnh phân tách nhiệm vụ, gọi công cụ và truyền thông tin giữa các Agent. ADAS khám phá việc thiết kế tự động cấu trúc Agent; Tự Cải Tiến Đệ Quy Harness (viết tắt là RHI) thì dựa trên phản hồi so sánh từ các phiên bản lịch sử, lặp lại mô tả cách thức hoạt động của Agent trong harness, và được đánh giá trong các nhiệm vụ nghiên cứu tổng hợp bao gồm tài chính định lượng. ADAS, RHI

Sửa đổi mã nguồn của chính mình và tìm kiếm phiên bản tốt hơn. SICA và Darwin Gödel Machine cho phép Agent sửa đổi công cụ hoặc mã chạy của chính mình, và sau đó kiểm tra các phiên bản ứng viên bằng hiệu suất nhiệm vụ. DGM còn giữ lại nhiều phiên bản và nhánh tiến hóa, cho phép các cải tiến tiếp theo có thể tiếp tục khám phá từ các con đường khác nhau. SICA, DGM

Những lộ trình này cho thấy, ngay cả khi mô hình nền tảng không thay đổi, hệ thống vẫn có thể nâng cao hiệu suất bằng cách thay đổi cách làm việc.

NeoTrade hy vọng trên nền tảng nghiên cứu này, sẽ thiết lập một cơ chế cải tiến liên tục hướng tới giao dịch thực. Việc nâng cao hiệu suất trong các nhiệm vụ nghiên cứu cần được chuyển đổi thành khả năng giao dịch lâu dài, còn cần phải đối mặt với thị trường liên tục thay đổi, chi phí thực hiện thực tế và ranh giới ủy quyền của người dùng.

NeoTrade chọn thị trường làm môi trường khám phá, điều mà họ coi trọng là thị trường có thể cung cấp những ràng buộc bên ngoài cho những cải tiến này.

Trong giao dịch, phán đoán sẽ đi vào chuỗi hành động thực tế. Dự đoán của Agent về sự kiện cuối cùng có thể đối chiếu với kết quả; lệnh có được thực hiện hay không, giá thực hiện như thế nào, đã chờ đợi bao lâu, đều có ghi chép; hiệu suất của chiến lược trong các môi trường khác nhau cũng có thể được quan sát liên tục.

Những hậu quả này sẽ không thay đổi chỉ vì Agent đã viết một bản xem lại thuyết phục hơn.

Điều này khiến giao dịch trở thành một bài kiểm tra có tính ràng buộc. Hệ thống cần xử lý đồng thời thông tin, xác suất, thời gian, chi phí và nguồn lực hạn chế. Một phân tích logic hoàn chỉnh, nếu luôn hoàn thành sau khi cơ hội đã biến mất, thì giá trị thực tế của nó vẫn còn hạn chế; một phán đoán đúng hướng, nếu chi phí thực hiện nuốt chửng lợi thế, cũng cần được xem xét lại.

Giao dịch thực tế do đó có thể phơi bày những vấn đề mà chỉ dựa vào đánh giá văn bản không dễ phát hiện: giá trị thực sự đã mất ở bước nào giữa phán đoán và hành động?

Tuy nhiên, phản hồi bên ngoài không đồng nghĩa với câu trả lời rõ ràng.

Agent dự đoán một sự kiện có 70% xác suất xảy ra, nhưng sự kiện cuối cùng không xảy ra, không thể chỉ dựa vào kết quả lần này để xác định dự đoán sai. Tương tự, một giao dịch có lãi cũng có thể đến từ may mắn, thị trường hoặc rủi ro bổ sung. Dữ liệu giao dịch có tỷ lệ tín hiệu-thông tin thấp, và nghiên cứu lịch sử cũng dễ bị ảnh hưởng bởi thiên lệch người sống sót và quá khớp; đây cũng là những khó khăn mà nghiên cứu học tập tăng cường tài chính đã chỉ ra rõ ràng. FinRL-Meta

May mắn thay, giao dịch dự đoán thị trường, chính xác cung cấp một kênh chứng cứ nhanh hơn so với lãi lỗ. Mỗi quyết định của Agent đều được đưa ra dưới dạng xác suất rõ ràng, điều này cho phép "chất lượng dự đoán" có thể được đo lường bằng các quy tắc đánh giá nghiêm ngặt (proper scoring rules, như điểm Brier) và đường cong điều chỉnh: một lần "70% không xảy ra" không thể xác định đúng sai, nhưng nếu trong một trăm lần dự đoán được đánh dấu là 70% chỉ có bốn mươi phần trăm xảy ra, thì độ lệch đã có chứng cứ thống kê rõ ràng. Từ vài chục đến hàng trăm lần dự đoán xác suất có thể tạo ra đánh giá điều chỉnh có ý nghĩa, trong khi việc chờ đợi đường cong lãi lỗ đạt được ý nghĩa thống kê thường cần một mẫu lớn hơn nhiều. Proper Scoring Rules

NeoTrade không cam kết lợi nhuận, cũng không đảm bảo bất kỳ chiến lược hoặc Agent nào có thể duy trì lợi nhuận. Một cơ chế học tập hoàn thiện hơn, những phán đoán chính xác hơn và việc thực hiện nghiêm ngặt hơn, vẫn có thể đi kèm với thua lỗ trong giao dịch. Mục tiêu nghiên cứu của RSI là để cải tiến có thể được xác minh, và "cải tiến được xác minh" cũng chỉ có nghĩa là nó đã có chứng cứ trong các điều kiện và phạm vi đánh giá cụ thể, không đại diện cho lợi nhuận trong tương lai được đảm bảo.

Vì vậy, vấn đề then chốt mà NeoTrade cần giải quyết là làm thế nào để tổ chức kết quả thành chứng cứ hỗ trợ cho việc cải tiến phán đoán.

Điều này yêu cầu hệ thống giữ lại thông tin và dấu thời gian khi quyết định, cấu hình đã sử dụng và phiên bản skill (gói khả năng chiến lược), tóm tắt quyết định, lệnh và ghi chép thực hiện, và liên kết chúng với kết quả tiếp theo. Chỉ như vậy, việc xem lại mới có cơ hội phân biệt: vấn đề đến từ chất lượng thông tin, phán đoán xác suất, quy trình thực hiện, hay điều kiện áp dụng của phương pháp trước đây đã thay đổi.

Thứ tự đánh giá cũng được xác định theo đó: chứng cứ về điều chỉnh và chất lượng phán đoán đến nhanh nhất, thực hiện và chi phí đứng thứ hai; PnL (lãi lỗ) là kết quả cuối cùng quan trọng, nhưng nó chậm nhất, tiếng ồn lớn nhất, không thể tự mình giải thích toàn bộ quá trình.

NeoTrade đang cố gắng xây dựng bộ khả năng này trên tầng harness. Cụ thể, harness chịu trách nhiệm tổ chức bộ nhớ, ngữ cảnh, công cụ, cấu hình, thực hiện và đánh giá. Ngay cả khi sử dụng cùng một mô hình nền tảng, các quy trình làm việc khác nhau cũng có thể mang lại hiệu suất rõ rệt khác nhau.

Cuộc khám phá của NeoTrade chủ yếu bắt đầu từ một số thành phần có thể lặp lại:

Bộ nhớ: Tổ chức chứng cứ quyết định, kết quả và điều kiện thất bại thành kinh nghiệm có thể truy xuất, và giữ lại nguồn gốc, thời gian và phạm vi áp dụng. Agent cần học cách khi nào gọi kinh nghiệm, cũng cần nhận diện khi nào kinh nghiệm cũ đã không còn áp dụng.

Cấu hình đại lý (Cấu hình hoạt động): Điều chỉnh lựa chọn nguồn thông tin, tổ chức ngữ cảnh, bước phân tích và cách gọi công cụ trong phạm vi ủy quyền. Ví dụ, giảm thiểu việc xử lý lặp lại thông tin có giá trị thấp, dành nhiều nguồn lực nghiên cứu hơn cho các bằng chứng thực sự ảnh hưởng đến phán đoán.

Kỹ năng: Thực hiện phiên bản hóa và lặp lại các phương pháp chiến lược cùng điều kiện áp dụng của chúng. Một kỹ năng có thể dần dần bổ sung xác minh thông tin, nhận diện cơ hội, kiểm tra thực hiện và phán đoán thất bại, và quyết định có giữ phiên bản mới hay không thông qua so sánh.

Các thành phần này cung cấp lối vào được cải thiện. Để tiến gần hơn đến RSI, hệ thống cũng cần cải thiện cách sử dụng những lối vào này: cách xác định vấn đề, cách đề xuất thay đổi ứng cử viên, cách chọn thí nghiệm, và cách đánh giá liệu bằng chứng có đủ hay không.

NeoTrade đang khám phá các hướng đi bao gồm:

Phân tích lỗi: Đưa ra các giả thuyết nguyên nhân có thể kiểm chứng từ hồ sơ quyết định và thực hiện, xác định vấn đề có thể nằm ở thông tin, phán đoán hay thực hiện, và liên tục cải thiện phương pháp phân tích lỗi.

Tạo công cụ và sửa đổi mã: Đối với các khoảng trống năng lực xuất hiện lặp đi lặp lại, tạo ra hoặc sửa đổi công cụ xử lý dữ liệu, xác minh và tính toán, và đưa vào quy trình làm việc sau khi được kiểm tra xác nhận.

Lập lịch nguồn lực nghiên cứu: Trong ngân sách đã định, học cách phân tích sâu hơn, gọi thêm công cụ hoặc kết thúc nghiên cứu, và phân bổ nguồn lực đánh giá cho các cải tiến ứng cử viên đáng kiểm chứng hơn.

Vẫn lấy giao dịch tin tức làm ví dụ. Đại lý có thể phát hiện rằng nhiều báo cáo có vẻ độc lập thực tế đến từ cùng một nguồn gốc ban đầu, trong khi trước đó nó đã coi chúng là bằng chứng hỗ trợ lẫn nhau. Nó có thể đề xuất một sửa đổi harness: thêm theo dõi nguồn gốc và loại bỏ trùng lặp trước khi phân tích.

Tiếp theo, hệ thống cần xác minh thay đổi này. Nó có giảm thiểu việc đếm lặp lại không? Nó có cải thiện phán đoán xác suất không? Thời gian kiểm tra tăng thêm có bỏ lỡ cửa sổ thực hiện không? Hiệu quả có chỉ tồn tại trong các mẫu lịch sử được sử dụng để phát hiện vấn đề không?

Các kiểm tra này không nhất thiết phải bắt đầu từ tiền thật: Điểm dừng đầu tiên của NeoTrade là hoạt động bóng mờ mô phỏng môi trường thị trường------tiêu thụ cùng một dữ liệu thị trường thời gian thực như phiên bản hiện tại, đưa ra quyết định song song mà không sử dụng vốn, chỉ sau khi được chấp nhận độc lập, mới vào giao dịch thực.

Nếu cải tiến hiệu quả, thì đại lý này mới đáng được giữ lại. Hơn nữa, thí nghiệm còn có thể giúp đại lý cải thiện phương pháp hồi tưởng của chính nó: sau này khi gặp phán đoán "hỗ trợ từ nhiều nguồn", chủ động kiểm tra xem các nguồn này có độc lập hay không. Một sửa chữa cục bộ như vậy có thể hình thành năng lực nghiên cứu có thể tái sử dụng.

"Có thể kiểm chứng" là cốt lõi của cơ chế này.

NeoTrade hy vọng mỗi lần cải tiến ứng cử viên đều có vấn đề rõ ràng, thay đổi có thể truy nguyên và kết quả có thể so sánh. Trong nghiên cứu cần giữ phiên bản cũ làm đối chứng, kiểm tra thay đổi trong dữ liệu và môi trường thị trường không tham gia điều chỉnh, đồng thời quan sát chất lượng dự đoán (đo lường bằng điểm Brier, đường cong hiệu chỉnh và các quy tắc đánh giá thích hợp khác), độ tin cậy thực hiện, chi phí và rủi ro.

Tất cả các nỗ lực, bao gồm cả các phiên bản thất bại, cũng nên được đưa vào hồ sơ thí nghiệm. Nếu không, hệ thống chỉ hiển thị kết quả thành công đã được lọc, dễ dàng khiến những thành tích ngẫu nhiên bị hiểu nhầm là tiến bộ.

Nghiên cứu quá khớp hồi quy cho thấy, việc thử nghiệm nhiều phương án trên cùng một tập dữ liệu sẽ làm tăng đáng kể khả năng phát hiện lợi thế giả. Nghiên cứu quá khớp hồi quy

Vòng lặp cải tiến bản thân là một cỗ máy tạo ra các phương án ứng cử viên. Mẫu giao dịch thực tế tần suất thấp tự nhiên rất hiếm------một đại lý có chọn lọc cao có thể chỉ giao dịch vài lần mỗi tuần------trong khi việc tạo ra các phiên bản harness ứng cử viên gần như không tốn chi phí. Việc chọn ra người chiến thắng từ một lượng lớn ứng cử viên trên mẫu nhỏ chính là sự tái hiện trực tiếp của cơ chế lợi thế giả đã nêu.

Do đó, quy trình xác minh cần được tích hợp một số ràng buộc cho chính nó: đăng ký trước thí nghiệm, giả thuyết, chỉ số chấp nhận và cửa sổ mẫu được cố định trước khi thí nghiệm bắt đầu, không được thay đổi phương pháp ghi điểm sau đó; giới hạn số lượng ứng cử viên được kiểm tra đồng thời, và điều chỉnh cho so sánh đa biến; sử dụng các chỉ số hiệu chỉnh có sức mạnh thống kê cao hơn để đảm nhận việc lọc hàng ngày, để lợi nhuận và thua lỗ đảm nhận việc chấp nhận cuối cùng thay vì mỗi vòng đánh giá; đánh giá nguồn lực tập trung vào một số ứng cử viên có giá trị cao, thay vì phân tán rộng rãi.

Trong khi đó, các phương pháp nghiên cứu và thực hiện có thể sửa đổi cần được phân biệt với ranh giới ủy quyền của người dùng. Đại lý có thể đề xuất cách làm việc tốt hơn, nhưng quyền hạn về vốn, phạm vi giao dịch, giới hạn rủi ro, và các ràng buộc chấp nhận độc lập để xác định liệu phiên bản ứng cử viên có được thông qua hay không, không thể được nó nới lỏng để đạt điểm cao hơn.

Ngoài ranh giới ủy quyền, việc tự cải tiến còn phải đối mặt với một đối thủ ẩn giấu hơn: các cuộc tấn công nhằm vào chính vòng lặp học tập. Một hệ thống có thể ghi lại kinh nghiệm vào bộ nhớ, có thể sửa đổi kỹ năng và công cụ của chính nó, tương đương với việc kéo dài ảnh hưởng của tiêm thông tin (prompt injection) từ một cuộc hội thoại đến mỗi vòng cải tiến trong tương lai------một "kinh nghiệm" bị ô nhiễm sẽ tham gia vào các quyết định tiếp theo dưới dạng kiến thức bình thường. Đây không phải là rủi ro giả định: các nhà nghiên cứu đã chỉ ra rằng việc tiêm thông tin vào bộ nhớ của khung giao dịch mã nguồn mở có thể dẫn đến chuyển khoản thực sự trên chuỗi, và nội dung tiêm có thể tồn tại qua các phiên; cũng đã xảy ra sự kiện thực tế khi một đại lý giao dịch tự động bị tiêm lệnh, gây ra thiệt hại lên tới sáu con số đô la. Real AI Agents with Fake Memories, sự kiện AIXBT

Do đó, vòng lặp học tập cần có phòng tuyến riêng của nó, không thể chỉ dựa vào kiểm soát rủi ro trong giao dịch: nội dung bên ngoài luôn được coi là dữ liệu cần phân tích, chứ không phải là lệnh cần thực hiện vào hệ thống; kinh nghiệm trước khi ghi vào bộ nhớ phải trải qua đánh dấu nguồn gốc, lọc và kiểm toán------việc ghi vào bộ nhớ được coi như một cuộc tấn công; việc đề xuất và chấp nhận các ứng cử viên cải tiến phải được tách biệt, tránh việc cùng một đoạn ngữ cảnh có thể bị ô nhiễm vừa đề xuất sửa đổi, vừa phê duyệt sửa đổi; hồ sơ thí nghiệm và kinh nghiệm giữ nguyên chỉ tăng mà không thay đổi, để bất kỳ hành vi bất thường nào cũng có thể truy ngược về nguồn ô nhiễm. Việc thúc giục hành động ngay lập tức, yêu cầu nới lỏng kiểm soát rủi ro, và nội dung "kinh nghiệm" tự xưng là thông báo của hệ thống, thuộc về cờ đỏ ưu tiên cao nhất.

Điều này khiến việc tự cải tiến trở thành một quy trình kỹ thuật có ranh giới, có hồ sơ, chống ô nhiễm, có thể từ chối hoặc quay lại.

NeoTrade hy vọng thúc đẩy đổi mới, tập trung vào việc kết nối học tập, xác minh và hoạt động thực tế.

Điểm độc đáo của hướng đi này thể hiện qua một số vấn đề liên quan lẫn nhau:

Hiệu quả trong sự thay đổi liên tục: Không chỉ kiểm tra một phiên bản có tốt hơn phiên bản cũ hay không, mà còn phải xác định khi nào lợi thế này bắt đầu mất hiệu lực, và liệu hệ thống có thể thích ứng lại hay không. Các điều kiện áp dụng và bằng chứng mất hiệu lực cần được lưu giữ cùng với cải tiến.

Cải tiến bao gồm chi phí thực tế: Đưa dự đoán, giao dịch, độ trễ, phí giao dịch, trượt giá và chi phí suy luận vào cùng một bộ đánh giá. Việc tăng cường các bước phân tích có thể nâng cao độ chính xác, nhưng cũng có thể khiến giao dịch bỏ lỡ cơ hội; cải tiến cần chấp nhận sự kiểm tra của toàn bộ chuỗi thực hiện.

Tự sửa đổi có ranh giới ủy quyền: Kết hợp các phương pháp nghiên cứu và thực hiện có thể phát triển với kiểm soát rủi ro độc lập, cơ chế chấp nhận và bảo vệ tiêm vào vòng lặp học tập, cho phép đại lý thử nghiệm các phương pháp mới, đồng thời giữ quyền hạn có thể kiểm toán, thay đổi có thể thu hồi, và kinh nghiệm có thể truy nguyên.

Thích ứng lâu dài hướng tới người dùng cụ thể: Dưới thiết kế chạy tại chỗ và người dùng kiểm soát dữ liệu, khám phá các harness phù hợp với các phạm vi thị trường khác nhau, ngân sách nghiên cứu và yêu cầu rủi ro. Cách thức chuyển giao kinh nghiệm chung, khi nào kinh nghiệm cá nhân có hiệu quả, đều cần được kiểm chứng.

Những sự kết hợp này mang đến những vấn đề mới đáng nghiên cứu, đồng thời tạo thành đóng góp kỹ thuật và sản phẩm mà NeoTrade hy vọng hình thành. Giá trị của chúng cần được thiết lập thông qua hoạt động thực tế và thí nghiệm đối chứng.

Khi cuộc khám phá này tiến triển, NeoTrade cần trả lời một câu hỏi cụ thể: Trong cùng một mô hình, ngân sách nguồn lực và ràng buộc rủi ro, một đại lý có thể cải tiến chính harness của nó, có thể thích ứng đáng tin cậy hơn với môi trường thị trường mới không?

Bằng chứng hồi quy có trọng số hơn cần được đo lường cẩn thận. "Tìm thấy chi phí cải tiến hiệu quả giảm theo thời gian" nghe có vẻ là tiêu chuẩn tự nhiên, nhưng nó mang theo hai sự nhầm lẫn: các cải tiến sớm thường là trái cây dễ hái, càng về sau tự nhiên càng đắt, và việc tăng chi phí không thể bác bỏ hồi quy; ngược lại, việc giảm chi phí cũng có thể chỉ là thị trường vừa đúng vào giai đoạn dễ dàng hơn.

Thị trường sẽ tiếp tục thay đổi. Đối thủ sẽ học hỏi, cơ hội cũ sẽ biến mất, và vấn đề mới sẽ luôn xuất hiện.

Khả năng mà NeoTrade hy vọng xây dựng là cho phép đại lý tích lũy kinh nghiệm có thể kiểm chứng trong những thay đổi này, điều chỉnh phương pháp của chính nó, và cho phép các cải tiến đã được xác minh tham gia vào vòng học tập tiếp theo.

Join ChainCatcher Official
Telegram Feed: @chaincatcher
X (Twitter): @ChainCatcher_
warnning Cảnh báo rủi ro
app_icon
ChainCatcher Building the Web3 world with innovations.