Ngày nay khi nhắc đến AI, mọi người đã rất quen thuộc với thượng nguồn và hạ nguồn của ngành. Khi đầu cơ lĩnh vực lưu trữ thì biết nhìn vào module quang, vật liệu, thiết bị; khi đầu cơ sức tính toán thì biết nhìn vào Nvidia, điện năng, tản nhiệt.
Nhưng khi nói đến robot, phần lớn nhận thức của mọi người vẫn dừng lại ở mấy con robot hình người có thể đi vài bước trên sân khấu Gala mùa xuân, thấy ngầu, nhưng ngoài ra thượng nguồn và hạ nguồn của robot có những gì, "lá tía tô" của ngành robot là gì, đa số đều không nói rõ được.
Thực ra ngành công nghiệp robot cũng có chuỗi cung ứng riêng, cũng đang phân hóa ra ngày càng nhiều đường đua phân khúc. Phần cứng có người làm, mô hình có người làm, nhưng còn một mắt xích hiếm khi được người bình thường chú ý, lại có thể ảnh hưởng đến giới hạn năng lực của robot: dữ liệu. Chính xác hơn, là dữ liệu sản xuất "kinh nghiệm thao tác" cho robot.
Sự trỗi dậy của các mô hình lớn có một tiền đề rất đơn giản: trên internet đã tích lũy một lượng khổng lồ văn bản, hình ảnh, mã code và video. Các công ty mô hình ban đầu phải giải quyết vấn đề làm sao hấp thụ những dữ liệu này, làm sao mở rộng sức tính toán, làm sao huấn luyện mô hình lớn hơn.
Robot thì khác.
Robot không có kho ngữ liệu internet tự nhiên. Đối với các quỹ đạo có thể dùng trực tiếp cho việc học điều khiển robot, thường bao gồm quan sát, hành động và trạng thái robot; tùy theo nhiệm vụ khác nhau, còn có thể bao gồm trạng thái vật thể, thông tin tiếp xúc, điều kiện thành công, ngữ nghĩa nhiệm vụ và tần suất điều khiển. Thu thập thực tế thì chậm, đắt, nguy hiểm, và phụ thuộc rất nhiều vào từng loại robot cụ thể.
Và đây chính là bối cảnh ra đời của Axis Robotics. Ngày 27 tháng 7, công ty công cụ dữ liệu Physical AI này đã công bố hoàn thành vòng gọi vốn hạt giống 12 triệu USD, do Hack VC dẫn đầu, với sự tham gia của Nomad Capital, Pi Network Ventures, 10K Ventures và nhiều nhà đầu tư thiên thần. Số tiền này không đặt cược vào một đội ngũ chế tạo robot nữa, mà là một đội ngũ chuyên "nuôi dưỡng kinh nghiệm" cho robot.
Trong bối cảnh đó, BlockBeats đã phỏng vấn Chris, người sáng lập Axis Robotics, người có nhiều kinh nghiệm trong lĩnh vực đầu tư và tư vấn.
BlockBeats hỏi: Trước khi làm Axis, kinh nghiệm khởi nghiệp và sự nghiệp chính của anh là gì? Anh đã tiếp cận với robot, Physical AI và hướng dữ liệu robot như thế nào? Có cơ hội cụ thể nào khiến anh nhận ra đây là một cơ hội để khởi nghiệp không?
Chris:Trước khi làm Axis, trải nghiệm khởi nghiệp trước đó của tôi đã mang lại cho tôi một cảm nhận rất lớn: dữ liệu không hề hấp dẫn, nhưng nó thường là biến số quyết định trần nhà, có thể quyết định một công ty cuối cùng có thể đi được bao xa.
Đầu năm 2024 là một thời điểm khá quan trọng đối với tôi. Lúc đó trí tuệ nhân tạo rất nóng, mọi người đều nói về mô hình, tham số và sức mạnh tính toán, nhưng tôi ngày càng cảm thấy rằng ngành đang chuyển từ "mô hình dẫn dắt" sang "dữ liệu dẫn dắt". Mô hình tất nhiên quan trọng, nhưng thứ quyết định mô hình có thể tiếp tục tiến lên hay không, thường vẫn là dữ liệu.
Điều thực sự kích thích tôi là công ty Surge AI. Thành lập năm 2020, chỉ sau bốn năm doanh thu đã vượt qua 1 tỷ USD, còn mạnh hơn cả Scale AI, và gần như không huy động vốn nhiều. Lúc đó tôi luôn suy nghĩ: tại sao một công ty làm dữ liệu lại có thể chạy nhanh như vậy? Chúng ta có đang đánh giá thấp giá trị của dữ liệu trong kỷ nguyên thông minh không?
Trong khoảng thời gian đó, tôi cũng thường xuyên trò chuyện với bạn bè ở NTU, Berkeley, NVIDIA, nghe họ kể về những thay đổi đang diễn ra ở giới học thuật và tuyến đầu ngành công nghiệp. Mọi người dần hình thành một nhận thức rất rõ ràng: mô hình lặp lại rất nhanh, nhưng dữ liệu là nền móng, và là tầng khó làm nhất, không chuẩn hóa nhất, và dễ bị bỏ qua nhất. Từ tiền huấn luyện đến hậu huấn luyện của mô hình ngôn ngữ lớn, rồi đến nhu cầu về dữ liệu chất lượng cao sau khi Agent xuất hiện, dữ liệu không trở nên kém quan trọng hơn, mà ngược lại, ngày càng phức tạp hơn.
Vì vậy tôi bắt đầu nghĩ, liệu Physical AI có đi theo cùng một con đường không? Thế giới vật lý phức tạp hơn nhiều so với thế giới văn bản. Sự thay đổi của môi trường thực tế, nhiễu cảm biến, các thao tác đuôi dài khác nhau, thói quen sử dụng của những người khác nhau, tất cả đều sẽ nhân lên gấp bội nhu cầu dữ liệu. Lượng dữ liệu mà Physical AI cần, cũng như các kịch bản sửa lỗi trong hậu huấn luyện, có thể gấp trăm lần, thậm chí nhiều hơn so với trí tuệ nhân tạo ngày nay.
Nhưng lúc đó nếu bạn đi hỏi "ai đang làm dữ liệu Physical AI", gần như không có cái tên nào có thể được nói ra ngay lập tức. Một lĩnh vực có thể tạo ra công ty trị giá hàng trăm tỷ USD trong tương lai, vẫn chưa có người chiếm lĩnh tâm trí thực sự. Đối với nhà khởi nghiệp, tín hiệu này đã rất rõ ràng: đáng để nhà khởi nghiệp dốc toàn lực đầu tư.
Vì vậy từ mùa hè năm 2025, tôi cùng bạn bè ở NTU, UCB bắt đầu thảo luận một cách có hệ thống về lộ trình kỹ thuật và hình thái sản phẩm, Axis Robotics cũng thực sự khởi động trong giai đoạn đó.
BlockBeats hỏi: Khi giới bên ngoài nói về ngành robot, họ thường chú ý đến phần cứng và mô hình trước. Nhưng tại sao đội ngũ Axis lại cho rằng, dữ liệu mới là "lá tía tô" có khả năng hạn chế việc triển khai quy mô lớn nhất trong vòng Physical AI này?
Chris:Đây là một câu hỏi rất hay. Sự phát triển của các mô hình lớn cho chúng ta một gợi ý rất trực tiếp: sau khi một hướng công nghệ được kiểm chứng, khả năng ở giai đoạn tiếp theo thường đến từ việc mở rộng đồng thời dữ liệu, sức mạnh tính toán và quy mô mô hình. Từ GPT-1 đến GPT-3, chúng ta thấy rằng tiền huấn luyện quy mô lớn có thể mang lại bước nhảy vọt rõ rệt về năng lực.
Nhưng ngành robot hiện vẫn đang ở giai đoạn sớm hơn nhiều. Phần cứng và thuật toán ngày nay thực ra đã tiến triển không chậm, đủ loại cánh tay robot và robot hình người liên tục xuất hiện. Hướng mô hình cũng đang dần hội tụ, ví dụ VLA kết nối thị giác, ngôn ngữ và hành động robot; mô hình thế giới học cách môi trường có thể thay đổi sau khi một hành động xảy ra; WAM thì kết hợp dự đoán trạng thái tương lai với việc tạo ra hành động. Tất cả các hướng này đều có người đang theo đuổi.
Vấn đề nằm ở chỗ, muốn một robot không chỉ trình diễn trong phòng thí nghiệm mà thực sự làm việc được trong môi trường thực tế, tức là đạt đến bước nhảy vọt gần giống "khoảnh khắc GPT-1" của các mô hình ngôn ngữ năm xưa, thì cần một lượng dữ liệu tương tác thế giới thực lớn hơn nhiều lần.
Lấy ví dụ, robot ngày nay hơi giống một người chỉ học bơi qua sách vở, lý thuyết thì hiểu hết nhưng chưa từng xuống nước. Muốn nó thực sự biết bơi, phải cho nó luyện tập lặp đi lặp lại ở nhiều hồ bơi khác nhau, nhiệt độ nước khác nhau, sóng khác nhau. Những "kinh nghiệm xuống nước" này chính là dữ liệu.
Nhưng hiện tại quy mô dữ liệu công khai vẫn còn rất nhỏ.

Open X-Embodiment được coi là một trong những bộ dữ liệu mở tiêu biểu, tích hợp 21 tổ chức, 22 loại robot, hơn 1 triệu quỹ đạo, nghe thì nhiều nhưng so với lượng dữ liệu cấp độ internet thì chưa bằng một phần nhỏ. Nhiều bộ dữ liệu công khai khác vẫn dừng ở mức vài trăm giờ.

Vì vậy chúng tôi đánh giá rằng, thứ đang kẹt lại mô hình nền tảng robot hiện nay chưa hẳn là cấu trúc mô hình, mà là quy mô và sự đa dạng của dữ liệu chưa theo kịp. Nếu không có đủ dữ liệu thực tế đa dạng giữa các bối cảnh và ngành nghề, thì dù mô hình và phần cứng có tốt đến đâu cũng chỉ quay vòng trong phòng thí nghiệm. Ở giai đoạn này, dữ liệu không phải là thứ làm đẹp thêm, mà là biến số then chốt quyết định liệu Physical AI có vượt qua được điểm bước ngoặt hay không.
BlockBeats hỏi: Có thể dùng cách đơn giản nhất, trực tiếp nhất, không vòng vo nhất để nói cho người bình thường biết Axis làm gì không?
Chris: Nói một cách thẳng thắn nhất, Axis đang giúp robot tích lũy liên tục "kinh nghiệm thực hành".
Bạn có thể hình dung robot như một thực tập sinh mới vào nghề. Đầu óc nó không tệ, nhưng chưa từng làm việc gì cả. Muốn biến nó thành người lành nghề, chỉ đưa sách hướng dẫn vận hành cho nó xem là không đủ, nó phải tự tay làm, làm xong rồi sai, có người chỉnh sửa, rồi làm lại, luyện tập lặp đi lặp lại. Việc chúng tôi làm là hệ thống hóa những kinh nghiệm đó để sản xuất ra.
Từ chuẩn bị trước khi huấn luyện, thiết kế nhiệm vụ, luyện tập mô phỏng, đến thu thập dữ liệu thực tế, rồi làm sạch dữ liệu, sửa lỗi sau khi huấn luyện mô hình và tối ưu hóa liên tục, toàn bộ chuỗi này chúng tôi đã kết nối thông suốt. Chúng tôi còn xây dựng nền tảng mô phỏng trên web và công cụ thu thập trên điện thoại di động, để người bình thường cũng có thể tham gia. Bạn gấp quần áo, dọn dẹp bàn ở nhà, những thao tác hàng ngày này đều có thể trở thành tư liệu học tập cho robot.
Tóm gọn một câu: Axis là một cỗ máy dữ liệu liên tục cung cấp dữ liệu huấn luyện cho Physical AI, đồng thời liên tục giúp nó sửa lỗi, giúp robot học nhanh hơn, phạm lỗi ít hơn.
BlockBeats hỏi: Theo bạn, giải pháp cuối cùng cho khoảng trống dữ liệu trí tuệ nhúng hiện nay là gì? Dữ liệu góc nhìn thứ nhất, dữ liệu điều khiển từ xa và dữ liệu mô phỏng, loại nào tốt hơn?
Chris: Thách thức lớn nhất của ngành hôm nay là ba điều: quy mô dữ liệu, tính đa dạng của bối cảnh và sự căn chỉnh vật lý thực tế, rất khó để đạt được cùng lúc. Cái gọi là căn chỉnh vật lý thực tế, nghĩa là quy luật chuyển động trong dữ liệu của bạn phải khớp với thế giới thực, không thể luyện tập rất thuần thục trong môi trường ảo mà khi lên máy thật lại "tay nghề kém".
Tôi ví dụ thế này. Dữ liệu vận hành từ xa mô phỏng, giống như tập lái trên máy mô phỏng ở trường dạy lái. Rào cản thấp, không cần xe thật, mọi người trên toàn cầu có thể điều khiển robot ảo từ xa qua web để tạo ra lượng lớn dữ liệu huấn luyện. Chúng tôi lại kết hợp ngẫu nhiên hình dạng robot, vật thể, bối cảnh, nhiệm vụ, tính đa dạng nhanh chóng được mở rộng. Nhược điểm cũng rõ ràng: mô phỏng có tốt đến đâu cũng không phải điều kiện đường thực tế. Những chấn động, tình huống bất ngờ, mặt đường không đều trong thực tế, mô phỏng rất khó tái hiện hoàn toàn. Mô hình học trong môi trường ảo, lên máy thật có thể vẫn không hoạt động, đó là cái gọi là "khác biệt ảo - thực".
Dữ liệu góc nhìn thứ nhất của con người, giống như lắp một chiếc camera hành trình cho tài xế già. Người bình thường có thể dùng điện thoại để thu thập thao tác thực tế tại nhà, văn phòng, trong hình ảnh tự mang thông tin thị giác và ngôn ngữ, giúp mô hình hiểu con người thực sự làm việc như thế nào. Nhưng nhược điểm là trong hình ảnh không có dữ liệu khớp chính xác của robot, dùng trực tiếp để huấn luyện thao tác tinh vi thì chưa đủ.
Dữ liệu điều khiển từ xa trên máy thật, chính là thực sự lên đường lái xe thử. Độ chính xác quỹ đạo cao nhất, gần nhất với tương tác vật lý thực tế. Đặc biệt là quỹ đạo để lại sau khi mô hình tự vận hành thất bại rồi con người tiếp quản và chỉnh sửa, có giá trị đặc biệt đối với việc cải tiến mô hình. Nhưng chi phí cũng cao nhất, cần máy thật, cần nhân lực, năng suất có hạn, không thể mở rộng vô hạn.

Phong cách triển khai thực tế của Axis
Vì vậy câu trả lời không phải là loại nào tốt hơn, mà là ba loại dữ liệu mỗi loại làm việc riêng của mình: mô phỏng mở rộng quy mô, góc nhìn thứ nhất giúp mô hình hiểu kiến thức thông thường về thế giới thực, điều khiển từ xa trên máy thật thực hiện hiệu chỉnh độ chính xác và vòng lặp sửa lỗi. Chỉ khi đưa ba loại dữ liệu vào cùng một hệ thống, mới có thể thực sự lấp đầy khoảng trống này.
Đây cũng là lý do chúng tôi xây dựng "động cơ vòng lặp kép, nguồn dữ liệu hỗn hợp". Chúng tôi sử dụng dữ liệu điều khiển từ xa mô phỏng và dữ liệu người thật góc nhìn thứ nhất làm nguồn cung cấp kép, kết hợp với Human-Gated DAgger. Cách làm của nó rất trực tiếp: khi mô hình thất bại, con người can thiệp để chỉnh sửa, sau đó đưa kết quả chỉnh sửa trở lại quá trình huấn luyện. Như vậy, dữ liệu sau khi thu thập, làm sạch và tăng cường, đi vào quá trình huấn luyện mô hình thống nhất về thị giác, ngôn ngữ và hành động, rồi đến triển khai ảo-thực, phản hồi lỗi và bổ sung dữ liệu, tạo thành một vòng lặp tự tiến hóa.
BlockBeats hỏi: Ban đầu vì sao Axis chọn bắt đầu từ dữ liệu mô phỏng, và bây giờ lại bắt đầu bố trí dữ liệu góc nhìn thứ nhất? Đây có phải là sự thay đổi định hướng chiến lược không?
Chris: Đây là sự mở rộng của cùng một chiến lược dữ liệu. Physical AI chắc chắn được thúc đẩy bởi dữ liệu, và chỉ số cốt lõi của dữ liệu không phải là số lượng, mà là tính đa dạng, vì tính đa dạng quyết định khả năng tổng quát hóa và độ bền vững. Chúng tôi làm mô phỏng trước, vì nó có thể kiểm soát, có thể lặp lại và dễ đánh giá. Chúng tôi có thể thiết kế nhiệm vụ, điều chỉnh kịch bản và hình thái robot, sau khi thu thập xong còn có thể phát lại, xác minh, huấn luyện và kiểm thử. Bản thân nó giống như một "mô hình thế giới", là sự ảo hóa của thế giới thực.
Dữ liệu góc nhìn thứ nhất có thể bổ sung chiều rộng của thế giới thực. Gần đây, các nghiên cứu bao gồm cả DreamDojo đã giúp ngành công nghiệp nhìn thấy rõ hơn tiềm năng của video góc nhìn thứ nhất quy mô lớn trong việc học hành vi con người và quy luật thế giới. Loại dữ liệu này ghi lại cách con người sử dụng công cụ, xử lý vật thể và hoàn thành nhiệm vụ, và những hành vi này phân bố ở các quốc gia, ngành nghề và bối cảnh sống khác nhau, rất khó để một số ít phòng thí nghiệm bao phủ hết.
Dữ liệu mô phỏng dễ dàng được sản xuất tập trung bởi một số ít nền tảng, nhưng dữ liệu góc nhìn thứ nhất tự nhiên bị phân tán, cần sự tham gia chung của những người đóng góp trên toàn cầu. Khi nhu cầu của các công ty mô hình hàng đầu như NVIDIA, DeepMind đối với loại dữ liệu này tăng lên, khả năng liên tục thu thập, xử lý và xác minh dữ liệu góc nhìn thứ nhất trên toàn cầu sẽ trở thành một năng lực quan trọng.
Quan trọng hơn, đối với Axis, mạng lưới cộng tác viên, phân phối nhiệm vụ và quy trình xử lý dữ liệu cùng xác minh là những thứ có thể tái sử dụng. Mở rộng từ mô phỏng sang dữ liệu góc nhìn thứ nhất không phải là đổi hướng, mà là hoàn thiện một cơ sở hạ tầng dữ liệu robot toàn diện hơn.
BlockBeats hỏi: Anh có thể dẫn chúng tôi qua toàn bộ quy trình thu thập, xử lý và huấn luyện dữ liệu trí tuệ nhúng trong Axis không?
Chris: Trong Axis, việc thu thập và xử lý dữ liệu không bị chia cắt thành từng đoạn riêng lẻ, toàn bộ quy trình là một vòng khép kín từ đầu đến cuối. Bản Axis V2 phát hành gần đây là một bước nâng cấp quan trọng đối với chúng tôi: trước đây Axis giống một trạm thu thập dữ liệu một chiều, còn bây giờ chúng tôi đã kết nối toàn bộ quá trình tạo nhiệm vụ, thu thập dữ liệu, huấn luyện mô hình và đánh giá tối ưu thành một hệ thống thống nhất.

Bước đầu tiên là ra đề. Chúng tôi sẽ sử dụng thuật toán trong môi trường mô phỏng để kết hợp các biến số như thân robot, vật thể mục tiêu, vị trí, điều kiện thị giác. Ví dụ, kết hợp 10 loại hành động, 10 loại vật thể và 10 cách bố trí, sự đa dạng của nhiệm vụ có thể được khuếch đại theo cấp số nhân một cách nhanh chóng.
Bước thứ hai là làm bài. Các cộng tác viên toàn cầu có thể hoàn thành nhiệm vụ mô phỏng thông qua giao diện web hoặc điện thoại di động đơn giản, hoặc sử dụng ứng dụng góc nhìn thứ nhất trên thiết bị di động để thu thập quá trình thao tác trong thế giới thực.
Bước thứ ba là chấm điểm và xử lý, đây cũng là khâu cốt lõi nhất. Dữ liệu thô thường có hiện tượng rung lắc, hành động vô hiệu, thao tác không tự nhiên, chúng tôi sẽ làm sạch, làm mượt và lấy mẫu lại trước tiên. Sau đó, nhờ RoboVerse, cùng một bộ dữ liệu được luân chuyển giữa các môi trường mô phỏng khác nhau, trước tiên chuyển dữ liệu mô phỏng thu thập từ giao diện web nhẹ sang Isaac Sim để phát lại và tăng cường dữ liệu, vừa phát lại vừa thay đổi chất liệu cảnh, ánh sáng, góc camera và thông số vật lý. Giống như dùng cùng một công thức nấu ăn nhưng thay đổi nồi, lửa và nguyên liệu khác nhau để nấu lại, một dữ liệu thô có thể mở rộng ra nhiều mẫu huấn luyện.

Sau khi xử lý xong cũng không phải đưa thẳng vào mô hình lớn, mà phải trải qua kiểm tra điều kiện thành công, lọc ngoại lệ và chuẩn hóa định dạng mới có thể đưa vào huấn luyện mô hình. Sau khi hoàn thành một vòng huấn luyện, chúng tôi sẽ cho mô hình thực hiện nhiệm vụ trong môi trường mô phỏng và đánh giá, quan sát xem nó dễ thất bại trong những tình huống và trạng thái nào, rồi chuyển những điểm yếu đó thành các nhiệm vụ thu thập có định hướng mới.
Mô hình tự chủ thực hiện nhiệm vụ, một khi đi chệch hướng đúng, người đóng góp sẽ tiếp quản và cung cấp hành động sửa lỗi. Dữ liệu sửa lỗi này sẽ quay lại quá trình huấn luyện, giúp mô hình dần học cách xử lý các tình huống trước đây chưa gặp. Vòng xoay này cứ quay liên tục, dữ liệu, mô hình và khả năng của robot cùng nhau tiến lên.
Vì vậy, ý nghĩa của V2 không chỉ là thêm vài tính năng, mà là giúp Axis chuyển từ một "bộ thu thập dữ liệu" thành một "hệ thống hoàn chỉnh có thể giúp mô hình thông minh hơn".
BlockBeats hỏi: Axis gần đây đã phát hành Dataset V1, tại sao bộ dữ liệu này lại quan trọng, nó cụ thể chứng minh điều gì?
Chris: Điều quan trọng nhất của Dataset V1 không phải là nó chỉ đơn thuần thêm một lượng dữ liệu, mà là nó bước đầu xác nhận một điều: các thao tác mô phỏng từ đông đảo người đóng góp thông thường, sau khi trải qua thiết kế nhiệm vụ, kiểm tra thành công, lọc, làm mượt và tăng cường dữ liệu, có thể tạo thành tín hiệu hữu ích cho việc tiền huấn luyện robot.
V1 bao gồm 207 nhiệm vụ thao tác, hơn 50.000 quỹ đạo và hơn 60.000 biến thể nhiệm vụ và kịch bản. Trong đánh giá công khai LIBERO-Plus, sau khi tiếp tục tiền huấn luyện với toàn bộ dữ liệu AXIS, tỷ lệ thành công tổng thể của π0.5 đã tăng từ 83,9 lên 88,8, tăng 4,9 điểm phần trăm. Nhóm đối chứng RoboCasa với cùng lượng dữ liệu đạt 57,5. Điều này ít nhất cho thấy, trong điều kiện đánh giá này, sự cải thiện của mô hình không chỉ phụ thuộc vào số lượng dữ liệu đơn lẻ, mà còn liên quan đến việc nhiệm vụ, kịch bản, góc nhìn và điều kiện nhiễu có đủ đa dạng hay không.
Năm nay chúng tôi sẽ phát hành Dataset V2, tiếp tục mở rộng quy mô và bao phủ nhiều hình thái robot, nhiệm vụ và kịch bản hơn.
BlockBeats hỏi: Axis đánh giá một mẩu dữ liệu có giá trị như thế nào? Tiêu chí đánh giá đại khái gồm những gì?
Chris: Chúng tôi không chỉ nhìn một mẩu dữ liệu "có thu thập được hay không", mà sẽ liên tục đặt ra vài câu hỏi: nó có sạch không, có mang lại điều gì mới không, có thể ứng dụng trong thế giới thực không, và nó có giúp mô hình bù đắp điểm yếu thực sự không.
Vòng đầu tiên xem có dùng được không. Thao tác đã hoàn thành chưa? Có bị kẹt, mất kết nối ở giữa chừng không? Phát lại hành động có tái hiện được không? Có thiết bị giật lag, thao tác trôi, hoặc vật thể xuyên qua nhau vi phạm quy luật vật lý không? Chúng tôi còn dùng bộ dữ liệu này để huấn luyện một mô hình nhẹ làm kiểm tra nhanh, nếu ngay cả vòng này cũng không qua, bộ dữ liệu đó sẽ không được đưa vào nhóm huấn luyện.
Vòng thứ hai xem có thông tin mới hay không. Robot sợ nhất là lặp đi lặp lại những bài đã biết. Chúng tôi sẽ xem bối cảnh, vật thể, cách tương tác của quỹ đạo này khác biệt đến mức nào so với dữ liệu hiện có. Nếu xuất hiện bố cục bối cảnh hiếm gặp, chất liệu đặc biệt, thao tác bất thường, thì giá trị sẽ cao. Việc lặp lại hàng loạt thao tác "nhấc lên đặt xuống" tất nhiên cũng có ích, nhưng chủ yếu là bổ sung số lượng cơ bản. Điều thực sự đáng để đầu tư trọng điểm là những nhiệm vụ phức hợp có nhiều vật thể cản trở lẫn nhau, cần liên tục nhiều bước mới hoàn thành được—loại dữ liệu này mới buộc mô hình học được cách suy luận linh hoạt.
Vòng thứ ba xem có thể từ mô phỏng đi đến thực tế hay không. Dữ liệu mô phỏng không phải càng nhiều càng tốt, mấu chốt là có tính đến những biến đổi của thế giới thực hay không—ánh sáng thay đổi có được không? Chất liệu đổi khác thì sao? Ma sát khác biệt? Góc camera lệch đi? Những biến số này được nhiễu loạn càng đầy đủ, thì khi mô hình lên máy thật càng ít gặp tình trạng "thấy ánh sáng là chết". Nếu một đoạn dữ liệu mô phỏng luôn xảy ra trong một điều kiện lý tưởng duy nhất, nó chỉ có thể làm tài liệu nền cho việc tiền huấn luyện cơ bản, giá trị chuyển giao sang thế giới thực rất hạn chế.
Cuối cùng xem đóng góp cho việc lặp lại dài hạn. Khi mô hình gặp sự cố trên máy thật, đoạn quỹ đạo ngắn mà con người tiếp quản và chỉnh sửa thường rất giá trị—nó cho chúng tôi biết chính xác mô hình chưa hiểu chỗ nào. Những quỹ đạo hoàn toàn mới từ nhiệm vụ mới, dòng máy mới cũng tương tự, giúp mô hình nhanh chóng mở rộng ranh giới năng lực. Ngược lại, nếu một nhiệm vụ đơn giản nào đó mô hình đã làm rất ổn định, thì chất thêm dữ liệu tương tự sẽ có lợi ích giảm dần.
Vì vậy, một dữ liệu tốt không chỉ là "định dạng đúng". Nó phải sạch sẽ, có tính mới, có thể áp dụng vào thế giới thực, và còn phải thúc đẩy mô hình tiến bộ tiếp. Chúng tôi hy vọng dành nguồn lực thu thập hạn chế cho những dữ liệu thực sự có thể khiến robot thông minh hơn.
BlockBeats hỏi: Vì Axis là công ty robot, tại sao lại cần công nghệ blockchain? Axis đã chọn Base chain, có thể giải thích cụ thể lý do không?
Chris: Đây là một câu hỏi rất sắc bén và cũng rất quan trọng. Logic của chúng tôi rất đơn giản: Axis trước tiên đang giải quyết nút thắt dữ liệu của Physical AI, và để làm được điều này, cần sự tham gia của rất nhiều người đóng góp thông thường trên toàn cầu. Công nghệ blockchain không phải là nhân vật chính, nó giống một bộ công cụ cơ sở hiệu quả hơn, dùng để truy xuất nguồn gốc, xác minh, khuyến khích và phân phối.
Trong kỷ nguyên mô hình ngôn ngữ lớn, dữ liệu huấn luyện ở mức độ lớn là một "hộp đen": dữ liệu từ đâu đến, được xử lý như thế nào, giá trị của người đóng góp được xác nhận ra sao—bên ngoài rất khó nhìn rõ. Nhưng Physical AI liên quan trực tiếp đến hành động của robot trong thế giới thực, chất lượng dữ liệu ảnh hưởng đến an toàn, vì vậy hộp đen này không thể đơn giản chấp nhận được.
Chúng tôi đặt một phần quy trình sản xuất dữ liệu của Physical AI lên Base, với mong muốn làm cho việc này trở nên minh bạch hơn. Base là một mạng lưới blockchain chi phí thấp được xây dựng trên Ethereum. Cụ thể, mã số nhiệm vụ, mã số quỹ đạo dữ liệu, mã số người dùng và mối liên kết giữa chúng sẽ được ghi lại. Nhờ đó, mỗi quỹ đạo hành động, mỗi người đóng góp đều có thể được theo dõi, kiểm toán và nhận được phần thưởng tương ứng.
Ngoài ra, chúng tôi cần một mạng lưới có phạm vi cộng đồng rộng và rào cản tham gia thấp. Cộng đồng của Base rất toàn cầu, và chi phí sử dụng chuỗi Base thấp, xác nhận giao dịch nhanh, cũng thuận tiện cho việc ghi nhận đóng góp và phát thưởng của chúng tôi.
Quan trọng hơn, điều chúng tôi khen thưởng không chỉ là số lượng đơn thuần, mà là những đóng góp chất lượng cao. Đối với mô hình robot, dữ liệu rác không chỉ vô dụng mà thậm chí có thể gây hại. Chúng tôi sử dụng hệ thống chấm điểm hai lớp và hệ thống điểm tích lũy để xác định liệu một dữ liệu có thực sự giúp ích cho mô hình hay không; đóng góp càng tốt, điểm càng cao, phần thưởng càng nhiều. Hiệu quả và chi phí thấp của chuỗi Base hoàn toàn phù hợp với nhu cầu hợp tác toàn cầu với phần thưởng vi mô tần suất cao của chúng tôi.
BlockBeats hỏi: Lộ trình thương mại hóa hiện tại của Axis là gì? Xoay quanh việc thu thập dữ liệu robot, huấn luyện mô hình và triển khai thực tế, các bạn chủ yếu cung cấp những sản phẩm hoặc dịch vụ nào cho khách hàng? Phản hồi của khách hàng hiện tại về mô hình này như thế nào?
Chris: Lộ trình thương mại hóa của chúng tôi khá rõ ràng, cốt lõi là phục vụ ba nhóm khách hàng và cung cấp giải pháp từ đầu đến cuối dựa trên vấn đề cụ thể của từng nhóm.
Nhóm đầu tiên là các công ty phần cứng robot và công ty liên quan đến hiện thân, ví dụ như Booster Robotics, Feagine Robotics và AgiBot. Họ có phần cứng riêng, nhưng thường cần dữ liệu tùy chỉnh hơn và các mô hình có thể triển khai trực tiếp để bổ sung khả năng vận hành. Chúng tôi có thể bắt đầu từ thiết kế nhiệm vụ, hỗ trợ họ thu thập dữ liệu, huấn luyện mô hình và triển khai, đồng thời cung cấp giải pháp dữ liệu cho khách hàng hạ nguồn của họ.
Nhóm thứ hai là các công ty mô hình phát triển mô hình thị giác-ngôn ngữ-hành động hoặc mô hình thế giới, ví dụ như Manycore Tech và SomaStacks. Vai trò của mô hình thế giới là giúp máy học hiểu môi trường sẽ thay đổi như thế nào. Họ cần một lượng lớn dữ liệu vận hành chất lượng cao để huấn luyện mô hình tổng quát, chúng tôi cung cấp cho họ các bộ nhiệm vụ và bộ dữ liệu chất lượng cao, và cũng có thể cùng nhau thực hiện huấn luyện kết hợp.
Nhóm thứ ba là các doanh nghiệp trong ngành dọc, ví dụ như Lotus Cars và Geely Automobile. Điều họ quan tâm không phải là mô hình tiên tiến đến đâu, mà là làm sao để đưa robot thực sự vào dây chuyền sản xuất, vì vậy chúng tôi cung cấp giải pháp tự động hóa từ đầu đến cuối dựa trên phương pháp học máy.
Chúng tôi rất coi trọng năng lực hệ thống, vì vậy việc giao hàng không chỉ là một gói dữ liệu. Khách hàng cần gì, ranh giới năng lực nội bộ ở đâu, chúng tôi có thể điều chỉnh tương ứng: vừa có thể cung cấp dữ liệu, vừa có thể bàn giao luôn giải pháp dựa trên dữ liệu. Như vậy vừa nâng cao sức cạnh tranh phục vụ khách hàng, vừa trực tiếp giúp khách hàng tăng hiệu quả và chất lượng.
BlockBeats hỏi: Đối tác và khách hàng của Axis là những ai? Khi các khách hàng khác nhau đến với Axis, nhu cầu của họ thường là gì?
Chris: Các loại công ty vừa đề cập đều là khách hàng tiêu biểu của chúng tôi. Bề ngoài họ đều nói "thiếu dữ liệu", nhưng thực tế thứ họ thiếu không giống nhau.
Ví dụ một nhà sản xuất phần cứng, có thể vừa tạo ra một cánh tay robot rất tốt, nhưng khi đến hiện trường khách hàng, chỉ cần ánh sáng thay đổi, hoặc vật phẩm được đặt ở vị trí khác, robot liền không nắm bắt chính xác được. Họ tìm đến Axis, điều thực sự muốn giải quyết là: làm sao để robot hoạt động ổn định trong nhiều môi trường hơn.
Thứ chúng tôi cung cấp cho họ không phải là một đống video lộn xộn, mà là dữ liệu có cấu trúc được tạo sinh, làm sạch và chú thích ngữ nghĩa đa chiều, đa dạng. Khi cần thiết, chúng tôi cũng trực tiếp giúp họ huấn luyện chiến lược. Kết quả cuối cùng cần bàn giao là làm cho phần cứng của họ ổn định hơn và có khả năng khái quát hóa tốt hơn trong môi trường phi cấu trúc.
BlockBeats hỏi: Từ khi nền tảng ra mắt đến nay, các bạn có thể chia sẻ một số dữ liệu vận hành thực tế chưa từng công bố, chẳng hạn như số lượng người đóng góp đăng ký hợp lệ, số lượng nhiệm vụ được phát hành, tổng số quỹ đạo tích lũy, cũng như mức độ hoạt động và đóng góp của người dùng chất lượng cao?
Chris: Kể từ khi nền tảng ra mắt đến nay đã 15 tuần, tổng số người đóng góp đăng ký của chúng tôi đã vượt quá 80.000. Con số này đã loại bỏ các địa chỉ không hợp lệ như tài khoản bot, là dữ liệu thực sự hợp lệ. Chúng tôi đã phát hành tổng cộng 1.600 nhiệm vụ học máy dùng cho tiền huấn luyện, tích lũy thu thập hơn 2 triệu quỹ đạo dữ liệu, quy đổi ra khoảng 3.500 giờ dữ liệu chất lượng cao.
Nhưng chúng tôi coi trọng hơn là chất lượng và độ gắn kết của người dùng. Hiện tại, số người đóng góp chất lượng cao khoảng 20.000 người, chiếm khoảng 30%. Trong 30 ngày qua, có 7.800 người trong nhóm này duy trì hoạt động; trong 7 ngày qua có 5.300 người hoạt động, tỷ lệ tuần hoạt/tháng hoạt đạt 68%. Họ đã đóng góp lần lượt 680.000 và 160.000 quỹ đạo trong 30 ngày qua và 7 ngày qua.
Mức độ hoạt động và chiều sâu tham gia này cho chúng tôi thấy sự quan tâm của người dùng đối với mô hình "huấn luyện là đóng góp, đóng góp nhận thưởng", đồng thời cũng cho thấy cộng đồng của chúng tôi đang hình thành một mạng lưới người đóng góp thông minh robot tương đối trưởng thành và ổn định.
BlockBeats hỏi: Trong hai năm qua, robot hình người, VLA, Physical AI đều rất nóng, nhưng hầu hết người bình thường vẫn chưa thực sự sử dụng robot. Bạn nghĩ còn bao lâu nữa robot mới bùng nổ trên diện rộng? Điểm ngoặt thực sự sẽ là gì - chi phí phần cứng giảm, năng lực mô hình vượt bậc, hay hạ tầng dữ liệu trưởng thành?
Chris: Chúng tôi cho rằng, điểm ngoặt thực sự vẫn là sự trưởng thành của hạ tầng dữ liệu.
Chi phí phần cứng thực ra đã giảm nhanh chóng. Lợi thế chuỗi cung ứng của Trung Quốc khiến chi phí sản xuất robot không còn là rào cản không thể vượt qua. Nhưng tại sao người bình thường vẫn chưa sử dụng robot trên quy mô lớn? Nguyên nhân cốt lõi là robot vẫn chưa đủ thông minh, chúng thiếu hiểu biết thông thường đầy đủ về quy luật vật lý của thế giới thực và ý định của con người.
Điều này giống như bạn có một chiếc xe giá rẻ, động cơ cũng tốt, nhưng chưa có bằng lái, chưa từng lên đường - chỉ có phần cứng và thuật toán, thiếu "kinh nghiệm lái xe" đủ, xe vẫn không chạy tốt được. Chỉ khi chúng ta có thể thu thập dữ liệu tương tác với thế giới vật lý với chi phí thấp và quy mô lớn như cách chúng ta thu thập trang web ngày nay, và biến nó thành nguồn dinh dưỡng mà mô hình có thể tiêu hóa, robot mới thực sự bùng nổ.
Chúng tôi cảm thấy điểm ngoặt này ngày càng gần, và điều Axis muốn làm là đẩy nó tiến thêm một bước nữa.
BlockBeats hỏi: Trong ngành robot, các công ty mô hình lớn và công ty sản xuất máy hoàn chỉnh trong tương lai có thể sẽ tự xây dựng dữ liệu. Đối mặt với các đội ngũ tự xây dựng dữ liệu này, cũng như các đối thủ cùng lĩnh vực hiện tại của Axis, hào phòng thủ dài hạn của Axis là gì? Là mạng lưới người đóng góp, khả năng tạo nhiệm vụ, kiểm soát chất lượng dữ liệu, bối cảnh khách hàng, hay hiệu quả huấn luyện khép kín?
Chris: Đây là một câu hỏi rất quan trọng và rất thực tế. Các công ty mô hình lớn và nhà sản xuất máy hoàn chỉnh chắc chắn sẽ tự xây dựng đội ngũ dữ liệu trong tương lai, đây gần như là kết quả tất yếu của sự phát triển ngành. Nhưng cuộc cạnh tranh thực sự không phải là ai có thể tự thu thập dữ liệu, mà là ai có thể xây dựng một hạ tầng dữ liệu xuyên bối cảnh, có khả năng mở rộng quy mô và liên tục tối ưu hóa.
Trong ngắn hạn, mọi người cạnh tranh về độ phủ và tính đa dạng của dữ liệu; trong trung hạn, cạnh tranh về hiệu quả chuyển hóa dữ liệu thành năng lực mô hình; trong dài hạn, cạnh tranh về việc ai có thể thực sự nhúng vào hệ thống sản xuất thông minh của khách hàng, trở thành mắt xích khó bị thay thế.
Hào phòng thủ của Axis sẽ không chỉ là một điểm đơn lẻ, chẳng hạn như mạng lưới người đóng góp, hiệu quả thu thập hay khả năng xử lý dữ liệu. Năng lực đơn điểm đều có thể bị sao chép, chúng tôi quan tâm hơn đến việc kết nối những năng lực này thành một vòng khép kín không ngừng tăng cường, và dần dần nhúng vào quy trình huấn luyện của khách hàng.
Đối với khách hàng, việc kết nối với Axis sẽ rất nhẹ nhàng, không cần giấy phép phức tạp, có thể nhanh chóng phát hành nhiệm vụ và nhận dữ liệu. Nhưng một khi khách hàng bắt đầu sử dụng hệ thống tài sản mô phỏng, mạng lưới thu thập phân tán và vòng khép kín sửa lỗi mô hình của chúng tôi, quy trình huấn luyện của hai bên sẽ dần dần gắn kết với nhau. Muốn thay thế chúng tôi, khách hàng không chỉ đơn thuần đổi một nhà cung cấp dữ liệu, mà phải xây dựng lại cơ sở hạ tầng mô phỏng, tái lập mạng lưới người đóng góp, đường ống xử lý dữ liệu và quy trình sửa lỗi sau huấn luyện. Hào phòng thủ của chúng tôi không phải là sự khép kín, mà là sự nhúng cấu trúc này.
Chúng tôi cũng đặc biệt coi trọng khả năng tiến hóa cùng với mô hình. Nếu chỉ bán dữ liệu, tất nhiên có thể bị thay thế bất cứ lúc nào; nhưng nếu chúng tôi có thể liên tục phát hiện điểm yếu của mô hình, thiết kế các nhiệm vụ có mục tiêu, cung cấp dữ liệu sửa lỗi sau huấn luyện, và thực sự giúp khách hàng cải thiện tỷ lệ thành công và độ bền vững, chúng tôi sẽ trở thành một phần của vòng khép kín tối ưu hóa mô hình. Khi đó, mối quan hệ giữa chúng tôi và khách hàng không còn chỉ là nhà cung cấp và bên mua, mà giống như những người đồng xây dựng hơn.
Trong 18 tháng tới, ngành sẽ rất thiếu dữ liệu quy mô lớn, phủ rộng, khối lượng và tính đa dạng vẫn là yếu tố cốt lõi. Ba năm tiếp theo, ngành có thể sẽ cần dữ liệu chuyên biệt cho các lĩnh vực và tình huống cụ thể. Tài sản chúng tôi thực sự muốn tích lũy không phải là một loại dữ liệu nào đó, mà là một hệ thống tạo nhiệm vụ có thể lập trình, mạng lưới đóng góp phân tán có thể điều phối và vòng khép kín huấn luyện tối ưu liên tục. Nó có thể mở rộng theo chiều ngang sang nhiều ngành hơn, đồng thời đào sâu theo chiều dọc vào một lĩnh vực cụ thể.
Nếu tóm gọn bằng một câu, ngắn hạn cạnh tranh về quy mô, trung hạn cạnh tranh về hiệu quả, dài hạn cạnh tranh về độ nhúng. Mục tiêu của Axis là trở thành một phần của hệ thống sản xuất thông minh Physical AI, chứ không phải một nhà cung cấp dữ liệu có thể dễ dàng bị thay thế.
BlockBeats hỏi: Trong 6–12 tháng sau vòng gọi vốn, nhiệm vụ và mục tiêu chính của Axis là gì? Tiếp tục mở rộng quy mô dữ liệu, xác minh thêm nhiều nhiệm vụ robot thực tế, hay giành thêm nhiều khách hàng trả phí? Nếu nhìn lại sau một năm, các bạn muốn giới bên ngoài dùng từ khóa gì để mô tả Axis?
Chris: Trong 6 đến 12 tháng tới, chúng tôi sẽ đồng thời thúc đẩy sản phẩm, hệ sinh thái và thương mại hóa.
Về sản phẩm, V2 đã đưa chúng tôi từ nền tảng thu thập một chiều tiến lên thành vòng khép kín huấn luyện hoàn chỉnh, việc tiếp theo là thực sự vận hành hệ thống này và mở rộng quy mô. Vào tháng 9, chúng tôi tiếp tục triển khai đường ống thu thập dữ liệu góc nhìn thứ nhất, hiện đã tích lũy hàng chục nghìn giờ dữ liệu và đang trao đổi nhu cầu với các phòng thí nghiệm mô hình tiên tiến ở Bắc Mỹ. Khoảng tháng 10, chúng tôi dự kiến phát hành phiên bản V2 của bộ dữ liệu, bao phủ nhiều hình thái robot và năng lực nguyên tử hơn. Trước cuối năm, chúng tôi sẽ phát hành bộ dữ liệu sau huấn luyện Human-Gated DAgger quy mô lớn đầu tiên.
Về mặt hệ sinh thái, chúng tôi sẽ tiếp tục mở rộng mạng lưới toàn cầu, tiến vào thị trường Mỹ Latinh và châu Âu. Trong 6 đến 12 tháng tới, chúng tôi hy vọng duy trì công suất ổn định hàng ngày trên 500 giờ cho dữ liệu góc nhìn thứ nhất, nâng công suất hàng ngày của dữ liệu mô phỏng lên trên 50 giờ, và từng bước mở rộng năng lực sản xuất dữ liệu huấn luyện sau DAgger.
Về mặt thương mại hóa, mục tiêu của chúng tôi là hoàn thành 2 đến 3 dự án thí điểm trả phí mới vào cuối năm, và bước vào danh sách nhà cung cấp ưu tiên của các công ty mô hình nền tảng vào đầu năm sau.
Nếu nhìn lại sau một năm, chúng tôi hy vọng mọi người sẽ mô tả Axis bằng ba từ: "Quy mô, Đa dạng, Khép kín". Quy mô là khả năng cung cấp nguồn dữ liệu cấp ngành một cách bền vững; Đa dạng là chúng tôi thực sự bao phủ được độ phức tạp của thế giới thực; Khép kín là chúng tôi không chỉ tạo ra dữ liệu mà còn liên tục tối ưu hóa dựa trên điểm yếu của mô hình.
Quan trọng hơn, chúng tôi hy vọng khi ngành nhắc đến Axis, họ sẽ nói: "Đây là một hệ thống giúp mô hình robot tiến hóa nhanh hơn." Vấn đề chúng tôi giải quyết không chỉ là số lượng dữ liệu, mà còn là hiệu quả tiến hóa của mô hình. Chỉ cần khách hàng kết nối với Axis, mô hình lặp nhanh hơn, tỷ lệ thành công cao hơn, phạm vi tình huống bao phủ rộng hơn, đó chính là giá trị của chúng tôi.
Chào mừng bạn tham gia cộng đồng chính thức của BlockBeats:
Nhóm Telegram đăng ký: https://t.me/theblockbeats
Nhóm Telegram thảo luận: https://t.me/BlockBeats_App
Tài khoản Twitter chính thức: https://twitter.com/BlockBeatsAsia