在機器人領域,大家常常討論 robotics data,焦點停留在「能不能收集到」。但更關鍵的問題是:收集到的資料,是否適合直接拿去訓練。
原始的 trajectory 往往帶著停頓、抖動、失敗中段、鏡頭不穩、動作頻率不足。如果直接餵給模型,學到的可能只是噪音,而不是技能。這就是為什麼 Data Processing 不是後勤,而是資料能不能用的分水嶺。
第一步是清洗:validation、filtering、smoothing、resampling。清洗之後,還需要調整 camera、lighting、pose、mass、friction。前半段是把一條示範修到能用,後半段則是把同一條示範展開成一組可訓練樣本。
在看
@axisrobotics 的時候,我會把這層單獨算進去。前面的 Task Generation 和 Simulation 決定覆蓋範圍,而後面的處理層則決定品質。覆蓋沒有處理,只是堆原始檔;處理沒有覆蓋,只是把同一條示範洗得很漂亮。
Physical AI 真正缺的,往往不是更多未處理的成功路徑,而是同一條動作在不同條件下仍然成立的版本。如果同一條動作不能在不同條件下重現,數量再多,也只是把同一種成功路徑存得更密。