Post
sato
satoooh.org
did:plc:wolbjvwtxvub2unbgl4ayihr
主観映像はVLMの空間理解性能がめっちゃ落ちるらしく、そこに着目した新しいベンチマークの提案してるやつ。Gemini 3 Flashとかでも人間と37.7%くらい差が出るらしく、Rayban Metaとかでデータ取れるようになったら一気に向上しそうね。ロボットの性能も上がりそう
arxiv.org/abs/2602.16682
https://arxiv.org/abs/2602.16682
2026-02-20T01:02:07.154Z