{"as_of":"2026-08-10T15:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0024c76b0d31a4a0dd96acfca271acacf5085b5b4a73cadbf2e15f3cc9abba98","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:27:53.257043Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.27180/citation-record","integrity":"/paper/2607.27180/integrity","json":"/paper/2607.27180/citation-record.json","paper":"/paper/2607.27180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.524278Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":"32d75587-f0fa-4f98-b27c-0949e316e6dd","year":2018},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.070094Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:ba11427590b2845d27cdee24cfa8df7d446284062a55e66e016f9a644e30c00e","observation_id":"6ab25c09-464f-4e97-bf1f-5ee681b944f6","resolution":{"observed_at":"2026-08-05T04:27:54.527603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-05T04:27:53.075264Z","title":"_0 : A vision-language-action flow model for general robot control, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.075264Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7407372dcdac0b49f2938aa8b00792108274ae22c888201c7d75f0b1333a491f","observation_id":"6861f628-8709-404a-a0c8-b3902d8df2d1","resolution":{"observed_at":"2026-08-05T04:27:53.075264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.514893Z","title":"Turner, Eric Undersander, and Tsung-Yen Yang","venue":null,"work_id":"1fc1dbaa-75de-43ab-87b7-f80d20af1933","year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.078982Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7e7d0552ecf617ff048a2e118772565884a7d59d9940fef396ded561f8116e1b","observation_id":"a5eeda64-7f19-4f92-80c4-e96181dae722","resolution":{"observed_at":"2026-08-05T04:27:54.518174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.505287Z","title":"SpatialVLM : Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"ffa84fd6-0420-433b-981a-9c70ffcc9137","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.082197Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:2a56dce6108ba87c0bb77ac0bceece94ffb0dbe79ff95703753e36b49879ef72","observation_id":"aa073d81-8d68-4964-98de-ad1b587e7176","resolution":{"observed_at":"2026-08-05T04:27:54.508738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.495291Z","title":"LoTa-Bench : Benchmarking language-oriented task planners for embodied agents","venue":null,"work_id":"40228d68-e7f4-4da9-b6a3-ed30b95797e5","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.086299Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:d48126cb1207efbc81317eff036810eadc822a1cc0604b2cfcbfd540e5687bc2","observation_id":"e374e4c5-7954-439f-8bc9-b776274cfdf5","resolution":{"observed_at":"2026-08-05T04:27:54.499028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.15975","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.186620Z","title":"Umo: Unified in-context learning unlocks motion foundation model priors","venue":null,"work_id":"b0e6269a-195a-4942-8300-cc7dc96b16e2","year":2026},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.089644Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:353557ddcbe1ffe7cc0bbef71f35fd04b942bffec8d2e0028556ae9d7f4e8e8f","observation_id":"8292f7df-5bfe-42c3-a35a-f19f9cc0e854","resolution":{"observed_at":"2026-08-05T04:27:54.192337Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6880.27927","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.122333Z","title":"Bullet physics simulation","venue":null,"work_id":"753752cc-1bd4-458d-966e-71c3a4f10fd4","year":2015},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.093124Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:250d46100d01e52e7bce733ad9d632f6369eb5a08bf3fda432e9e4d8f7e14351","observation_id":"0bf41762-0765-4b22-9521-7b9495f08f82","resolution":{"observed_at":"2026-08-05T04:27:54.127642Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.19259","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.035656Z","title":"Moving by looking: Towards vision-driven avatar motion generation","venue":null,"work_id":"bde60b0f-9b5a-4217-9aa4-52b77300d310","year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.096083Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:2295a2607fd5bb5e4e1449e042adcf3d7d9fe44a51b00c83448ef217253a0860","observation_id":"6a06d3cd-4200-422d-8e44-0f91d5c528a3","resolution":{"observed_at":"2026-08-05T04:27:54.043473Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.484957Z","title":null,"venue":null,"work_id":"0d467a42-58a8-4bbb-9467-f1d0801720b9","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.099218Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:cb03ff822f8835dc613c4b440fe3a236333c918869121da6b24895104b7788a8","observation_id":"da4f47b3-2073-4f65-bba5-ccecfc645fc8","resolution":{"observed_at":"2026-08-05T04:27:54.488985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.474847Z","title":"Manipulate-anything: Automating real-world robots using vision-language models","venue":null,"work_id":"d18aafc2-8a14-495b-91cb-7e6950e3b81f","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.102107Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:a2822d9a8d52ec704bb377846486d6843e268d4422e916a90e2125c2c6d552f6","observation_id":"5bc2a7c2-77e5-4910-8028-bd549859a556","resolution":{"observed_at":"2026-08-05T04:27:54.478561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.106011Z","title":"Sanketi, Dorsa Sadigh, Chelsea Finn, and Sergey Levine","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.106011Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:83d067cc7468a5c03e72d40739a4c8aa60abefc3e624d5a125fd715d2e6a542a","observation_id":"095dfea5-81cc-40ad-8356-a69877df88ad","resolution":{"observed_at":"2026-08-05T04:27:53.106011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.109145Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.109145Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:b7041c2a38a4ded6237c2227edb6dc076f79ff0defd94245c1591932b511f98f","observation_id":"456824bd-d734-45ca-8459-3aac11782433","resolution":{"observed_at":"2026-08-05T04:27:53.109145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.465191Z","title":"MoMask : Generative masked modeling of 3d human motions","venue":null,"work_id":"b2de90a0-816c-4d1f-8f80-7730f6f9e36c","year":1900},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.111900Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:3f13d48fd9af3097590410507c762c0087944ce50c326bea75783197c29ca0fa","observation_id":"4eb38bdd-4631-4ab4-9fb1-64027ef29cb7","resolution":{"observed_at":"2026-08-05T04:27:54.468555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.115153Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.115153Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:d788725b5e6d1f00961988862406755784a8c886feb6afe7a8af12cebeb9e068","observation_id":"7794d1f2-a8cc-4948-aca3-45d37c17222f","resolution":{"observed_at":"2026-08-05T04:27:53.115153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.18746","last_updated":"2026-05-25T08:34:52Z","snapshot_observed_at":"2026-08-02T07:58:31.278661Z","submitted_at":"2026-05-18T17:59:02Z","title":"ESI-Bench: Towards Embodied Spatial Intelligence that Closes the Perception-Action Loop","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.18746","snapshot_observed_at":"2026-08-05T04:27:53.118055Z","title":"ESI-Bench : Towards embodied spatial intelligence that closes the perception-action loop","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.118055Z"},"links":{"cited_paper":"/paper/2605.18746","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:d8cd8607913a625aab5062481d3ccdfbfad0dfe86049620c83e6897ef0793c0e","observation_id":"cdfb89a2-9142-4ec9-932b-d9dfa3b7ebb2","resolution":{"observed_at":"2026-08-05T04:27:53.118055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.455148Z","title":"VoxPoser : Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":"0294b790-a52e-4c81-a540-756e965d82ec","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.121290Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:d6b24e7e14c6ba3df3680e643170c8365a4fbdb5bb1850ce816d7f014f643154","observation_id":"af4541cf-c2f4-488b-8491-bc5e1a61fcdb","resolution":{"observed_at":"2026-08-05T04:27:54.458537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.445248Z","title":"Inner monologue: Embodied reasoning through planning with language models","venue":null,"work_id":"b07acc00-f349-4d69-8778-5c416d48bced","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.124955Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7d2d3d05b75bf4693df178f2c71ad4b921f197d849e1b936dc9e7ee06485da3e","observation_id":"cb7a4c46-791b-4cae-955a-3f4ccb7768dd","resolution":{"observed_at":"2026-08-05T04:27:54.448682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.435717Z","title":"Como: Controllable motion generation through language guided pose code editing","venue":null,"work_id":"e9967fbe-0da7-41a2-bf15-62e6a53cc2c9","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.127826Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7d2367ccc7b98d48c7486a9e2f6007b734782246879d51aad7b1562953d361ab","observation_id":"44b99768-d4d5-49c3-80c5-a0109b96d0fa","resolution":{"observed_at":"2026-08-05T04:27:54.439160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.425796Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":"dcf2fead-3137-44f9-95d9-b9d1eaeecf8f","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.130780Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:dcad0aea8056c209d21436e6c23691dec3932433aef035516bc9003a6d436459","observation_id":"6b290da6-ee40-4ae9-be7e-fe714aa8d0c9","resolution":{"observed_at":"2026-08-05T04:27:54.429200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25164","last_updated":"2026-04-28T03:15:12Z","snapshot_observed_at":"2026-08-05T04:36:39.841622Z","submitted_at":"2026-04-28T03:15:12Z","title":"IAM: Identity-Aware Human Motion and Shape Joint Generation","version":1},"cited_work":{"arxiv_id":"2604.25164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.25164","snapshot_observed_at":"2026-08-05T04:27:53.808938Z","title":"IAM: Identity-Aware Human Motion and Shape Joint Generation","venue":"cs.CV","work_id":"e4098376-284d-4407-bd6e-66c53aa9a789","year":2026},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.133792Z"},"links":{"cited_paper":"/paper/2604.25164","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:78c6776ceb1f88abb4503f979ccad34d1ddaac4b1381917a3bce60acf557aa41","observation_id":"8388b5cf-ba48-47ea-89fb-4a03d3d66643","resolution":{"observed_at":"2026-08-05T04:27:53.814598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.137106Z","title":"Chang, and Manolis Savva","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.137106Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:399d1e2c39f442950181ad52a196ce8a622063b5bac2137180c0c4afb7d62c3c","observation_id":"c858dc4b-21cd-4c2d-bd0e-5d028bf41d97","resolution":{"observed_at":"2026-08-05T04:27:53.137106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.416135Z","title":"Foster, Pannag R","venue":null,"work_id":"470e60dc-d992-49ab-85fc-7a28d9bc3f6d","year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.140217Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:b191747bcbc7a958ae5e670174aadc4981851a0d8da500530bced052b60f1c69","observation_id":"53816b94-5b39-493e-8ab6-a7c37085c324","resolution":{"observed_at":"2026-08-05T04:27:54.419383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07917","last_updated":"2025-09-18T12:21:57Z","snapshot_observed_at":"2026-07-06T22:11:09.342568Z","submitted_at":"2025-08-11T12:32:45Z","title":"MolmoAct: Action Reasoning Models that can Reason in Space","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07917","snapshot_observed_at":"2026-08-05T04:27:53.143134Z","title":"MolmoAct : Action reasoning models that can reason in space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.143134Z"},"links":{"cited_paper":"/paper/2508.07917","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:19077b2f1efee3c921ddaf7a53c97f61192b93a1b8bd7a61fc2d7c35da230ee3","observation_id":"f3b3463b-aa57-4496-b26f-f08d8a18dc20","resolution":{"observed_at":"2026-08-05T04:27:53.143134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.406802Z","title":"BEHAVIOR-1K : A benchmark for embodied AI with 1,000 everyday activities and realistic simulation","venue":null,"work_id":"13d24f42-58bc-4079-a446-baaba8b5bc22","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.146428Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:2033462eeb39c8a435c1524fae3843acfc49379381d277e7fdee99eb61575130","observation_id":"654f3d73-4a64-4859-8225-8005446494cb","resolution":{"observed_at":"2026-08-05T04:27:54.410027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04633","last_updated":"2025-06-05T05:09:46Z","snapshot_observed_at":"2026-08-10T06:40:52.289910Z","submitted_at":"2025-06-05T05:09:46Z","title":"Unfolding Spatial Cognition: Evaluating Multimodal Models on Visual Simulations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04633","snapshot_observed_at":"2026-08-05T04:27:53.149718Z","title":"Unfolding spatial cognition: Evaluating multimodal models on visual simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.149718Z"},"links":{"cited_paper":"/paper/2506.04633","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:9e776962ecbafff55c63edac77ca5f1d7b49f8807f19e296ef1a05584a0d0b4e","observation_id":"b14b3cb5-72ac-49e0-b444-a6d3609feed1","resolution":{"observed_at":"2026-08-05T04:27:53.149718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.153319Z","title":"Embodied agent interface: Benchmarking LLMs for embodied decision making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.153319Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:ee91054730f01d78f1c813994f28f2aa9eb8229fad85833e09cfaf28dd64e39a","observation_id":"d179ca96-d1d7-49ea-bcb0-a307c43329b0","resolution":{"observed_at":"2026-08-05T04:27:53.153319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.396428Z","title":"Llamo: Scaling pretrained language models for unified motion understanding and generation with continuous autoregressive tokens","venue":null,"work_id":"bc5fe461-e03a-4ed5-b239-5966444a5aff","year":2026},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.156338Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:95689e546ff670825bf8cfd174ca77aa595678e28a301189c59d349e19349a16","observation_id":"7b6ddff6-51e1-449c-b1cc-f2c41190a46e","resolution":{"observed_at":"2026-08-05T04:27:54.400013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.386916Z","title":"Genhsi: Controllable generation of human-scene interaction videos","venue":null,"work_id":"1bc1ca14-5380-4ae2-8c5a-416b45d094c5","year":2026},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.159675Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:f673776bb94346579af0b3c001a8612ab7e5212947cbe544f136c10011bf8897","observation_id":"eb01743d-6420-4798-a91b-78f6e8169446","resolution":{"observed_at":"2026-08-05T04:27:54.390146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.377462Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":"5b4220e1-5b6d-4025-a0d2-48fb5c1f6f9f","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.162728Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:e7d217db100c2095782cfac6cb7e50b702ba5fef8dccc056e52333825da52964","observation_id":"ee7b26eb-85ec-4bc1-b01a-50cc68fbbba5","resolution":{"observed_at":"2026-08-05T04:27:54.380611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10399","last_updated":"2025-08-14T06:56:16Z","snapshot_observed_at":"2026-08-10T06:32:19.882627Z","submitted_at":"2025-08-14T06:56:16Z","title":"Large Model Empowered Embodied AI: A Survey on Decision-Making and Embodied Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10399","snapshot_observed_at":"2026-08-05T04:27:53.165796Z","title":"Large model empowered embodied AI : A survey on decision-making and embodied learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.165796Z"},"links":{"cited_paper":"/paper/2508.10399","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:1e4336eaa199b038b3fbdf56192385c32d4ec4d4f4eb5060502617347e528493","observation_id":"dacf82d1-d40d-43ee-9137-9db50bbaaf7b","resolution":{"observed_at":"2026-08-05T04:27:53.165796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06327","last_updated":"2024-08-12T17:44:17Z","snapshot_observed_at":"2026-08-07T04:07:56.293097Z","submitted_at":"2024-08-12T17:44:17Z","title":"VisualAgentBench: Towards Large Multimodal Models as Visual Foundation Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06327","snapshot_observed_at":"2026-08-05T04:27:53.169379Z","title":"VisualAgentBench : Towards large multimodal models as visual foundation agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.169379Z"},"links":{"cited_paper":"/paper/2408.06327","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:045bfbc90f6a3f6fab64826b8a04ae7ce052e98bdb19658f24c4d4fbd83d6c7f","observation_id":"187746f4-ff8d-47eb-bbc6-8f18e60f9021","resolution":{"observed_at":"2026-08-05T04:27:53.169379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.172713Z","title":"A survey on vision-language-action models for embodied AI","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.172713Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:cc9e1e580f3d7dc0c2b1842dcbdc8edb5302ddaf0686955241828f1773a8abe9","observation_id":"6d128dc5-a29f-4764-a2f1-91c139c6ae33","resolution":{"observed_at":"2026-08-05T04:27:53.172713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-05T04:27:53.176051Z","title":"GR00T N1 : An open foundation model for generalist humanoid robots, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.176051Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:a6cd0402930b64989604623894d887dfa158fb0656cbdf1c2a641f1fa0c56d03","observation_id":"3fe402b2-5200-43fd-b1d5-c2e165f74644","resolution":{"observed_at":"2026-08-05T04:27:53.176051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.367737Z","title":"VirtualHome : Simulating household activities via programs","venue":null,"work_id":"88e48459-7885-4311-91b2-70d7f33d5c4b","year":2018},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.179226Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:0e4263d823586e993d76d15960813f105f8db7a9510ba12c2e6cb45167bbc710","observation_id":"def29d3b-0927-4b45-a1ce-5179a2add6b8","resolution":{"observed_at":"2026-08-05T04:27:54.371114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.358286Z","title":"Turner, Oleksandr Maksymets, Zsolt Kira, Mrinal Kalakrishnan, Jitendra Malik, Devendra Singh Chaplot, Unnat Jain, Dhruv Batra, Akshara Rai, and Roozbeh Mottaghi","venue":null,"work_id":"7b8b43c7-f963-46ef-a478-125cb334ab21","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.182274Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:a12ffe7c309ed26881f66d8ddb8b1ec0a2a4f73515db9ac5fff53225d9701824","observation_id":"c1c0467c-3d70-4ec6-b36b-dc28c675986e","resolution":{"observed_at":"2026-08-05T04:27:54.361693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.185235Z","title":"Habitat: A platform for embodied AI research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.185235Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:1b033342a23dc75a8d12813867bc1745818b09edea6308595144f233d2e1bb1b","observation_id":"185de51e-d99e-463b-ac14-77f4d674669e","resolution":{"observed_at":"2026-08-05T04:27:53.185235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.348931Z","title":"ALFRED : A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"6ab3e7b2-fdf9-4d25-874c-8811ef792a50","year":2020},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.188247Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:e4cea33d8d8e3d589c79373a0675a3b10a3a66795c1aab201d51f71ede172f87","observation_id":"fb40735d-4807-495d-8c7f-8efac0cf7ac8","resolution":{"observed_at":"2026-08-05T04:27:54.352196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.339291Z","title":"Bailando: 3 D dance generation by actor-critic GPT with choreographic memory","venue":null,"work_id":"1b468356-3f2b-470e-830f-3f19a15956bc","year":2022},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.192092Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:04728efc8b3100eff57939cdec64cdddc87956f82781597b3e2b5e4c05d7c755","observation_id":"f7444fe4-4ebb-4543-859f-c584b270ba71","resolution":{"observed_at":"2026-08-05T04:27:54.342645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.329806Z","title":"Bailando++: 3 D dance GPT with choreographic memory","venue":null,"work_id":"63dc6827-ec17-40b8-b99c-d758ef2c9904","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.195246Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:2a21240a801943d774009a8eca8cea0a757e4f98471ea062ee274a788810703f","observation_id":"4a14de67-bbf9-4f72-af83-dd893038eb70","resolution":{"observed_at":"2026-08-05T04:27:54.333238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.319361Z","title":"Duolando: Follower GPT with off-policy reinforcement learning for dance accompaniment","venue":null,"work_id":"7307812b-9ef6-4231-b77c-d26e54a63238","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.198233Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:1102dd76984b17e559a90e370aa9b7a590881e71b707b2eb13bd7dcfa101465b","observation_id":"0d3f88fb-894d-45f7-a2aa-3a0a19f60417","resolution":{"observed_at":"2026-08-05T04:27:54.323138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23778","last_updated":"2025-08-12T17:11:47Z","snapshot_observed_at":"2026-08-06T10:30:17.267603Z","submitted_at":"2025-07-31T17:58:33Z","title":"Half-Physics: Enabling Kinematic 3D Human Model with Physical Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23778","snapshot_observed_at":"2026-08-05T04:27:53.202268Z","title":"Half-physics: Enabling kinematic 3d human model with physical interactions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.202268Z"},"links":{"cited_paper":"/paper/2507.23778","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7018d08bb4d8631e82ba40e2b0672bbdba073303445effd41857b02509e528e9","observation_id":"6cd900b1-e2e8-4fcd-a52f-e75692678fb7","resolution":{"observed_at":"2026-08-05T04:27:53.202268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.309318Z","title":"Sadler, Wei-Lun Chao, and Yu Su","venue":null,"work_id":"63d4bac8-a9f2-46c1-84bc-030bb35170d3","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.205693Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:8466674f8eafabcfa254fc4463b00a6b673079f8f7d787b99f4dc273eaf6c43a","observation_id":"0a154a73-2625-4d63-96df-3574c6949044","resolution":{"observed_at":"2026-08-05T04:27:54.312655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.299240Z","title":"Chang, Zsolt Kira, Vladlen Koltun, Jitendra Malik, Manolis Savva, and Dhruv Batra","venue":null,"work_id":"befabeaa-72b6-4853-b923-81c4d44cbd0e","year":2021},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.208697Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:45fbdd1f41351ef8611c2b03ef9c582b4b95f6731d012f274eeab4fde8f55dd1","observation_id":"21f1e0cb-c8f9-4e01-beee-5ebcf618b83c","resolution":{"observed_at":"2026-08-05T04:27:54.302877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03186","last_updated":"2024-07-02T17:23:13Z","snapshot_observed_at":"2026-08-09T09:54:10.383680Z","submitted_at":"2024-03-05T18:22:29Z","title":"Cradle: Empowering Foundation Agents Towards General Computer Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03186","snapshot_observed_at":"2026-08-05T04:27:53.212403Z","title":"Cradle: Empowering foundation agents towards general computer control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.212403Z"},"links":{"cited_paper":"/paper/2403.03186","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7e35da7823d0845cc4154ebda8acc8a8e865ac9c23671deaae9b5dea2237b9ad","observation_id":"9979aaa9-cf98-430c-9d65-8678ed2ff504","resolution":{"observed_at":"2026-08-05T04:27:53.212403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.288722Z","title":null,"venue":null,"work_id":"9406b9a2-abed-4b13-acbf-2defd735dd65","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.215673Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:21025308293933ca36e66d9fe38f58d998b651c0ac47a3705a03962c59d06d5d","observation_id":"b70710c0-b998-42d1-b684-19c919fbbe9c","resolution":{"observed_at":"2026-08-05T04:27:54.292224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.278856Z","title":"Voyager: An open-ended embodied agent with large language models","venue":null,"work_id":"e77e68d8-d3ea-4005-8e0b-9b03b66d2545","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.218692Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:18a25255c0b330a6c24b4721843f5fc622284918faa3843df6d9dfda866073b9","observation_id":"1b7e799c-b6ee-494b-ac5a-b9ed8c0f6087","resolution":{"observed_at":"2026-08-05T04:27:54.282231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.269238Z","title":"Describe, explain, plan and select: Interactive planning with LLMs enables open-world multi-task agents","venue":null,"work_id":"194da7d2-150c-4069-b444-616a2bec9b72","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.221653Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:601fd62c2d5e4d4e5682e20429d7cf6039cea9f853eafac72497ca805afa64ad","observation_id":"3c074f47-6e14-450c-bf47-633fb999e084","resolution":{"observed_at":"2026-08-05T04:27:54.272653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.224699Z","title":"Text2interact: High-fidelity and diverse text-to-two-person interaction generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.224699Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:a9c500cbb5d2c4bbd11a839e4c9c7b01b76e767bcfa604e5bfa4c6b0b6966d9a","observation_id":"ad0f9f70-d0d0-453c-ba0c-88a6e417d331","resolution":{"observed_at":"2026-08-05T04:27:53.224699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.258855Z","title":"OmniControl : Control any joint at any time for human motion generation","venue":null,"work_id":"5d377c7d-8324-4eb3-bbf5-853b1bf52e07","year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.228626Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:a9477fe648f2b5a8b136e440f2bbc65150b860f5d934db18e12b3c932c95a2b6","observation_id":"ffcc9334-c785-4714-ba36-c1197e77bbba","resolution":{"observed_at":"2026-08-05T04:27:54.262342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14171","last_updated":"2025-07-02T21:00:36Z","snapshot_observed_at":"2026-08-10T08:02:13.965614Z","submitted_at":"2024-12-18T18:59:54Z","title":"Thinking in Space: How Multimodal Large Language Models See, Remember, and Recall Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14171","snapshot_observed_at":"2026-08-05T04:27:53.231578Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.231578Z"},"links":{"cited_paper":"/paper/2412.14171","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7a1e0596f7a3c73501f577acb019c36e2f8afb9843d63fd11fe31309893033f4","observation_id":"2e3d3914-2827-4669-838d-89d3bc8b3f73","resolution":{"observed_at":"2026-08-05T04:27:53.231578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.248365Z","title":"EmbodiedBench : Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":"486a3306-7f6c-40bd-ad33-b4cd6121660b","year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.234858Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:7115c77ad20e74ee210382a34304f376ce9127f22066f14e87e403dc1496370b","observation_id":"8e90fffc-49ea-4a6e-9185-94db7348aa6b","resolution":{"observed_at":"2026-08-05T04:27:54.251796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.237794Z","title":"PhysDiff : Physics-guided human motion diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.237794Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:729be18fc6d329f4b4912907c61ca85de79cdd365da825cd56006ef386f1715b","observation_id":"e3695817-2f10-44fd-987d-948aeb894aef","resolution":{"observed_at":"2026-08-05T04:27:53.237794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18134","last_updated":"2026-05-14T20:47:47Z","snapshot_observed_at":"2026-07-06T21:29:26.614513Z","submitted_at":"2025-05-23T17:43:27Z","title":"VideoGameBench: Can Vision-Language Models complete popular video games?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18134","snapshot_observed_at":"2026-08-05T04:27:53.240874Z","title":"Zhang, Thomas L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.240874Z"},"links":{"cited_paper":"/paper/2505.18134","citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:78b9ccc22d6a4b10f864f75072e6344c5ff736f2ea22cf6ca00d6684c4ccb2cb","observation_id":"abee7c03-b433-43e5-be08-9769e454be1c","resolution":{"observed_at":"2026-08-05T04:27:53.240874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:53.244099Z","title":"Egoreact: Egocentric video-driven 3d human reaction generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.244099Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:83227bb511f5c9fb44ed221f8ec083653173a958c0a0f363c86c45af53287f7c","observation_id":"ec644601-6dbe-46d6-83ec-76a2517f540c","resolution":{"observed_at":"2026-08-05T04:27:53.244099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.238454Z","title":"The wanderings of odysseus in 3d scenes","venue":null,"work_id":"98c99914-0fb7-4175-9225-e2de38c068a3","year":2022},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.247056Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:2fe6f4fbcb8515f5be18ced1ed6b4ffd1ccbc9fb11ac8f0e06e7e57f23cb1dcf","observation_id":"8832dcaf-2362-47ed-9ad6-5ffde4835f41","resolution":{"observed_at":"2026-08-05T04:27:54.241970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.228557Z","title":null,"venue":null,"work_id":"043c5ef4-fa4d-4ae2-8717-00a4e28841eb","year":2025},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.249978Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:49f2eb72f5c1ccef5ecdffdf3e7a8256a652d095f6936955d53599904ffdc487","observation_id":"59f315d1-c39d-4469-8de1-0cafdf9c5f23","resolution":{"observed_at":"2026-08-05T04:27:54.231966Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.218557Z","title":"Synthesizing diverse human motions in 3d indoor scenes","venue":null,"work_id":"1beb9ec3-431f-4a59-8a27-6123672d1b19","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.253873Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:20ed31a1008b2e7f7fb140dd022ee81a764a0d3e4186927ec4c81325e3c11539","observation_id":"e5da0000-ac44-4a54-998e-dc1069ad0619","resolution":{"observed_at":"2026-08-05T04:27:54.222112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:27:54.207876Z","title":"RT-2 : Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"aeff0eb3-a384-45d4-90a1-a271d6c14e26","year":2023},"citing_paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:53.257043Z"},"links":{"citing_paper":"/paper/2607.27180"},"observation_digest":"sha256:35d03550f34779b41c28d7016495370158d5af936cd91bea017dda56dc38f88a","observation_id":"81391ef6-c7d9-482e-8da4-8b14d2e44362","resolution":{"observed_at":"2026-08-05T04:27:54.211622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.27180","last_updated":"2026-08-03T21:59:13Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:09:39.032760Z","submitted_at":"2026-07-29T17:51:36Z","title":"HumanCLAW: Can Vision-Language Models Act Through a Body?"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":30},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2607.27180."}