{"as_of":"2026-08-17T05:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8cdf21195f36fbddfd4da8e7f282c7985b790c6fc89ab6b341f6479082fcaa65","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:27:01.485780Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.08839/citation-record","integrity":"/paper/2608.08839/integrity","json":"/paper/2608.08839/citation-record.json","paper":"/paper/2608.08839"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-08-16T22:05:17.066613Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13030","snapshot_observed_at":"2026-08-14T04:27:01.187503Z","title":"Motus: A unified latent action world model.arXiv preprint arXiv:2512.13030,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.187503Z"},"links":{"cited_paper":"/paper/2512.13030","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:beffde940df2f66617e02f5d76413bf722cfaf873da6a0bb983808f9ac985478","observation_id":"9c4cdf7b-882d-406c-b4ef-208ea7513bda","resolution":{"observed_at":"2026-08-14T04:27:01.187503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.15607/rss.2025.xxi.01","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.528465Z","title":"π0.5: a vision-language-action model with open-world generalization","venue":null,"work_id":"f4422bf4-4dc4-4730-8c37-da048903f40e","year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.213845Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:b2d3aec88a430fe196c9c4a4e93ef0dc30db5520e3d57d2bd4aea34963da4671","observation_id":"45bff85b-e0d3-4f0d-a057-d9580aacb76a","resolution":{"observed_at":"2026-08-14T04:27:01.535013Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-08-13T10:05:34.967093Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-14T04:27:01.246456Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.246456Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:9844d40c8685c6f4837da26a81c056ee86dc62bca1fe7a851bbdeb5fa95b32e8","observation_id":"94a0bf8e-e965-4e35-bea9-f4996e576e80","resolution":{"observed_at":"2026-08-14T04:27:01.246456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-12T23:18:51.506083Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-14T04:27:01.271186Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation.arXiv preprint arXiv:2410.06158,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.271186Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:5de9344cd85dad6818d2d2c1458678458cb671c608f14f7f284ee7a7b7ff587b","observation_id":"45301073-61e7-4430-a514-1d0e169dd403","resolution":{"observed_at":"2026-08-14T04:27:01.271186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-14T04:27:01.307886Z","title":"Ltx-video: Realtime video latent diffusion.arXiv preprint arXiv:2501.00103,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.307886Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:43c2d9568743b83a56f95210a8642f00ab945747b5d507f52fe09a4c0c803d36","observation_id":"41ef3d8a-b30a-4df4-a51e-6c1d3f278632","resolution":{"observed_at":"2026-08-14T04:27:01.307886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-14T03:25:49.528763Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-14T04:27:01.313720Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks.arXiv preprint arXiv:2504.19854,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.313720Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:037ae7568396a66b363d0e9ceb019ab638c1aabdf09d880317248e17bb040dd3","observation_id":"65d62c5e-809e-4f91-b6a6-4f2e9e8bfd07","resolution":{"observed_at":"2026-08-14T04:27:01.313720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.318910Z","title":"Rynnvla-001: Using human demonstrations to improve robot manipulation.arXiv preprint arXiv:2509.15212,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.318910Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:9dad86d416163e0ebb6d375fc7f73a37c53963286863d57856be8d3a2a0a0163","observation_id":"6c097634-f4f9-47eb-a59c-167333b337e8","resolution":{"observed_at":"2026-08-14T04:27:01.318910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-08-13T22:25:02.123367Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-08-14T04:27:01.322000Z","title":"2025.XXI.017","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.322000Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:5278cccd0c4e7dd055eac0ed55a856a24ccc4caded64517337c8caf32a1ab7c2","observation_id":"5647a053-0c1a-4c39-bb99-f593781aed6e","resolution":{"observed_at":"2026-08-14T04:27:01.322000Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00200","last_updated":"2025-04-24T20:02:43Z","snapshot_observed_at":"2026-08-14T06:14:38.487820Z","submitted_at":"2025-02-28T21:38:17Z","title":"Unified Video Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00200","snapshot_observed_at":"2026-08-14T04:27:01.332559Z","title":"Unified video action model.arXiv preprint arXiv:2503.00200,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.332559Z"},"links":{"cited_paper":"/paper/2503.00200","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:2e95765b2f4a5d05d1312bccef6f12cb4fde29e3893524465ed36fe6a6f76321","observation_id":"6f83a792-6cb8-4ded-8659-693c7593dfbd","resolution":{"observed_at":"2026-08-14T04:27:01.332559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-08-14T13:55:25.823113Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-14T04:27:01.336990Z","title":"Genie envisioner: A unified world foundation platform for robotic manipulation.arXiv preprint arXiv:2508.05635,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.336990Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:08d80a82d6d4e0359d43f6adf35c5a028bf89ec340bee98fcfcdf50c3658e950","observation_id":"f5fa2be7-2580-4e88-9baa-cdbd2005f8e1","resolution":{"observed_at":"2026-08-14T04:27:01.336990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-14T04:27:01.346136Z","title":"Depth anything 3: Recovering the visual space from any views.arXiv preprint arXiv:2511.10647,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.346136Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:e6b4df99d2fb6dd06e18bf2c23d9391f2f204b251ba6d68e01f5a469bcafa0cc","observation_id":"d0d199e1-abd0-4e4c-80c8-412f57e1ed56","resolution":{"observed_at":"2026-08-14T04:27:01.346136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06481","last_updated":"2026-05-07T16:06:08Z","snapshot_observed_at":"2026-08-11T07:38:44.239882Z","submitted_at":"2026-05-07T16:06:08Z","title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06481","snapshot_observed_at":"2026-08-14T04:27:01.356892Z","title":"Oa-wam: Object-addressable world action model for robust robot manipulation.arXiv preprint arXiv:2605.06481,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.356892Z"},"links":{"cited_paper":"/paper/2605.06481","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:e0c9493da88371984307456fa457bae785343353bfb202d8af56c34e0c2f8abb","observation_id":"73a90e82-f850-41f5-a373-264846f5716c","resolution":{"observed_at":"2026-08-14T04:27:01.356892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.19683","last_updated":"2026-04-22T17:44:56Z","snapshot_observed_at":"2026-08-15T06:57:44.935343Z","submitted_at":"2026-04-21T17:05:37Z","title":"Mask World Model: Predicting What Matters for Robust Robot Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.19683","snapshot_observed_at":"2026-08-14T04:27:01.365387Z","title":"Mask world model: Predicting what matters for robust robot policy learning.arXiv preprint arXiv:2604.19683,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.365387Z"},"links":{"cited_paper":"/paper/2604.19683","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:4363a1d9c3c8dae86dfa46e1fa37bb51e37b8925bebc1c196802a961aca6b779","observation_id":"416ca311-f861-4115-88b2-4b45c2ff0c0c","resolution":{"observed_at":"2026-08-14T04:27:01.365387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.378434Z","title":"Dit4dit: Jointly modeling video dynamics and actions for generalizable robot control.arXiv preprint arXiv:2603.10448,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.378434Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:b1f4f2b29b77c8c445b85f17b455499ac90bf5b472ad8dad199b1d7fd497f138","observation_id":"4f851e50-8e62-45e1-a400-2bce99d00a32","resolution":{"observed_at":"2026-08-14T04:27:01.378434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-14T04:27:01.382735Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.382735Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:0869c28678ddc448fda4297a17091780f3705e6c6f0ca5371bd583286e985724","observation_id":"df5a5daf-c291-4eb0-8c32-af1a286e8981","resolution":{"observed_at":"2026-08-14T04:27:01.382735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-14T04:27:01.415201Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.415201Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:80c996cc4cfdca2a9af1051a64edf7d13888f6edb3090430dcee7a5d5b5e0532","observation_id":"98d7f6f8-d680-4a1a-a310-45b741db355f","resolution":{"observed_at":"2026-08-14T04:27:01.415201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.436760Z","title":"S-VAM: Shortcut video-action model by self-distilling geometric and semantic foresight.arXiv preprint arXiv:2603.16195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.436760Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:11db7e6987be5aa3acddeee2c5f44cbe776f875a77048a80b286bb969c4c0455","observation_id":"27bcc08b-6877-4a20-ad7d-935a2ad0db66","resolution":{"observed_at":"2026-08-14T04:27:01.436760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.13515","last_updated":"2026-06-11T16:02:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-11T16:02:42Z","title":"MaskWAM: Unifying Mask Prompting and Prediction for World-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.13515","snapshot_observed_at":"2026-08-14T04:27:01.450632Z","title":"Maskwam: Unifying mask prompting and prediction for world-action models.arXiv preprint arXiv:2606.13515,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.450632Z"},"links":{"cited_paper":"/paper/2606.13515","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:8881d98d3f9e7724ff13f980e04c9e8e96664a8f5cd61623e88fb59d82343d4e","observation_id":"0c20bc1a-e422-464d-878c-7855c0698104","resolution":{"observed_at":"2026-08-14T04:27:01.450632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-08-15T14:30:41.084242Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-08-14T04:27:01.455192Z","title":"Fast-wam: Do world action models need test-time future imagination?arXiv preprint arXiv:2603.16666,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.455192Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:3d625fc41b326217d6af0f9213cdbac97389ba42cf86ef356e6334c6a9f97f31","observation_id":"f19e0cf9-3b5d-42c8-8b9a-e98d39b885b3","resolution":{"observed_at":"2026-08-14T04:27:01.455192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.462371Z","title":"FlowVLA: Visual chain of thought-based motion reasoning for vision-language-action models.arXiv preprint arXiv:2508.18269,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.462371Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:f9d7a62b1c613b8d52ae8e123b39ed6f40e5b3da15b6644138b702e60daf6509","observation_id":"ea6ecb71-d1cd-4df9-b9cb-08a5ea330434","resolution":{"observed_at":"2026-08-14T04:27:01.462371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:27:01.467787Z","title":"DualCoT-VLA: Visual-linguistic chain of thought via parallel reasoning for vision-language-action models.arXiv preprint arXiv:2603.22280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.467787Z"},"links":{"citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:a06d6c30607f58c43c121b4eee28a481673ec5c953bb850d798b3c13e6abf4e7","observation_id":"01a340b4-28fb-446a-a0ba-9d9f01afd41b","resolution":{"observed_at":"2026-08-14T04:27:01.467787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02792","last_updated":"2025-05-23T00:47:24Z","snapshot_observed_at":"2026-08-10T02:54:28.264405Z","submitted_at":"2025-04-03T17:38:59Z","title":"Unified World Models: Coupling Video and Action Diffusion for Pretraining on Large Robotic Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.02792","snapshot_observed_at":"2026-08-14T04:27:01.479963Z","title":"Unified world models: Coupling video and action diffusion for pretraining on large robotic datasets.arXiv preprint arXiv:2504.02792,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.479963Z"},"links":{"cited_paper":"/paper/2504.02792","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:d847e4b5d4e5024b761d388db1ee3ae0c4e19d7b2342685b975159dc28151205","observation_id":"c3d68a9d-5b10-45b2-81f9-802e6f4f655e","resolution":{"observed_at":"2026-08-14T04:27:01.479963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04927","last_updated":"2026-07-06T10:57:01Z","snapshot_observed_at":"2026-08-14T09:59:31.893846Z","submitted_at":"2026-07-06T10:57:01Z","title":"DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation","version":1},"cited_work":{"arxiv_id":"2607.04927","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.04927","snapshot_observed_at":"2026-08-14T04:27:01.554266Z","title":"DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation","venue":"cs.RO","work_id":"0d74b52b-3d57-4e7b-956d-902d705b5442","year":2026},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.485780Z"},"links":{"cited_paper":"/paper/2607.04927","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:fc38d47f0e98fd999190e3c8371380359c27c41aeadc884a98b500d07c324267","observation_id":"e357fa73-6940-4db3-bb28-3a4ac4759dd9","resolution":{"observed_at":"2026-08-14T04:27:01.558768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10333","last_updated":"2025-08-14T04:20:19Z","snapshot_observed_at":"2026-08-05T20:32:29.550851Z","submitted_at":"2025-08-14T04:20:19Z","title":"ReconVLA: Reconstructive Vision-Language-Action Model as Effective Robot Perceiver","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10333","snapshot_observed_at":"2026-08-14T04:27:01.402929Z","title":"ReconVLA: Reconstructive vision-language-action model as effective robot perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.402929Z"},"links":{"cited_paper":"/paper/2508.10333","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:e7a16999ed6d4b1ff08d7da9c9412d5a0b9d0117489ac9968959055a55bcf094","observation_id":"6a50ebe8-ed3b-405d-baff-8aefda09b651","resolution":{"observed_at":"2026-08-14T04:27:01.402929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06111","last_updated":"2025-11-03T11:52:57Z","snapshot_observed_at":"2026-08-09T00:51:47.897197Z","submitted_at":"2025-05-09T15:11:13Z","title":"UniVLA: Learning to Act Anywhere with Task-centric Latent Actions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06111","snapshot_observed_at":"2026-08-14T04:27:01.238908Z","title":"Univla: Learning to act anywhere with task-centric latent actions.arXiv preprint arXiv:2505.06111,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.238908Z"},"links":{"cited_paper":"/paper/2505.06111","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:fe08f5663d158d4a07d0788882202a3c7ccb665a02093770abe72d6c774b7a04","observation_id":"7cca0c34-2788-4da8-bdce-8b05e6dbe381","resolution":{"observed_at":"2026-08-14T04:27:01.238908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.13626","last_updated":"2025-12-26T12:19:56Z","snapshot_observed_at":"2026-08-13T00:59:48.824306Z","submitted_at":"2025-10-15T14:51:36Z","title":"LIBERO-Plus: In-depth Robustness Analysis of Vision-Language-Action Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.13626","snapshot_observed_at":"2026-08-14T04:27:01.290804Z","title":"Libero-plus: In-depth robustness analysis of vision-language-action models.arXiv preprint arXiv:2510.13626,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.290804Z"},"links":{"cited_paper":"/paper/2510.13626","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:418c5b82908d5575bd10c560523f2980198faf29a6f5f5082e80a173dfb1ff4c","observation_id":"b1b0234c-48e2-4d0c-8b5f-f201e595275f","resolution":{"observed_at":"2026-08-14T04:27:01.290804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-14T04:27:01.206906Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.206906Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:37210d0ce842ec0ada46ba87ae29bdc6e405217294ba4897d9f630a27ce5fcca","observation_id":"5e761f15-8856-4ccf-af6c-764da0415a20","resolution":{"observed_at":"2026-08-14T04:27:01.206906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-08-14T04:27:01.327148Z","title":"Causal world modeling for robot control.arXiv preprint arXiv:2601.21998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-14T04:27:01.327148Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2608.08839"},"observation_digest":"sha256:77a85143155c7846dd326ccc0e263c53da4ee7768036e3b479b7b92d62bdb88a","observation_id":"3c97199d-61b9-4aae-a5e6-e6f88464c71c","resolution":{"observed_at":"2026-08-14T04:27:01.327148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.08839","last_updated":"2026-08-09T17:59:35Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-16T02:32:53.115860Z","submitted_at":"2026-08-09T17:59:35Z","title":"SG-WAM: Text-Grounded and Spatial-aware Semantic Guidance for World-Action Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2608.08839."}