{"as_of":"2026-08-08T14:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b94fbc4098cf522115d87c6f6d6b6f32a15d1a7650ad4c7954840acce0b2b246","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:54.732094Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:49:47.113836Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T21:16:14.446824Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-08-06T10:49:47.113836Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23478","last_updated":"2025-07-31T11:59:06Z","snapshot_observed_at":"2026-08-07T03:56:49.161093Z","submitted_at":"2025-07-31T11:59:06Z","title":"3D-R1: Enhancing Reasoning in 3D VLMs for Unified Scene Understanding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-06T10:49:47.113836Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2507.23478"},"observation_digest":"sha256:58b6923936d30c9217a218287bd6dd7be81331f1aacca0133698a71f1adafa9b","observation_id":"a03740dc-991f-46e0-b652-48ad2b8c165e","resolution":{"observed_at":"2026-08-06T10:49:47.113836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2506.17545 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-06T19:04:15.122942Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:c34db8e1ff689af5674db58613b50b4f3e93ef2ea33c08c0dd770317e0827207","observation_id":"dc1d0c90-7740-4d73-9f6f-43a60c62986c","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2604.02870","last_updated":"2026-04-03T08:37:08Z","snapshot_observed_at":"2026-08-01T03:43:05.117795Z","submitted_at":"2026-04-03T08:37:08Z","title":"Token Warping Helps MLLMs Look from Nearby Viewpoints","version":1},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-13T21:07:55.062113Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2604.02870"},"observation_digest":"sha256:80b39fbaec72e5a9f37b08efee81535015c29a04cc68ba95b474f35183892927","observation_id":"b6c9fc21-e333-4f3e-a41d-595aa2598a86","resolution":{"observed_at":"2026-05-13T21:08:17.348876Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2605.20165","last_updated":"2026-05-19T17:50:25Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:25Z","title":"CaMo: Camera Motion Grounded Evaluation and Training for Vision-Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-20T05:27:30.938311Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2605.20165"},"observation_digest":"sha256:1d07e48cb5d8460f3a4648155b60ba791a4f3506e8c5001ee75c9ff9a2173c15","observation_id":"f454b41e-fca4-4ae5-8299-3dba8be8881e","resolution":{"observed_at":"2026-05-20T05:28:04.506945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2606.01215","last_updated":"2026-06-29T08:50:50Z","snapshot_observed_at":"2026-08-06T11:12:11.961385Z","submitted_at":"2026-05-31T13:04:31Z","title":"Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:14:48.328093Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2606.01215"},"observation_digest":"sha256:dc2cfdd0f4f56fed23e8d5d5526418a26a3ba4ed82eb7d884990e065acf619e6","observation_id":"8b7f3447-d5a3-469b-a3dd-700edaba72ba","resolution":{"observed_at":"2026-07-01T21:16:14.448373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"cited_work":{"arxiv_id":"2506.17545","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.17545","snapshot_observed_at":"2026-07-01T21:16:14.446824Z","title":"arXiv preprint arXiv:2506.17545 , year=","venue":null,"work_id":"26c501ae-f807-4ee0-882b-c6f216e03ea9","year":null},"citing_paper":{"arxiv_id":"2606.01215","last_updated":"2026-06-29T08:50:50Z","snapshot_observed_at":"2026-08-06T11:12:11.961385Z","submitted_at":"2026-05-31T13:04:31Z","title":"Distilling Neuro-Symbolic Programs into 3D Multi-modal LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T11:26:47.680406Z"},"links":{"cited_paper":"/paper/2506.17545","citing_paper":"/paper/2606.01215"},"observation_digest":"sha256:8f844d76c66b50b4d1a6355f622d32ac11a68b2c4beacd471485c42df22390d0","observation_id":"5e2d5bd9-7531-4e87-b024-96a063370336","resolution":{"observed_at":"2026-06-30T11:34:38.162717Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17545/citation-record","integrity":"/paper/2506.17545/integrity","json":"/paper/2506.17545/citation-record.json","paper":"/paper/2506.17545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:01.474742Z","title":"Referit3d: Neural listeners for fine-grained 3d object identification in real-world scenes","venue":null,"work_id":"e20378c7-8011-4449-83e3-e3ec2d7527cb","year":2020},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.085085Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:fe4ae4d59b3dcb31faf4b92af09fcc8b32beec83816b31a131fd373823946582","observation_id":"ed8e7168-1445-4b8f-b31a-47ef08ff9f0a","resolution":{"observed_at":"2026-08-06T23:35:01.552537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.187260Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.187260Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3db280330cb03491a6c4bd3cca34d11722b2f5334769a632f06b5fb1c9f7b384","observation_id":"9226bca7-4524-49b8-8091-469a56ba4367","resolution":{"observed_at":"2026-08-06T23:34:50.187260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T23:34:50.293925Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.293925Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:4ce0774a1124a7bfc3f32df01e6a0bcf080dd5699025ae9852ed7a7017744acb","observation_id":"4ad1c548-4f4c-4ed3-a81e-26e7e230146d","resolution":{"observed_at":"2026-08-06T23:34:50.293925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08897","last_updated":"2022-01-12T08:19:29Z","snapshot_observed_at":"2026-07-06T12:09:19.763667Z","submitted_at":"2021-11-17T04:27:01Z","title":"ARKitScenes: A Diverse Real-World Dataset For 3D Indoor Scene Understanding Using Mobile RGB-D Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08897","snapshot_observed_at":"2026-08-06T23:34:50.424528Z","title":"Arkitscenes: A diverse real-world dataset for 3d indoor scene understanding using mobile rgb-d data","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.424528Z"},"links":{"cited_paper":"/paper/2111.08897","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:36ddf0ffd42f5a70e5bfa1ae2a04074669f39bd38c51066ea67d4be1df8ce95e","observation_id":"3061aad6-af57-490d-8a9f-02616bb75303","resolution":{"observed_at":"2026-08-06T23:34:50.424528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.502146Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.502146Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:0f66c42c23ab4c69d7a34dec1cc3ceb51f14239cabdb5c257f5de21dc84e6a90","observation_id":"a866976b-438a-45c9-a23b-79a47a285988","resolution":{"observed_at":"2026-08-06T23:34:50.502146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.590561Z","title":"Scanrefer: 3d object localization in rgb-d scans using natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.590561Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:2ef7638eafd7601ba760a849b7203bb9d46a9401234782e59305d4f516a4c317","observation_id":"8886deb5-0959-48ae-b47a-f5854c681229","resolution":{"observed_at":"2026-08-06T23:34:50.590561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:50.674777Z","title":"R1-v: Reinforcing super generalization ability in vision-language models with less than $3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.674777Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:cc67ab6e669e334b505f96beb2c4f61e73c2ce5b6798f83027772c61229ce896","observation_id":"962879af-d356-4703-98e2-e3a1c2052ec4","resolution":{"observed_at":"2026-08-06T23:34:50.674777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:01.084976Z","title":"Language conditioned spatial relation reasoning for 3d object grounding","venue":null,"work_id":"e92b4e80-04d0-434a-be02-219d6de8656f","year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.786284Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:6797a015dccf7d29a62c8794d7a0ce4d87abeb27a7db88ac65112abea341f331","observation_id":"279ff78f-65b3-41ff-b81e-d483adeb9d9a","resolution":{"observed_at":"2026-08-06T23:35:01.194834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.823293Z","title":"End-to-end 3d dense captioning with vote2cap-detr","venue":null,"work_id":"4fdeef04-852a-41e7-aa48-f305f72adb60","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:50.864776Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:943607d8c4cd9c75e3bfc9244102c4dffe912fc1d53556941cb96fd37ca80050","observation_id":"d0ab54f3-d442-4292-b066-44c289b2dfec","resolution":{"observed_at":"2026-08-06T23:35:00.957226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.571857Z","title":"V ote2cap-detr++: Decoupling localization and describing for end-to-end 3d dense captioning","venue":null,"work_id":"47e4ca97-c2d1-4c49-9d29-073c71f74b2b","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.009696Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:82b911162150d329d1c21c02dd433ee5ddcc6939ab5234ac69e83f85fec74ae4","observation_id":"285d4ae2-ca5a-45aa-8e85-414c5362e4b1","resolution":{"observed_at":"2026-08-06T23:35:00.706023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.266297Z","title":"Scan2cap: Context-aware dense captioning in rgb-d scans","venue":null,"work_id":"fed008e0-f15e-4311-b54d-51fcbfef89bf","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.112310Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:a46914943bd95b6c1d9e34feb7d138f5772e47d505b0971131259687e430dc33","observation_id":"28a4d20a-9564-41cb-88a2-23ecabea99b9","resolution":{"observed_at":"2026-08-06T23:35:00.402504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:35:00.109368Z","title":"Functionality understanding and segmentation in 3d scenes","venue":null,"work_id":"171d5b8f-872a-4c63-ab41-ec8a0e7e5c7c","year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.198878Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:38ad6fb690baf609daf6e778edebc6918a08d4bdde48c7d014fb022a7be1f3e4","observation_id":"28484630-a5d9-4b57-a6a9-8d67a508401c","resolution":{"observed_at":"2026-08-06T23:35:00.222262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.811335Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":"eea17bb8-99eb-40dd-bbe1-9ecc22c89de4","year":2017},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.302373Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:ea9dc27ebb5906e88770c32b502b25205f6d73f86a995e285c73af55638f4342","observation_id":"7e5f8c23-6c1c-48b2-b91e-11f77dea73ad","resolution":{"observed_at":"2026-08-06T23:34:59.955079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.544741Z","title":"Scenefun3d: fine-grained functionality and affordance understanding in 3d scenes","venue":null,"work_id":"9dc03280-083b-439a-831e-18bb40ee427a","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.373750Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:fff29770399c9de0aa99018c12edc81d3eae37f22c838ab7d6e7aace4d5a566a","observation_id":"b253733e-2e3f-400e-8a32-56f2b7b5b772","resolution":{"observed_at":"2026-08-06T23:34:59.666719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21776","last_updated":"2025-10-22T16:42:24Z","snapshot_observed_at":"2026-08-05T07:15:29.998948Z","submitted_at":"2025-03-27T17:59:51Z","title":"Video-R1: Reinforcing Video Reasoning in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21776","snapshot_observed_at":"2026-08-06T23:34:51.432004Z","title":"Video-r1: Reinforcing video reasoning in mllms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.432004Z"},"links":{"cited_paper":"/paper/2503.21776","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:46e17a5d6c5a9127593364d60a9727a89a906feaab226eb66bea611221c169a9","observation_id":"7acd6dc5-915f-4e15-b313-13cd14a70da8","resolution":{"observed_at":"2026-08-06T23:34:51.432004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11401","last_updated":"2024-03-22T18:52:51Z","snapshot_observed_at":"2026-08-06T11:39:56.281668Z","submitted_at":"2024-03-18T01:18:48Z","title":"Scene-LLM: Extending Language Model for 3D Visual Understanding and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11401","snapshot_observed_at":"2026-08-06T23:34:51.467823Z","title":"Scene-llm: Extending language model for 3d visual understanding and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.467823Z"},"links":{"cited_paper":"/paper/2403.11401","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:b25847d717e2d5f1e10817ec4899281f3d1737773279270b27f2c5909fd53880","observation_id":"d14b9ef8-5e7f-4d64-b888-4815955d8d59","resolution":{"observed_at":"2026-08-06T23:34:51.467823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:51.538593Z","title":"The ecological approach to visual perception: classic edition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.538593Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:b42feddb2d88c0e1768e701eba4f26931ecc4e6afac0f1cf9f0eede62c47b46d","observation_id":"7f54d23d-d774-4890-8f84-618e83889bcc","resolution":{"observed_at":"2026-08-06T23:34:51.538593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:34:51.580536Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.580536Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:1360c186272854a489e3a33a6d433a9ff0442c11b6de027f01014cde535336fc","observation_id":"f0353bd0-68cd-4d0e-b8aa-ee09a817f793","resolution":{"observed_at":"2026-08-06T23:34:51.580536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.311345Z","title":"Viewrefer: Grasp the multi-view knowledge for 3d visual grounding","venue":null,"work_id":"9218a869-3ab7-41f9-bde4-932b33879015","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.630120Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:fa0423b4bd23e50da11ff3d952bda935a5a66096a3dd761d99ad74870078cb88","observation_id":"005ced98-3c95-48b2-9856-325d9f985566","resolution":{"observed_at":"2026-08-06T23:34:59.393195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00615","last_updated":"2023-09-01T17:59:47Z","snapshot_observed_at":"2026-07-06T16:13:23.343694Z","submitted_at":"2023-09-01T17:59:47Z","title":"Point-Bind & Point-LLM: Aligning Point Cloud with Multi-modality for 3D Understanding, Generation, and Instruction Following","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00615","snapshot_observed_at":"2026-08-06T23:34:51.681819Z","title":"Point-bind & point-llm: Aligning point cloud with multi-modality for 3d understanding, generation, and instruction following","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.681819Z"},"links":{"cited_paper":"/paper/2309.00615","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:307585d16be46aec4c2b04536c337708e81e52baff37e9d928ef2bfbc7d4447f","observation_id":"b9d52e38-0094-444f-aa1f-65c4f97ce632","resolution":{"observed_at":"2026-08-06T23:34:51.681819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:59.077241Z","title":"Chat-scene: Bridging 3d scene and large language models with object identifiers","venue":null,"work_id":"69cee262-33d1-47fa-9404-72e6b275dbcc","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.737382Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:695e58eab4e237cd6edca7fff817ca98f2e868bb63beb6b8b5315d0348bd1cca","observation_id":"14668d63-bd0c-49fa-be77-36c52ef52330","resolution":{"observed_at":"2026-08-06T23:34:59.186224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-06T23:34:51.827382Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.827382Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:73aaa444138df8ae44aa1084521d0bc67e186e917474cbb267a6b92ba87966cb","observation_id":"8c1c1e4c-3e24-4bd9-b9eb-e8941c7b684e","resolution":{"observed_at":"2026-08-06T23:34:51.827382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:58.801544Z","title":"Text-guided graph neural networks for referring 3d instance segmentation","venue":null,"work_id":"217c2d03-b316-4ff8-b9be-2125a5224565","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.886696Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:463aefb8422363f77da9c6fc7c2fecfb023d120c28117291188e145997fc0dfb","observation_id":"353c30ed-8014-4f78-8788-fbacb505715b","resolution":{"observed_at":"2026-08-06T23:34:58.944257Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:58.610090Z","title":"Multi-view transformer for 3d visual grounding","venue":null,"work_id":"0958f335-af80-4b83-8abf-87e5340584da","year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:51.957621Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:075be6e6f1c3ff112b3f4879fc61f68765d0ebda5cacad6128f79eba2c685b14","observation_id":"fbc57c2c-1005-4aa4-8900-2cdb4a8f0385","resolution":{"observed_at":"2026-08-06T23:34:58.705701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-06T23:34:52.047794Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.047794Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:0da411944f00ca0d8340162c9593eedabc851ab237633c075871fbafd498713d","observation_id":"1e59bc04-336c-47d1-8f1d-34864794b21f","resolution":{"observed_at":"2026-08-06T23:34:52.047794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:58.321676Z","title":"Bottom up top down detection transformers for language grounding in images and point clouds","venue":null,"work_id":"adea0142-2228-495c-9bbc-6bf7e4fceff1","year":2022},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.121287Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:bf000bb30996afd1fb40b6a8e8ea29689234a0321b8ec8004da87f208823e33a","observation_id":"4c7ebe5b-73ec-46c8-b30a-254cba943b27","resolution":{"observed_at":"2026-08-06T23:34:58.471374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:52.196735Z","title":"Lerf: Language embedded radiance fields","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.196735Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:b59e5dd507cf5ca1a02a3389f65ece086685e3b64f97fe1c48d7f4de36aa634f","observation_id":"8b4f9729-5c84-4207-bc3a-ddc83b247789","resolution":{"observed_at":"2026-08-06T23:34:52.196735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-06T23:34:52.248369Z","title":"Videochat: Chat-centric video understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.248369Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3b28fff209b387af15244578ec2eaddf1680dd785b6b0ab5d9b092c73156a621","observation_id":"5ff9199b-effe-478f-8564-e0160dc4a7d3","resolution":{"observed_at":"2026-08-06T23:34:52.248369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04383","last_updated":"2025-05-29T14:14:03Z","snapshot_observed_at":"2026-08-02T23:47:39.393363Z","submitted_at":"2024-12-05T17:58:43Z","title":"SeeGround: See and Ground for Zero-Shot Open-Vocabulary 3D Visual Grounding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04383","snapshot_observed_at":"2026-08-06T23:34:52.340466Z","title":"Seeground: See and ground for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.340466Z"},"links":{"cited_paper":"/paper/2412.04383","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:9ce58e2384d0baccb85d4c702c899a8df39fa6e1eb45cc6a41f915e301a320eb","observation_id":"e234c58c-8045-4310-aedb-429afb0f45c3","resolution":{"observed_at":"2026-08-06T23:34:52.340466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:52.404835Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.404835Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:e905a9f79518a15101133e23548c1f00d37a6a9c015d1b86ae554235a8372bd7","observation_id":"5228ce6a-ba5c-47d6-9e27-6a5406917599","resolution":{"observed_at":"2026-08-06T23:34:52.404835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:57.910449Z","title":"Introducing openai o1","venue":null,"work_id":"e421fcef-fa1a-4c89-91cd-8ba9b4ac1a9d","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.525748Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:475869d437f1d3cb58432e4161b4066b1b2e54c73a9ce42c6b2e3357e04ec544","observation_id":"7ecf0d1f-e033-4411-999d-0edd71d31830","resolution":{"observed_at":"2026-08-06T23:34:58.064915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:57.469850Z","title":"Openscene: 3d scene understanding with open vocabularies","venue":null,"work_id":"4870a051-6372-4d6c-9738-8ed00178f126","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.613220Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:7272a133d1c68fa0ca598e7280043b5bb3c87c23777c6ae23632264751100b7c","observation_id":"1ce32298-8785-4299-8788-d676de5a47d2","resolution":{"observed_at":"2026-08-06T23:34:57.587518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:57.239259Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"49567f79-1473-4285-bab7-9d9006723e3a","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:52.768733Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:d4738297665258f3b2673098f717ec0ad024df2bc5e5d586aa98533832c6b04d","observation_id":"e405d8fc-4ca3-4d86-bc3f-00c087ee3ed9","resolution":{"observed_at":"2026-08-06T23:34:57.324756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-06T23:34:53.004776Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.004776Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:559e76d2900972a181d63269029cd0f847205f4b9650ea054ce34d5e79171bc1","observation_id":"69fe2126-b29c-4af0-95a6-dd0306ff9b4e","resolution":{"observed_at":"2026-08-06T23:34:53.004776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:53.075943Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.075943Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:ef2f79364103147cb3ceb327f0a66ba2d6364752953799d7393a0eebc5b27bae","observation_id":"c3fa0c00-fe7f-4026-abb8-a8b4ab348688","resolution":{"observed_at":"2026-08-06T23:34:53.075943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-06T23:34:53.147630Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.147630Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:f8f003c61ef8a73b3b0d3eabf24b13a18f69a8b53243e12f9dc456b7c76aa575","observation_id":"82a2a810-cd69-4659-bd7e-d28eb2c4c698","resolution":{"observed_at":"2026-08-06T23:34:53.147630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.959515Z","title":"Mask3d: Mask transformer for 3d semantic instance segmentation","venue":null,"work_id":"7e9fad54-4e67-4938-b9d9-8ae324a18f99","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.210278Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:1413a87a2fcc26f7372d3feec1501d8ed5835409e617b3599ef12adfb74f7375","observation_id":"4bd2fa6a-d9fb-41b5-a809-f01b28e6e8d0","resolution":{"observed_at":"2026-08-06T23:34:57.078831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-06T23:34:53.304750Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.304750Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:ef3b3934db81755352240a568b808e0f1773027ee68430a6cfcdf251701fb353","observation_id":"45df17a8-1db0-49b3-bf58-476513600938","resolution":{"observed_at":"2026-08-06T23:34:53.304750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.804771Z","title":"Chatgpt for robotics: Design principles and model abilities","venue":null,"work_id":"57f5f256-187f-412d-8fb8-a22fd0f96a4f","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.418030Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:da40d614fb1e9a6af812f0e85665c4744d2de2bfd43b062034ded324a0e8b6f3","observation_id":"b2563195-10da-4789-9fb6-4383212f9d6a","resolution":{"observed_at":"2026-08-06T23:34:56.868146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03290","last_updated":"2025-08-21T05:15:19Z","snapshot_observed_at":"2026-08-02T03:09:09.488305Z","submitted_at":"2024-10-04T10:04:37Z","title":"Grounded-VideoLLM: Sharpening Fine-grained Temporal Grounding in Video Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03290","snapshot_observed_at":"2026-08-06T23:34:53.529692Z","title":"Grounded-videollm: Sharpening fine-grained temporal grounding in video large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.529692Z"},"links":{"cited_paper":"/paper/2410.03290","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3e52564d3be5a04c3a7dea75d203474b1ff6c747c120dc3c9d110dca62745c83","observation_id":"67ca3aea-21d9-42f0-82e8-0d874e7f886f","resolution":{"observed_at":"2026-08-06T23:34:53.529692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13377","last_updated":"2025-06-29T08:11:35Z","snapshot_observed_at":"2026-08-02T21:01:10.455745Z","submitted_at":"2025-03-17T17:04:20Z","title":"Time-R1: Post-Training Large Vision Language Model for Temporal Video Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13377","snapshot_observed_at":"2026-08-06T23:34:53.624919Z","title":"Timezero: Temporal video grounding with reasoning-guided lvlm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.624919Z"},"links":{"cited_paper":"/paper/2503.13377","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:7ade7fef5b4cff15b0357702083cf79b880652e2c6ee4af8bdb0bdd8453cdc25","observation_id":"78530adf-24b4-4652-b6b5-b232e77c5410","resolution":{"observed_at":"2026-08-06T23:34:53.624919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.560619Z","title":"Distilling coarse-to-fine semantic matching knowledge for weakly supervised 3d visual grounding","venue":null,"work_id":"43e83614-fa11-4bc7-8bad-b24b58cd124b","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.702757Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:f5cf0419847b22c101c74cfeb6963226bbf08ee611fcd81013eafa9a070be892","observation_id":"6bf266ad-34ce-4b37-a064-63a11da1e28c","resolution":{"observed_at":"2026-08-06T23:34:56.650264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.273796Z","title":"Pointllm: Empower- ing large language models to understand point clouds","venue":null,"work_id":"26857b56-d32d-4d14-a70e-c6a9ceb5262d","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.845949Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:c8fbd300bb2ffd1b31f00f76ede2accc3c232965d0e11ef30997a8fc2ad8c368","observation_id":"f3770be4-4d4c-46c4-ab61-fa2d0697575d","resolution":{"observed_at":"2026-08-06T23:34:56.416286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:56.009373Z","title":"Instancerefer: Cooperative holistic understanding for visual grounding on point clouds through instance multi-level contextual referring","venue":null,"work_id":"fdbd78f1-4b6e-43bb-9045-b2b6e15ab166","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:53.974587Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:229ba015dbf9ee0b5231fbb989f3c4f666298a3af3448e4f98346771c095a7ec","observation_id":"05da5af7-46a8-4a2d-af28-13db6388021c","resolution":{"observed_at":"2026-08-06T23:34:56.111190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:54.128620Z","title":"Visual programming for zero-shot open-vocabulary 3d visual grounding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.128620Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:26640b62caefa1882b4229c3f9007111df01f14a38c4d3ffd8be5336bf94da3a","observation_id":"7a2cf311-ede6-42a4-a5a4-ce6053d4b62d","resolution":{"observed_at":"2026-08-06T23:34:54.128620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.885257Z","title":"Empowering large language models with 3d situation awareness","venue":null,"work_id":"31352916-44ef-4bee-b0c4-4f7c1a74fd2f","year":2025},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.272841Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:61360e06b8a35c3a2ca9321f5e9158b1e13fc87b988bd15fd734aebd58e92f39","observation_id":"1a39f9cf-49bf-44fc-bc8c-6d39f64c550d","resolution":{"observed_at":"2026-08-06T23:34:55.935976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.703463Z","title":"3dvg-transformer: Relation modeling for visual grounding on point clouds","venue":null,"work_id":"34bc4b2d-abaa-44fc-ae24-08c19db97857","year":2021},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.384753Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:f06fc4699ff394322fa33c4134b1f1320a6857abb8e63a5a10129df5ff27bd6c","observation_id":"494884c1-1a1c-49cf-a2f6-49713e22119b","resolution":{"observed_at":"2026-08-06T23:34:55.760801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-06T09:32:33.122628Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-06T23:34:54.466311Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.466311Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:728f8345d83b2674e5c95af013f9fff0128c52b57427d071975f9e11fbd89118","observation_id":"3df51210-40c0-4bee-ae88-a9c4dfca88e0","resolution":{"observed_at":"2026-08-06T23:34:54.466311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06773","last_updated":"2023-10-10T16:49:21Z","snapshot_observed_at":"2026-08-07T09:42:09.287521Z","submitted_at":"2023-10-10T16:49:21Z","title":"Uni3D: Exploring Unified 3D Representation at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06773","snapshot_observed_at":"2026-08-06T23:34:54.555746Z","title":"Uni3d: Exploring unified 3d representation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.555746Z"},"links":{"cited_paper":"/paper/2310.06773","citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:3a8d3b877b9ca34331121644602ca7001185f3fcbf9dbfa23dbc16071f81702f","observation_id":"ca3eb5f5-d067-4075-b7e1-c7514176b17b","resolution":{"observed_at":"2026-08-06T23:34:54.555746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.511421Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"4ef84d5b-3261-40a9-8123-96536510a93a","year":2023},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.649230Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:2f6f8564a617a2f75f95df579f908475d927342f4af13af53eec042861fc6c0b","observation_id":"64d34c28-84ba-4862-84ad-17a14bb5ecd8","resolution":{"observed_at":"2026-08-06T23:34:55.621691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:55.330323Z","title":"[EVENT]\" in the video, determine the precise time period of the occurrence of the object. Provide the start and end times (in seconds, precise to one decimal place) in the format","venue":null,"work_id":"7ed241ba-2a7a-4080-b212-5dd71c0d8e7a","year":2024},"citing_paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:54.732094Z"},"links":{"citing_paper":"/paper/2506.17545"},"observation_digest":"sha256:b7181da268fd587014e6fcabf949cb96a19123da8b9a84c21996ef693313026f","observation_id":"ad927a9d-0c9f-4e92-80ff-8f16ffaec360","resolution":{"observed_at":"2026-08-06T23:34:55.426439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17545","last_updated":"2025-06-21T02:29:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:28:15.848219Z","submitted_at":"2025-06-21T02:29:10Z","title":"Scene-R1: Video-Grounded Large Language Models for 3D Scene Reasoning without 3D Annotations"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 6 inbound Pith citation observations for arXiv:2506.17545."}