{"as_of":"2026-08-08T05:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d358b5b69b02c70a0e0e9a4a86bd5349353a46d777b63703575029064448e783","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T13:09:12.916287Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.03763/citation-record","integrity":"/paper/2608.03763/integrity","json":"/paper/2608.03763/citation-record.json","paper":"/paper/2608.03763"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:08.802492Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.802492Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:2d74994ea4a0aee37a60d5a257fb6df2208859ddfc81641a5041fb7506b344f2","observation_id":"05e0a308-58c4-4ed5-afb1-4d9095c5fb83","resolution":{"observed_at":"2026-08-05T13:09:08.802492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:17.257918Z","title":null,"venue":null,"work_id":"09601f3c-d550-46de-abb6-24b9d0200290","year":null},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.847810Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:f20f583f0edd137927322f3aa624c7ba759297bd6fb34d023107afaf5d6d76e7","observation_id":"f5e00759-53f9-417b-93e3-fb05a1e17d1e","resolution":{"observed_at":"2026-08-05T13:09:17.398556Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:08.945497Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.945497Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:4e3eaa88416d1e79b89440c1705485d9a3a6f3dcf42dc08f2b8142dda8057a5c","observation_id":"3bd98ff8-b2bc-42db-9548-91f6542de475","resolution":{"observed_at":"2026-08-05T13:09:08.945497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:09.034257Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.034257Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:8947e008fcff29fc8d3847c629a69580384b2ca9a7be4f1b799d5c25aca012b3","observation_id":"7fcd970c-6e41-4cea-b238-79cf620c3c49","resolution":{"observed_at":"2026-08-05T13:09:09.034257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:09.224695Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.224695Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:6f584d139257d9aeeb8015b05ed8f197a3d12fcebec3dc9790d27a387449a531","observation_id":"ab40dc77-2cca-401d-8879-a5fc4ad00a42","resolution":{"observed_at":"2026-08-05T13:09:09.224695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T13:09:09.127829Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.127829Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:8078c26e9798fa8f4bafee1cf127ac74855df2966ae4660f2e8b70f176c35654","observation_id":"ed57359b-94a5-4ec4-977a-416ab34fb76b","resolution":{"observed_at":"2026-08-05T13:09:09.127829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:16.908546Z","title":null,"venue":null,"work_id":"f25e2f2e-6a42-449e-8587-47b26e76600b","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.387652Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:c6a9933177e49e9abfb629bffef0eb5bc9281944ed432d892a27330798d63b19","observation_id":"f5cce69b-16ba-49ab-b212-a11cb55d0a6e","resolution":{"observed_at":"2026-08-05T13:09:17.065936Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:09.294232Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.294232Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:bbb944980b9dd1f4af3f09ccbb246eb582617a6341e460ce3cbce2c51a2e3ae7","observation_id":"b9eb7da9-5425-40a9-aa3c-4edb2bb88907","resolution":{"observed_at":"2026-08-05T13:09:09.294232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:09.574584Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.574584Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:b63b9bb364347b436896087d1fe2103da4a57924efbf66ebe8ec503d668eed4f","observation_id":"d2e8e5ac-e50e-44c3-98cb-8d03187b8263","resolution":{"observed_at":"2026-08-05T13:09:09.574584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:16.592285Z","title":null,"venue":null,"work_id":"c19c9a53-4a96-4868-9a06-5b791454ae67","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.466058Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:a5264ce3b249cde6e47e5dba24560b071a8fe4ff672498e07e8880df0d73d2c5","observation_id":"37abc3b5-0fd8-492f-98e7-9c4d3a9f34cf","resolution":{"observed_at":"2026-08-05T13:09:16.741689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:16.147231Z","title":null,"venue":null,"work_id":"907b89a7-5f8b-4501-948c-651a2c2bcc6e","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.800632Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:94c36b4f454512ef9b4a571a9616f03e4cad6ea0dda89fc6a7752860deb13175","observation_id":"cdac0f11-740c-4140-bf36-0bf60abe8eaa","resolution":{"observed_at":"2026-08-05T13:09:16.236884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:16.333994Z","title":null,"venue":null,"work_id":"6b6b186c-ff25-4756-bd63-5fad1b2c870d","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.691918Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:6c231b7139c227e68ff6851976a7340cd50a2e109873b9df9546a5f676495fd7","observation_id":"adbddf60-d26a-4601-98c2-a1199d5b403d","resolution":{"observed_at":"2026-08-05T13:09:16.410399Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:15.795528Z","title":null,"venue":null,"work_id":"308de210-abfe-4a47-b27f-ce1dd07e82d1","year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.928648Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:ff58e408c7af3729b6379cb267155563c56b3b240e8f2661182dde99cada7f50","observation_id":"ba133e20-e2db-48c2-b166-e8819af7bb72","resolution":{"observed_at":"2026-08-05T13:09:15.851205Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:15.954643Z","title":null,"venue":null,"work_id":"9c913a96-7bd9-446a-a079-f0c45e976337","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:09.871059Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:261843cc07ef156b609b12e871e0926edf9fa2652193565eb4cdfc937edda708","observation_id":"01344cde-a65e-4983-b2dc-82f560afe9ca","resolution":{"observed_at":"2026-08-05T13:09:16.067425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:10.132195Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.132195Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:d9fc3b8073a0c9f4ee39c3a94e8956b5f95f2cf0abcfe88a8740627685b77359","observation_id":"f9989a79-a979-42a8-b530-53a66e9063ad","resolution":{"observed_at":"2026-08-05T13:09:10.132195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21924","last_updated":"2025-06-27T05:34:57Z","snapshot_observed_at":"2026-08-06T22:13:16.334528Z","submitted_at":"2025-06-27T05:34:57Z","title":"SPAZER: Spatial-Semantic Progressive Reasoning Agent for Zero-shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21924","snapshot_observed_at":"2026-08-05T13:09:10.035767Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.035767Z"},"links":{"cited_paper":"/paper/2506.21924","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:98a787b6346998177cf258f472ec4731e0b84a407abe714eed06cee398eb5bf0","observation_id":"9bbe3314-7a18-4060-acb3-3f65c5bd8846","resolution":{"observed_at":"2026-08-05T13:09:10.035767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:15.657860Z","title":null,"venue":null,"work_id":"1db4d5a9-9ed5-4d0c-9f56-ab1823bf0c60","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.315706Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:16be8742e5d7c4c2e2a8214c36c0655d8aefca3ff3ec9bdf805f986c2ab859fe","observation_id":"9d45281e-cd20-4443-90b2-403d669d3ffb","resolution":{"observed_at":"2026-08-05T13:09:15.725353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22436","last_updated":"2025-05-26T03:12:12Z","snapshot_observed_at":"2026-08-07T16:30:15.411320Z","submitted_at":"2025-03-28T13:55:16Z","title":"NuGrounding: A Multi-View 3D Visual Grounding Framework in Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22436","snapshot_observed_at":"2026-08-05T13:09:10.241484Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.241484Z"},"links":{"cited_paper":"/paper/2503.22436","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:2fb9fdc0ff791e54a970ccf9b28790cbcb3d6898e8a1474256e0670fc9024a09","observation_id":"4cb71d80-f800-4211-8c04-b9b3357e6cc9","resolution":{"observed_at":"2026-08-05T13:09:10.241484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:10.513944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.513944Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:b6be0f6088fd5bb42ff596f848bb66d1881253005c46c25a414aba5b8736b1b8","observation_id":"dd48d301-a562-422e-9ac8-1afdfac10ffb","resolution":{"observed_at":"2026-08-05T13:09:10.513944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:15.465950Z","title":null,"venue":null,"work_id":"a2e62d90-4711-4790-9a9c-8a1a8b253446","year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.440057Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:034b7c75a5ff39963afc90b6445cbacec7b7f933c051c43817b79614b779c6a9","observation_id":"21f82560-8454-422c-b5b6-819bc6a8a82a","resolution":{"observed_at":"2026-08-05T13:09:15.542855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:15.237034Z","title":null,"venue":null,"work_id":"768f118c-4c36-4f71-b1d0-e6ded31ccce4","year":2026},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.684127Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:54fb2d53aef3e331c7ac2cff88779e0f73a9bc568e81c66cd8e5727d2cbb81d9","observation_id":"0cdae5de-09d3-4ace-915c-812998fa828c","resolution":{"observed_at":"2026-08-05T13:09:15.325527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T13:09:10.620522Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.620522Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:cc6060968cb2b4672e70ecedd73f3ac831c239109f2b321404abd2ab1f8b7077","observation_id":"bb49c437-56fe-4ef2-a3cd-48f641e8257a","resolution":{"observed_at":"2026-08-05T13:09:10.620522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:14.929262Z","title":null,"venue":null,"work_id":"c814dded-db3b-4234-8154-3711f42d342e","year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.856349Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:f2c5bc511eb52c5a5fe5592d2dd7bdf1a218b41d196d1d403c60740dbfbecd95","observation_id":"edba7a61-e65a-4872-a9e7-c0d9140f56a4","resolution":{"observed_at":"2026-08-05T13:09:14.997314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:15.090344Z","title":null,"venue":null,"work_id":"3b870a2a-989b-4ef7-b0d6-c4176c393765","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.769747Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:bd2f0f90e24b4f121d8f966cb7f960dc8ca1a0eb6c76ddb1870de96c85665ff2","observation_id":"8670d48e-41ee-4f5a-8540-5b2d08572eea","resolution":{"observed_at":"2026-08-05T13:09:15.163544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.045685Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.045685Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:3511cb8d53f695a44708f10f25f4ee1281fa55a0744500e92c9ed34a0d1040ce","observation_id":"7b4e6c3b-dc5f-4ce0-ad08-3267d89170f3","resolution":{"observed_at":"2026-08-05T13:09:11.045685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:14.766769Z","title":null,"venue":null,"work_id":"1a57e8fe-6e0f-4b6d-90e9-33a34c88a210","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:10.949661Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:d9246f20f6c0532b0fec5949352664148c3b711d1e3bf882721c5d5f4cac4fe7","observation_id":"6e559a38-b4d4-4ebe-be20-0aff1d963b75","resolution":{"observed_at":"2026-08-05T13:09:14.853428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:14.627471Z","title":null,"venue":null,"work_id":"e834e22d-cfa7-47d4-91b7-3b08dc5a767d","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.199009Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:c5e90854b952eee602ed0badd5e9bb8c6e781acd3a54c11ad945fad7357e148c","observation_id":"4787b015-0594-498c-b12c-31bcfa4b2570","resolution":{"observed_at":"2026-08-05T13:09:14.682256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.114777Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.114777Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:62c94ea8b63a5bc01a22e09206c46ba0bcfbe1a0a4df2e1a900d9a62fc623fdb","observation_id":"4eef5f83-7c65-4e0f-bbaa-49d3a3bd651e","resolution":{"observed_at":"2026-08-05T13:09:11.114777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.417339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.417339Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:b73fc1e9bd970efa1f5f81262faad0d7b1e60c577b0cefca7c1b8f25993b92c4","observation_id":"2fd1a992-35ae-4515-b4a6-ab9d7be9453d","resolution":{"observed_at":"2026-08-05T13:09:11.417339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.316499Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.316499Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:43308ecc064a631f67547a9c84e7a6ff336b6f2b1cf0e8e84ba9e5eea676125b","observation_id":"78f041bc-bd30-4bc4-9075-8aaaf4e3e106","resolution":{"observed_at":"2026-08-05T13:09:11.316499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.598224Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.598224Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:e2225bcac7d4b1194685aaa4dedc2f72cc430c6dfe7bfda9bf91acf5f86acf68","observation_id":"dda10481-815c-42e2-8aec-bb230f857b04","resolution":{"observed_at":"2026-08-05T13:09:11.598224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.06289","last_updated":"2020-06-16T22:39:39Z","snapshot_observed_at":"2026-08-04T08:59:39.023397Z","submitted_at":"2020-02-15T00:46:32Z","title":"3D Dynamic Scene Graphs: Actionable Spatial Perception with Places, Objects, and Humans","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.06289","snapshot_observed_at":"2026-08-05T13:09:11.503492Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.503492Z"},"links":{"cited_paper":"/paper/2002.06289","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:f38cb8dd4deb11ef59a08d2cfb3b525183c71161d7c6822ebf836b99cfde329c","observation_id":"48c301c1-30e9-4c99-8934-21cd36b72596","resolution":{"observed_at":"2026-08-05T13:09:11.503492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:14.450772Z","title":null,"venue":null,"work_id":"fd50417d-655c-49a5-b4f5-9dca0e600d0f","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.809673Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:ce780365ba1ca66c9fffcd8429e907cdb6467ba96b5849da7d59e56a9c184d73","observation_id":"97877647-48a1-445e-8b6f-4cf935c12a32","resolution":{"observed_at":"2026-08-05T13:09:14.510585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.681191Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.681191Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:c51b509ffc085674465bb1b6c4aea9a88f34e73d18c3e4daecf26dad8694bd42","observation_id":"a549f899-ecdb-4a6a-ae60-8f89f4f8a390","resolution":{"observed_at":"2026-08-05T13:09:11.681191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:11.994727Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.994727Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:3c2df58248c39dd99a80219a237e66a57fde960df78eae0868f076cd0c54a84b","observation_id":"22ba2904-d388-428d-834f-aa2f826c9f44","resolution":{"observed_at":"2026-08-05T13:09:11.994727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-05T13:09:11.905638Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:11.905638Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:cdcb65439b9b56738e815d857523e64791fe8c82cc62beb2bfddb47d8d3aa804","observation_id":"1fa00cad-a6ed-49da-aa42-d2c732af3d56","resolution":{"observed_at":"2026-08-05T13:09:11.905638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:12.181302Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.181302Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:05922bb8a408154060e7cbc337f166c70b88d816e30b413e16ffd4458588a32d","observation_id":"fee23b29-7ea9-4bd8-b852-0c97883a502a","resolution":{"observed_at":"2026-08-05T13:09:12.181302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:14.283025Z","title":null,"venue":null,"work_id":"bf1d3d6c-616e-472c-8514-5d97168ac19c","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.086809Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:f4d33a1ae9df2210254a5b80fb34edf6fb70cc36c187121292caf017a9c1aaa1","observation_id":"d0d7cf93-8dc6-4f68-bc35-4fb0520ed581","resolution":{"observed_at":"2026-08-05T13:09:14.366321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.885767Z","title":null,"venue":null,"work_id":"a4139dcc-3b74-4c36-a900-bf0f5c7e10f7","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.330852Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:8df358e4522ccbb153a7bcb736a552f998b2c802435a39724975d59a31060e30","observation_id":"eda221cf-23e3-4ac4-8900-5f379f6496e9","resolution":{"observed_at":"2026-08-05T13:09:13.969552Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:14.091092Z","title":null,"venue":null,"work_id":"a31ffa5f-4b29-42c4-b52d-ff474fdfb125","year":2021},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.267650Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:e803c573d82739648e4495a245468e75527b1564ed6e7edcf3424149181e5424","observation_id":"cd0df2f5-a5aa-4c1f-bc51-f111062df6a2","resolution":{"observed_at":"2026-08-05T13:09:14.187914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.688188Z","title":null,"venue":null,"work_id":"2d8beed3-6016-4de8-8d44-11bc52fa832b","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.543929Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:583c4106219afde8fff48251fd9e4c9782996ec97ed6713d792b8b2b0bddda5d","observation_id":"880c8d8c-5180-4b53-a613-3ced68b30042","resolution":{"observed_at":"2026-08-05T13:09:13.788430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13860","last_updated":"2024-10-17T17:59:55Z","snapshot_observed_at":"2026-07-06T19:35:30.732080Z","submitted_at":"2024-10-17T17:59:55Z","title":"VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13860","snapshot_observed_at":"2026-08-05T13:09:12.444281Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.444281Z"},"links":{"cited_paper":"/paper/2410.13860","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:1f72084e404bbb4b3cafea95ee324886cfa9955e49b0ce7020526ad9fc3fb445","observation_id":"3adfee7b-12a5-4b11-9ef3-89a8da7c8d6c","resolution":{"observed_at":"2026-08-05T13:09:12.444281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.243995Z","title":null,"venue":null,"work_id":"135e6030-f26b-4b7f-854b-67033d57958c","year":2025},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.722648Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:50a60fc0e90ca93ab2dafc500feaec230ac4c8bb0ba7a38c407777cb24adf2c7","observation_id":"972f3899-dab0-4d03-ad29-c798725504e9","resolution":{"observed_at":"2026-08-05T13:09:13.335539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.437399Z","title":null,"venue":null,"work_id":"6c83f69f-571d-4db5-99dd-58f0a045ddb4","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.636792Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:7f7d3ee0d628a4c9d3f39589f7193478df508f3b707b6b1205b520ae77535ec6","observation_id":"f73db08b-2259-4e6b-ab20-094397fee3f7","resolution":{"observed_at":"2026-08-05T13:09:13.572439Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-05T13:09:12.916287Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.916287Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:a0ea0111cc1e382c94e71e7ccceda6e72cce979da0d8edfd4e3d2e445f9425e9","observation_id":"e1708bb7-f37a-44e4-b360-0ce49266e93c","resolution":{"observed_at":"2026-08-05T13:09:12.916287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T13:09:13.091541Z","title":null,"venue":null,"work_id":"a0c95132-0513-4a3e-8b32-5d87b398cfa5","year":2024},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:12.812530Z"},"links":{"citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:0c3f6e13a2eefd9524c947d1700d3f6cf819c50b28d2661bd399e8a244b2362b","observation_id":"87f9c84b-d30e-4967-8e1e-9ad870d680d7","resolution":{"observed_at":"2026-08-05T13:09:13.146060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15940","last_updated":"2023-09-27T18:32:29Z","snapshot_observed_at":"2026-08-02T08:40:10.303921Z","submitted_at":"2023-09-27T18:32:29Z","title":"Context-Aware Entity Grounding with Open-Vocabulary 3D Scene Graphs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15940","snapshot_observed_at":"2026-08-05T13:09:08.898271Z","title":"arXiv preprint arXiv:2309.15940(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T13:09:08.898271Z"},"links":{"cited_paper":"/paper/2309.15940","citing_paper":"/paper/2608.03763"},"observation_digest":"sha256:b67bcdca717a87abcdd4495e4eb86293a5f74ec51daba30c6a3d50d71196dfb3","observation_id":"71924371-6ecb-4a46-8ea8-15877dd2d8dd","resolution":{"observed_at":"2026-08-05T13:09:08.898271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.03763","last_updated":"2026-08-04T14:51:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:12:24.836061Z","submitted_at":"2026-08-04T14:51:15Z","title":"TDVR: Joint Text Disambiguation and Viewpoint Reasoning for Zero-Shot 3D Visual Grounding"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2608.03763."}