{"as_of":"2026-08-04T20:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a96aa2de0c1231469349c0bea9904923655ed8d7b27008fc84097d8e02cec27a","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T16:59:10.173198Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.20946/citation-record","integrity":"/paper/2606.20946/integrity","json":"/paper/2606.20946/citation-record.json","paper":"/paper/2606.20946"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16650","last_updated":"2023-09-28T17:53:38Z","snapshot_observed_at":"2026-07-06T16:25:05.493379Z","submitted_at":"2023-09-28T17:53:38Z","title":"ConceptGraphs: Open-Vocabulary 3D Scene Graphs for Perception and Planning","version":1},"cited_work":{"arxiv_id":"2309.16650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.16650","snapshot_observed_at":"2026-07-04T04:29:35.013892Z","title":"Conceptgraphs: Open-vocabulary 3d scene graphs for perception and planning","venue":null,"work_id":"917add91-9865-4ecf-9b10-9cbacf48fbde","year":2019},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"cited_paper":"/paper/2309.16650","citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:118e0576cc5d32cd65454c1cfff237952f1ec27ddf8db4e6ee7d8cbdba3b2ff7","observation_id":"bec46586-c2e3-418c-88bd-2e0169e880f9","resolution":{"observed_at":"2026-07-04T04:29:35.015243Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10763","last_updated":"2023-12-17T16:53:30Z","snapshot_observed_at":"2026-08-02T02:02:01.525485Z","submitted_at":"2023-12-17T16:53:30Z","title":"M3DBench: Let's Instruct Large Models with Multi-modal 3D Prompts","version":1},"cited_work":{"arxiv_id":"2312.10763","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.10763","snapshot_observed_at":"2026-07-04T04:29:35.010933Z","title":"Rong Li, Shijie Li, Lingdong Kong, Xulei Yang, and Junwei Liang","venue":null,"work_id":"d435f4e6-882b-4bc6-a5c1-66b32f32fa7d","year":2025},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"cited_paper":"/paper/2312.10763","citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:15bddda795f305bb143a1acda24761b4361a666ebbad165973d22e81fefd522b","observation_id":"d5622c10-0963-4d86-bd7f-65899609f03d","resolution":{"observed_at":"2026-07-04T04:29:35.012730Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.08238","last_updated":"2021-09-16T22:01:24Z","snapshot_observed_at":"2026-07-06T11:48:35.206160Z","submitted_at":"2021-09-16T22:01:24Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","version":1},"cited_work":{"arxiv_id":"2109.08238","doi":"10.48550/arxiv.2501.01366","metadata_source":"pith","pith_arxiv_id":"2109.08238","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Habitat-Matterport 3D Dataset (HM3D): 1000 Large-scale 3D Environments for Embodied AI","venue":"cs.CV","work_id":"fd1d6aaa-d036-4baf-9601-1435c8cefb37","year":2021},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"cited_paper":"/paper/2109.08238","citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:cdd86bcc7479dbad92183f2d018bd5a7148631f9ee12395aa754f5227a5859aa","observation_id":"0243b882-99d7-40b4-84ec-454d07dfc65e","resolution":{"observed_at":"2026-06-26T16:59:35.705091Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05251","last_updated":"2023-09-11T06:03:39Z","snapshot_observed_at":"2026-07-06T16:16:49.320601Z","submitted_at":"2023-09-11T06:03:39Z","title":"Multi3DRefer: Grounding Text Description to Multiple 3D Objects","version":1},"cited_work":{"arxiv_id":"2309.05251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.05251","snapshot_observed_at":"2026-07-04T04:29:35.008143Z","title":"Zhuofan Zhang, Ziyu Zhu, Pengxiang Li, Tengyu Liu, Xiaojian Ma, Yixin Chen, Baoxiong Jia, Siyuan Huang, and Qing Li","venue":null,"work_id":"37cfdefa-288a-455f-bc8f-85f7407920c8","year":2025},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"cited_paper":"/paper/2309.05251","citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:fe62b253e0c2f1a995a8cc633677647e87efe25bd1f9ef8dc9fb41206de3eec5","observation_id":"5492f362-e3ef-4256-a051-f89098b4950d","resolution":{"observed_at":"2026-07-04T04:29:35.009849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"|\", and no other text. The descriptions should vary in content and style","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:cc5479c2303f286df10d34442f25fa404a1a9ba7f4e5e2884ca4aaae31b52d1a","observation_id":"3c53e6aa-036b-46f1-bf6f-63ba605c257d","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"Of such boxes, it is the one not next to an armchair","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:c2db32988be0b78d841f20cb4553dc830a6286adafc812ca22a79a0f8df8f1ef","observation_id":"3fb19175-b0a6-4e0f-83d2-555b66059b64","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:e787e14934f5db2fd8910e092824110db07b30459aa9629764ea51892c5898da","observation_id":"27e176f8-c219-429c-a89d-261f8d2be4fc","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:079198353abeadb014cd19f68959a5a7bbb3ed1a951477ad04120ca7ac0fcc99","observation_id":"e52f3f20-11ac-40e6-b630-9e07d950c60b","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:ea7077e85082338bc427a21ad79666decef1d88d9c7461f689a9b38def6aedfb","observation_id":"296231ca-9ae3-4724-94d8-3f816dbe6f2a","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:007ed10a240b78fe065f4dc9ee2723bffc1652741a2ce443f81a5aa18e017d13","observation_id":"a56faa82-b4a3-4cd7-947f-5cf10a1ce4cd","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:fd8d6849855a99c720b495ad7c3405eb8d1e7fb71891309c860ac670b8ad999d","observation_id":"a3816bba-5644-4c71-83f4-6ab2d1d7c0cf","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:2c96af5e903586310009444b56951651499b94dadf3747c6db1c95f91646c35e","observation_id":"d52d5737-0dc9-4c46-8bc8-3d8b3e1c246f","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:8a64980955bf32d22f59c99d759c6355bb64819711be9060939bd09b628f6444","observation_id":"5ffad254-63ae-4b3a-9ccb-e6dd05868390","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:865e6601fe5c90b9b4dd2056270dcc08969a667b202cb33ba299a5a72c3e6f61","observation_id":"56824947-bd2b-4138-b8f0-5aa9604d16c1","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"|\", and no other text. The descriptions should vary in content and style","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:377fad79272c513100a7dff697342b65275bdfaa355651937ec7f382a0c15d43","observation_id":"f42bdaf4-47ff-4f59-b28b-ab8beb67eff8","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"on\" (inverse:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:1ea0335ef8f9f8c73cb17be0d55540cafd5ed0b0ae83d95d3d76ff276f4e92c8","observation_id":"4a3a47d5-91e8-4352-bdea-dfdf144ca3bd","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"i n\" (inverse:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:c90973a54432aa15a591cdf2122fd5ef1479c9c8d7390c5c3ffda89111d72881","observation_id":"181ca402-00bb-4376-afe2-c480168b635b","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"embeddedi n","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:15b54b972758faf10b27eedbb2423bc8efccb32a93ba9805f495583e23dc7ce4","observation_id":"c3532f72-586b-4fbc-bed7-54c2cb7dbfd3","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"l e a n i n g on","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:076f229295ea8db0928a264f9d1600763e67e8a805df767792b94a93666319ee","observation_id":"c81dae59-7c52-4e0a-bcf4-bf381bfb397d","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"h a n g i n g on","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:9d19b2b3c0902896760976ef40430ef830d97a09f971a55a2a4b5161663a7750","observation_id":"cf434433-6fb9-4adf-91bf-d05d553ad31b","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"none\" (inverse:","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:f1234ccb820389f6b4b5fa696dce75a6d5551b319781defd9e61d75d28561527","observation_id":"b336ca65-9e13-4ff7-ba18-1801b3b8e05b","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"on\" the shelf and not","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:e49e712156834757efcc0738f25df98d0db5a6a2e9398d594bc46d14ae384285","observation_id":"9431d678-eda4-4fe7-a291-d4454838d5b7","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"none\") # Output Format The output should be a JSON object with the following format: {","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:1aabc1f33582f4a04ce46860fe3111672674cd20a26100de5db62782e647c35f","observation_id":"45cf0ca8-b535-489a-b9b5-73137e179ad7","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"a\", \"an\",","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:44ccd45f749ef8cdae893c1e0ad8d1e3c04bb4eb0cd1597a5def8f71bb9bb526","observation_id":"f33482a3-fd58-43a5-85c9-8497c14dc7a5","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:be29ceba228cf3249fb5ef7fa378366c98ddeba4725fcd9f073da4b4c0e030b9","observation_id":"e98ecda7-302f-4e24-b790-dc2d28235bf4","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:16a3c1b5d178e49a28602942cde00a9773a30a0f68cac863a7c01fc286da58f0","observation_id":"55708aca-222e-4331-9ab4-9d5095abe980","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"The object should be marked with a green bounding box in the visualizer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:faad76ae91b8d193a8bd1329782af6d7ed34b8755ebb562f222a143cc6a04520","observation_id":"c5eb3f54-1f19-4bf6-b539-78a4040fcba6","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:b5ddc872b8c720a5b48e77fcd1fd6c728924fd223d5bc2d06533c475ef0c7c46","observation_id":"964430db-07cf-4a88-a238-442e0f93e9cf","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:0d192e8cf6e864806266d6917be44cf5c58d80e7a5de776b9dad2ea7fd93b1fe","observation_id":"a6aa2b15-9c02-4732-9ba2-ca2d0a4c2458","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:dccf433ad654c8d851ffb4964e296f1047cca1a462bc44b8359753079b3c3602","observation_id":"548014b6-03f4-4e2c-bc87-d82137c9367f","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T16:59:10.173198Z","title":"True”. Otherwise, the user selects “False","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-26T16:59:10.173198Z"},"links":{"citing_paper":"/paper/2606.20946"},"observation_digest":"sha256:8b3149a8e57e9bcc45e582bdb881c0f5aa9732f0f9f7957e0e52476fed1d9aff","observation_id":"5aef43e3-94b5-44b9-863b-e115cdf617c8","resolution":{"observed_at":"2026-06-26T16:59:10.173198Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.20946","last_updated":"2026-06-18T21:20:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-02T09:20:44.890160Z","submitted_at":"2026-06-18T21:20:20Z","title":"Scaling Diverse Language Generation for 3D Visual Grounding"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":2,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":25,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2606.20946."}