{"as_of":"2026-08-07T23:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55a98d11f53524f06b64320ce4f4b5a88c3072c3132b6bdd273981942c807da2","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:52:19.061479Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:42.147646Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:46:19.349816Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-08-07T15:15:42.147646Z","title":"Ir3d-bench: Evaluating vision-language model scene understanding as agentic inverse rendering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.15804","last_updated":"2025-07-10T17:36:35Z","snapshot_observed_at":"2026-08-07T17:07:40.040298Z","submitted_at":"2025-05-21T17:57:38Z","title":"STAR-R1: Spatial TrAnsformation Reasoning by Reinforcing Multimodal LLMs","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:42.147646Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2505.15804"},"observation_digest":"sha256:19cbd3e8487c37c3d55a39c9a759f58a7c805cd291be3584a43590b1640e945a","observation_id":"58f1947f-c76c-4444-8630-cb9fb76e6631","resolution":{"observed_at":"2026-08-07T15:15:42.147646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":"2506.23329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-07-01T22:46:19.349816Z","title":"arXiv preprint arXiv:2506.23329 (2025)","venue":null,"work_id":"accd70ab-d175-47fa-8c5c-3d5215e1b543","year":2025},"citing_paper":{"arxiv_id":"2604.13035","last_updated":"2026-04-14T17:59:26Z","snapshot_observed_at":"2026-08-02T20:49:07.621096Z","submitted_at":"2026-04-14T17:59:26Z","title":"SceneCritic: A Symbolic Evaluator for 3D Indoor Scene Synthesis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:33.149921Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2604.13035"},"observation_digest":"sha256:ac672eb446a010a9d2a7ef86b85624dfb544446e02ec7149be52989440d358b2","observation_id":"2a8e50f9-e90a-41bd-9177-58400071a09e","resolution":{"observed_at":"2026-05-11T10:11:03.448702Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":"2506.23329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-07-01T22:46:19.349816Z","title":"arXiv preprint arXiv:2506.23329 (2025)","venue":null,"work_id":"accd70ab-d175-47fa-8c5c-3d5215e1b543","year":2025},"citing_paper":{"arxiv_id":"2606.02580","last_updated":"2026-06-01T17:59:53Z","snapshot_observed_at":"2026-08-07T05:56:16.163586Z","submitted_at":"2026-06-01T17:59:53Z","title":"Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T15:04:01.773923Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2606.02580"},"observation_digest":"sha256:ef52a5d17f5c7eb156d201498c42cda8b72abe7e829d60f79f5da4ef5a34d1a5","observation_id":"d5b28e77-12f4-45cc-8b14-f7dcdfcd832d","resolution":{"observed_at":"2026-07-01T22:46:19.352179Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23329","snapshot_observed_at":"2026-07-12T01:11:59.721089Z","title":"Ir3d-bench: Evaluating vision-language model scene understanding as agentic inverse rendering.arXiv preprint arXiv:2506.23329, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03614","last_updated":"2026-07-03T22:04:42Z","snapshot_observed_at":"2026-08-07T20:42:22.133522Z","submitted_at":"2026-07-03T22:04:42Z","title":"IDEAL-Bench: Indoor Dataset and Evaluation suite for Analyzing 3D Layout reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T01:11:59.721089Z"},"links":{"cited_paper":"/paper/2506.23329","citing_paper":"/paper/2607.03614"},"observation_digest":"sha256:c1bda079964cf9afc03d3bf49df23afebc50158c7162e6cdbf35b6b30db1d320","observation_id":"239479b0-2d39-4cf4-b714-2e34cd9b6a29","resolution":{"observed_at":"2026-07-12T01:11:59.721089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.23329/citation-record","integrity":"/paper/2506.23329/integrity","json":"/paper/2506.23329/citation-record.json","paper":"/paper/2506.23329"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T21:52:11.055004Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.055004Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:74961cd7022ec748ad5ebb5abecbf16c5c404571dce55ca886d009b4ac1feaa4","observation_id":"70399b4d-b6e2-4b73-94bf-bad20488e404","resolution":{"observed_at":"2026-08-06T21:52:11.055004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T21:52:11.097608Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.097608Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:e7561383c791c23d015064018337d3622738e3899a400da089a8c1899cd4be7a","observation_id":"e399d4ea-d573-4ec4-8742-5321185e750e","resolution":{"observed_at":"2026-08-06T21:52:11.097608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.169741Z","title":"The Claude 3 Model Family: Opus, Sonnet, Haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.169741Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7dfc25c6a1f168d67cdcde51b159e9b8878faa2b6c39a8c508a2e0f08498c63c","observation_id":"c1bf531f-f280-4fa3-83ef-1b4ba3d07b95","resolution":{"observed_at":"2026-08-06T21:52:11.169741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T21:52:11.224504Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.224504Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9e994e650b22591a13e8f24d85c4c7e0d71357739988342e4fc310298208aebf","observation_id":"c5f399e7-11ab-498b-a352-6b5424b05bb8","resolution":{"observed_at":"2026-08-06T21:52:11.224504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:52:11.285409Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.285409Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9adc03b9340cb56de683e8e6c12f4f31576bcb0afc593f60667c35ff634938d8","observation_id":"b4095e18-2038-4477-a16d-c90e47d0c61d","resolution":{"observed_at":"2026-08-06T21:52:11.285409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.354626Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.354626Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c93b0b7be7c1a70fe05110d65e4155e6527885116776f6298bdc4beeb186a309","observation_id":"d393dec2-7886-404f-bd47-c76fdd7b1f14","resolution":{"observed_at":"2026-08-06T21:52:11.354626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.396632Z","title":"Perceptions as hypotheses","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.396632Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:8955c90d4c47210518fa47991f1817bc51cf7a8eb0907926432070ecb9188502","observation_id":"623e3470-0483-491f-8878-f676cb8fedf9","resolution":{"observed_at":"2026-08-06T21:52:11.396632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.441337Z","title":"Yuille and Daniel Kersten","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.441337Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d8bced7ef0ad5f6f5bb6fd39d521230e97534053d91f0b4c6a205e2f95e24cb1","observation_id":"b67c78c0-8f4d-430b-9a8a-c6a05d6a7535","resolution":{"observed_at":"2026-08-06T21:52:11.441337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.504617Z","title":"Efficient and robust analysis-by-synthesis in vision: A computational framework, behavioral tests, and modeling neuronal representations","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.504617Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d7e08dd362dc16aa1373e76d42c4b1e2f8131552ee1183a807bf3c39449c7a2e","observation_id":"4ba89f9d-b7fd-48cc-94e5-6035ea2f9f20","resolution":{"observed_at":"2026-08-06T21:52:11.504617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.569097Z","title":"Bever and David Poeppel","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.569097Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:eb3740a547f1bc5d3ae4526f7ec691e2010b5b46df4cb89dc281157e2ec28717","observation_id":"04895bc9-16e4-42ab-b6cb-fc311ebde2ea","resolution":{"observed_at":"2026-08-06T21:52:11.569097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.626028Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.626028Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:84af416fc4e5740d8457a2dedce6b33ea6c066a951ae40ab1148b3569686a046","observation_id":"2bd2439d-548f-4935-b8eb-ebc1323b56a8","resolution":{"observed_at":"2026-08-06T21:52:11.626028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.687738Z","title":"Visual programming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.687738Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:5779a57e44073ff91fc78809837dd426a7501acfd8bd01fb59524a000d353d89","observation_id":"41d94738-46fb-42ca-aa07-daad572b27a0","resolution":{"observed_at":"2026-08-06T21:52:11.687738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:11.750586Z","title":"Vipergpt: Visual inference via python execution for reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.750586Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6f1677d73ba6c940a97bd329347e8f436ac8f460bedc68cf94ceac8ae36f5994","observation_id":"2371c8ed-4db0-4785-b740-808dc0eddae7","resolution":{"observed_at":"2026-08-06T21:52:11.750586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:27.420209Z","title":"Gorilla: Large language model connected with massive apis","venue":null,"work_id":"72c8b015-5e79-40f6-96bc-5fdb8c56a1a1","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.803713Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:835e81fb2a09a9703bd9c2d140e806c7878685b7ce797bd93c83956da4ac1089","observation_id":"759e214b-494b-47d0-a7ff-29d41b221fb4","resolution":{"observed_at":"2026-08-06T21:52:27.564130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:27.182881Z","title":"Blender - a 3D modelling and rendering package, 2016","venue":null,"work_id":"686e4cda-e0f7-4c58-96e5-870b96d0bff6","year":2016},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.874949Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f8c9e1ce4421a785e11a01c20fe60f0de7426190a3fcdd2c8b3622e73c145a8f","observation_id":"58910aac-d9e8-4948-9f22-a5cf9a3c51dd","resolution":{"observed_at":"2026-08-06T21:52:27.281964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.853620Z","title":"https://github.com/modelcontextprotocol, 2024","venue":null,"work_id":"8d50e13f-638a-4e6d-a70d-87540eb6e90c","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.913246Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:eeeb9f11405d2423df38f3acec07b7322c4c0ead5ddb803f9b80456416669eec","observation_id":"4f94bb30-7534-47ce-b4a6-8f2c24fe64e2","resolution":{"observed_at":"2026-08-06T21:52:27.013539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.372305Z","title":"Blendermcp","venue":null,"work_id":"f0914145-7111-4d6c-8498-4c2c378417bd","year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:11.977613Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9a68a7b0356e91964d4c331abac1166311b3fe5c72664ca0f3e526b1dd6bff0e","observation_id":"ecc096df-bc12-4ee8-b717-625b2d4f4528","resolution":{"observed_at":"2026-08-06T21:52:26.613500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:26.010036Z","title":"Embodied question answering","venue":null,"work_id":"22b843b0-238e-46cc-b2f8-443e2c64825b","year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.022798Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:0b284bd7afaf468190c1c1bc72c8b6f195834a6de75c843702e249434bd2134f","observation_id":"c343af7a-bbde-476a-9168-91e73e1b1192","resolution":{"observed_at":"2026-08-06T21:52:26.204239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.083938Z","title":"Multi-target embodied question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.083938Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:3576029d28361c85a96460a88a9361c703f7fd691274d55143da48a15293e9f9","observation_id":"24c50811-3954-4c4c-8c9a-3443545a9ca4","resolution":{"observed_at":"2026-08-06T21:52:12.083938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.706972Z","title":"3d concept learning and reasoning from multi-view images","venue":null,"work_id":"e6a36527-c4ca-47ca-bc31-61466f8f8175","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.138262Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:70db58c5b2b2db0a3fe1b4d514b4aac2cead1dc33ef5646b4ccaf9d60a9e1b82","observation_id":"5b4e46d7-ef6f-4292-8bc7-a0adc8407f6b","resolution":{"observed_at":"2026-08-06T21:52:25.777892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.622073Z","title":"One step at a time: Long-horizon vision-and-language navigation with milestones","venue":null,"work_id":"32b78266-ca15-4ac8-83d1-0971983841c7","year":2022},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.194541Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f50536d2a685ffc306b5004dc64bc229409d975b53f319d5b6204bfc5b5e5582","observation_id":"9a512965-3142-40a5-a3af-38bb88cef8f6","resolution":{"observed_at":"2026-08-06T21:52:25.671215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.04927","last_updated":"2021-11-04T17:12:42Z","snapshot_observed_at":"2026-07-06T11:37:18.911471Z","submitted_at":"2021-08-10T21:24:05Z","title":"Embodied BERT: A Transformer Model for Embodied, Language-guided Visual Task Completion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.04927","snapshot_observed_at":"2026-08-06T21:52:12.241831Z","title":"Embodied bert: A transformer model for embodied, language-guided visual task completion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.241831Z"},"links":{"cited_paper":"/paper/2108.04927","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:195fb176e97a0d9ff1cf4190d3637673529ed4b22df32fc54b9513f1868e5eeb","observation_id":"c6d80a6f-3acd-410b-b3bb-eb48b0cd720d","resolution":{"observed_at":"2026-08-06T21:52:12.241831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:12.279337Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.279337Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6bd3d0a898153c904be840290317c52d3b412f015f0ad3c7846397d3db073614","observation_id":"de9ccc8a-466a-4a37-afa9-fe5ffb61f905","resolution":{"observed_at":"2026-08-06T21:52:12.279337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.484473Z","title":"Barrow and Jay M","venue":null,"work_id":"738f2696-44d3-4756-a043-f3653054321f","year":1978},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.293443Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:104ec883d826072cf4944f7a411f2d1fbf213559b53cc35991d944c55d09e3fb","observation_id":"e9a6c378-4606-4592-94b9-abeafdd0c1ae","resolution":{"observed_at":"2026-08-06T21:52:25.549695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.339018Z","title":"Soft rasterizer: A differentiable renderer for image-based 3d reasoning","venue":null,"work_id":"73f5865d-798d-4dbd-ade8-e26dbed1ca49","year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.327295Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:bc889dcda69ad9b94e9fe58679ad177ab21d6ab4c13cd93ce9b7eebaf45dcf29","observation_id":"05dad22f-a4c9-4d5e-b07d-273a93a6fc3a","resolution":{"observed_at":"2026-08-06T21:52:25.418707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.233410Z","title":"Carr, Jonathan Ragan-Kelley, and Frédo Durand","venue":null,"work_id":"a845f524-4277-43cc-be49-2596ccafac43","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.364961Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:df2b3c91d5b0b6534f6bc6f81548f9354556789f339f5543afd50a0f91c27d47","observation_id":"47e3950a-d8e2-4c22-ac40-8243dea9bbdb","resolution":{"observed_at":"2026-08-06T21:52:25.281806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:25.093920Z","title":"Differentiable vector graphics rasterization for editing and learning","venue":null,"work_id":"27334175-9e1e-4acb-bb41-316825db71ff","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.397916Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:8612ebdf46576bb23f95074c8c94b09e1031cef103ec5dc5f072e03621756ac0","observation_id":"03cb4dd2-5833-44e6-a443-1ded4a1cbcc2","resolution":{"observed_at":"2026-08-06T21:52:25.156345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.982728Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis","venue":null,"work_id":"c1b14839-1cc0-41e9-9267-b8b694877c06","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.474675Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:e48cfc59ef9ef343f187d581c23d86caa8855d7e5b25b3d4f82c00cd7ab45c36","observation_id":"fdf89410-523c-4f03-82e4-6e26fc4b84b2","resolution":{"observed_at":"2026-08-06T21:52:25.044121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.885014Z","title":"Unisurf: Unifying neural implicit surfaces and radiance fields for multi-view reconstruction","venue":null,"work_id":"b5a70296-2e66-4a69-9c10-fbfbed8e67ad","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.567066Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:da246c563f34e067e95419469b24a59427d3ce426d6b54e4cef87e8b90d8c8d9","observation_id":"185ef9c7-49ac-46b2-984d-870a0eff56e2","resolution":{"observed_at":"2026-08-06T21:52:24.925554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.771146Z","title":"V olume rendering of neural implicit surfaces","venue":null,"work_id":"85c21ca8-cfa8-4da8-888f-301980e217f2","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.634446Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:2275d20c9e433d4cff650f6dc3386180e831e28692a41ec101a9c27575a1ffdb","observation_id":"170cb4bb-be8d-4702-b529-96c80dc09769","resolution":{"observed_at":"2026-08-06T21:52:24.826114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.646119Z","title":"Synsin: End-to-end view synthesis from a single image","venue":null,"work_id":"6f4b3654-551c-4557-b1f2-0eeaf10e876e","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.704011Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:18067fd3b18f85796f57e6303f632d23d672a0397b103af96ff7fe10f6df600d","observation_id":"fe13a610-3f42-47f0-be62-c42423e06960","resolution":{"observed_at":"2026-08-06T21:52:24.683222Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.520823Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"56efc215-e5c8-42f4-8d05-ba26caf4a88d","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.762820Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:bc5bc45ddbf71e5f2a69e42efbcda3bc4b655144ce0d88c61224a6fa2cbc6957","observation_id":"a40ed8df-92b3-4d8e-9c4f-eb74c9b4898b","resolution":{"observed_at":"2026-08-06T21:52:24.597407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.394771Z","title":"Path-space differentiable rendering","venue":null,"work_id":"ded80b08-d35a-4900-ac8f-c1638bbb0260","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.822049Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:e5a95847598a286a7123f25c4de36dec472ecd79fed3df2911cf3e628b178ce9","observation_id":"120bdca9-0787-411c-af13-41bf6860ac8f","resolution":{"observed_at":"2026-08-06T21:52:24.443779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.230418Z","title":"Inst3d-lmm: Instance-aware 3d scene understanding with multi-modal instruction tuning, 2025","venue":null,"work_id":"204cc84f-381e-4fa9-93ef-e62db91e85b0","year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.878226Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:580d95867c6584c95bcb1689ff04e93014e0754b4c119129b23b54c7660a6b11","observation_id":"4a82b5d2-f0fa-4dcd-90ad-0e7dafa35cb0","resolution":{"observed_at":"2026-08-06T21:52:24.322002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-06T21:52:12.924934Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness.arXiv preprint arXiv:2409.18125, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.924934Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6c5cee7197aad72c985c32d03ae61f89cb33ebc04d124cb2d0cac6a9b2107745","observation_id":"baa76daf-d0cc-4046-867a-c8c4e18cb39f","resolution":{"observed_at":"2026-08-06T21:52:12.924934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:24.011771Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":"1d15c356-4738-42d9-972f-ca427d9efd9b","year":2022},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:12.978758Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:ccb4b404b181abc0f420cceb3c7d9c9f0960cfc95b40c36e6fa791fdd8f7fb6a","observation_id":"af2108fa-3480-4223-889d-1ddbf54662d7","resolution":{"observed_at":"2026-08-06T21:52:24.123602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.792761Z","title":"3d-vista: Pre- trained transformer for 3d vision and text alignment","venue":null,"work_id":"796b2e2c-aa01-427c-bcd3-e8ca88fa25a7","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.066768Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f1dc7c071503a773cb872468836b6c79a8f692e6bf0b8781113652c15b7fa29c","observation_id":"0fdde439-780f-4367-abce-abcb0b2ba4ac","resolution":{"observed_at":"2026-08-06T21:52:23.895150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.08830","last_updated":"2020-11-11T09:33:31Z","snapshot_observed_at":"2026-07-06T08:45:31.167221Z","submitted_at":"2019-12-18T19:00:49Z","title":"ScanRefer: 3D Object Localization in RGB-D Scans using Natural Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.08830","snapshot_observed_at":"2026-08-06T21:52:13.125119Z","title":"Chang, and Matthias Nießner","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.125119Z"},"links":{"cited_paper":"/paper/1912.08830","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:6402ac996438b6df7423e5e8d885c04051bb5afe0421bfc03739797ea820e2b5","observation_id":"804d0774-75fd-4430-b308-0a344c7c0b98","resolution":{"observed_at":"2026-08-06T21:52:13.125119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.626604Z","title":null,"venue":null,"work_id":"d2289d5b-7a20-429f-ab6e-0a2838a15047","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.176031Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a2c1924d45968e9569d6d030a404dba6fca2e04aea6d1ae080f37ff501be4f83","observation_id":"069e343b-baa2-47c1-ab21-fa116d0be223","resolution":{"observed_at":"2026-08-06T21:52:23.716990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.413530Z","title":null,"venue":null,"work_id":"5302140d-9032-4ea1-82c4-32371713977b","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.257778Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:57fb5931e6f42368cd26ca21dfd67aea7d8f5be399229f49e14132261c5842f1","observation_id":"8a82e53a-4cde-4c52-8b39-2781b3ce7187","resolution":{"observed_at":"2026-08-06T21:52:23.514382Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:13.307929Z","title":"Scalable 3d captioning with pretrained models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.307929Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7326ffbcb0d3e2f85b043d06d760f3454a994c43693513b10fbc657f1f84e87d","observation_id":"91a71c99-fc19-4bfb-9743-85f859313aca","resolution":{"observed_at":"2026-08-06T21:52:13.307929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.244847Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":"e6179801-fde1-4c8f-a53f-ade6e40526d5","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.367178Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a526f3e3da2069a0e081b4362c507b5db1430ab537d21a6838820034a7ebd4e6","observation_id":"f8e232af-a3db-4d52-a83a-5d822a3dd8a3","resolution":{"observed_at":"2026-08-06T21:52:23.340070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:23.088257Z","title":"Alfred: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":"bf099bb6-16a6-4f20-9fc0-048a437a058f","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.427092Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f35affb640250348af75309c5cc094d574e5b2646757f9e883172008d3ac2d9f","observation_id":"5364b1bc-adb6-4a12-a480-5b8ade7cb1cb","resolution":{"observed_at":"2026-08-06T21:52:23.158643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.860797Z","title":"Sceneverse: Scaling 3d vision-language learning for grounded scene understanding","venue":null,"work_id":"27d0ed9e-05c7-44d9-a517-fd8fad7b7cb6","year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.473093Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:1ed23df744d99c76d9fb893e84b9f20f51bcbfd7b2ae4a36c9179997e1a140ec","observation_id":"79c150fb-dcb2-4dda-9b34-946805354b5f","resolution":{"observed_at":"2026-08-06T21:52:22.964985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.661163Z","title":"Spatialrgpt: Grounded spatial reasoning in vision-language models","venue":null,"work_id":"3a02da94-8d7d-43ff-8306-125f43f4ed62","year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.520082Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:cdefd138b04dc5f93048ac169f7aca43abdaf7bcc460b4202303fb6c5204d50d","observation_id":"2243b079-f024-4250-87c2-d590e88832e9","resolution":{"observed_at":"2026-08-06T21:52:22.738013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07241","last_updated":"2023-10-23T14:56:15Z","snapshot_observed_at":"2026-07-06T14:51:48.920020Z","submitted_at":"2023-02-14T18:40:26Z","title":"ConceptFusion: Open-set Multimodal 3D Mapping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07241","snapshot_observed_at":"2026-08-06T21:52:13.629446Z","title":"Conceptfusion: Open-set multimodal 3d mapping","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.629446Z"},"links":{"cited_paper":"/paper/2302.07241","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:dfa12640f5e7a70ad980c7c6f6f998291044d606b8e8067e3092549d855d5bdf","observation_id":"13c423ae-e694-4b4d-9483-84ce12cea5bc","resolution":{"observed_at":"2026-08-06T21:52:13.629446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.436962Z","title":"Context-aware entity grounding with open-vocabulary 3d scene graphs","venue":null,"work_id":"b99c67e1-138e-4122-96fc-6fc71c30c53a","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.689722Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:8fccc307f341e6e2611c1567c5d382227153706116bd4cf9f722ecf00ee239e0","observation_id":"0854f686-091f-4bf1-9322-c38faaea3951","resolution":{"observed_at":"2026-08-06T21:52:22.553902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:22.189394Z","title":"Tenenbaum, Antonio Torralba, Florian Shkurti, and Liam Paull","venue":null,"work_id":"85542c58-6747-4504-a16b-94318d2bea6f","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.772311Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:0467dc25a642ae2b9826b5155712a3e5eb8441e3503864e9d795ae70595d4193","observation_id":"09505462-0c34-481b-9759-994420a4609d","resolution":{"observed_at":"2026-08-06T21:52:22.310278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12981","last_updated":"2023-07-24T17:59:02Z","snapshot_observed_at":"2026-08-03T03:13:48.042761Z","submitted_at":"2023-07-24T17:59:02Z","title":"3D-LLM: Injecting the 3D World into Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12981","snapshot_observed_at":"2026-08-06T21:52:13.851642Z","title":"3d-llm: Injecting the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.851642Z"},"links":{"cited_paper":"/paper/2307.12981","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:fe0f02cc42b1ea3bd6634da187506a8143f7d0c0b517c9167b681b96681a167b","observation_id":"5d0d8d06-ed63-48ce-ab2b-6ad2bebe8242","resolution":{"observed_at":"2026-08-06T21:52:13.851642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11835","last_updated":"2024-03-18T14:47:03Z","snapshot_observed_at":"2026-07-06T17:46:20.935124Z","submitted_at":"2024-03-18T14:47:03Z","title":"Agent3D-Zero: An Agent for Zero-shot 3D Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11835","snapshot_observed_at":"2026-08-06T21:52:13.961478Z","title":"Agent3d-zero: An agent for zero-shot 3d understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:13.961478Z"},"links":{"cited_paper":"/paper/2403.11835","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c73d37f03c778b8a2d15b154932db8f24bf78bbf713d86d1dd8e8cc0d5c0858b","observation_id":"af0980fc-8aae-4b20-8ca6-af1ebf75083a","resolution":{"observed_at":"2026-08-06T21:52:13.961478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03201","last_updated":"2024-01-16T16:39:57Z","snapshot_observed_at":"2026-08-06T01:10:16.745527Z","submitted_at":"2024-01-06T12:20:18Z","title":"3DMIT: 3D Multi-modal Instruction Tuning for Scene Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03201","snapshot_observed_at":"2026-08-06T21:52:14.100701Z","title":"3dmit: 3d multi-modal instruction tuning for scene understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:14.100701Z"},"links":{"cited_paper":"/paper/2401.03201","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:57c55d89e82b581ecd2250c619faad7b5de3bd6db6d97c8da01dc081d0b731cf","observation_id":"477b6121-dda0-4230-a3af-7ebb78398485","resolution":{"observed_at":"2026-08-06T21:52:14.100701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:14.285145Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:14.285145Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:9f25bba0d7546b0f2493025ab17e27638ef3f00903c671c97645cb511d2752cf","observation_id":"aa631a06-2c28-496b-934d-0e48b671585c","resolution":{"observed_at":"2026-08-06T21:52:14.285145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.983644Z","title":"Kulkarni, Pushmeet Kohli, Joshua B","venue":null,"work_id":"e856a8bd-323c-44f7-a44d-59659df344a2","year":2015},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:15.001949Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:3e30d0a3010133146793a1973ef493f27f6b74b184dd0c434f94446803bbc4ff","observation_id":"bf2e2b69-3430-422d-9178-84203d7d112f","resolution":{"observed_at":"2026-08-06T21:52:22.056195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.803466Z","title":"Learning to infer graphics programs from hand-drawn images","venue":null,"work_id":"6d51cd08-8340-4336-96e6-39b82e1c5ea7","year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:15.895509Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b8d045fe6fc0d0975771e5511cbd5b36035198659d3c45d82d41397c5db86a56","observation_id":"92033c46-13f7-4403-9222-3acc43d758a9","resolution":{"observed_at":"2026-08-06T21:52:21.901078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.603685Z","title":"Learning to infer and execute 3d shape programs","venue":null,"work_id":"9cd50a35-cc67-41cf-86d2-64737924ae46","year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.005434Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:be779d72d1977f9a1d677345247afe648ec87ff21b245325e66eea449ef0666b","observation_id":"ab25332c-a816-4f5b-8b68-f98bd8ce40d5","resolution":{"observed_at":"2026-08-06T21:52:21.706626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.442420Z","title":"Shapeassembly: Learning to generate programs for 3d shape structure synthesis","venue":null,"work_id":"ddb42099-874e-4565-b26e-c3d977b48c99","year":2020},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.170005Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:87d693ce6fa1044eef22b1cab69a5b95b83a1434a3bb27ea0b7c76e0e457887d","observation_id":"370dc2bc-3632-4845-839c-20e7bf03bfeb","resolution":{"observed_at":"2026-08-06T21:52:21.534646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.268243Z","title":"Scenecraft: An llm agent for synthesizing 3d scenes as blender code","venue":null,"work_id":"5c11e347-e5b5-45c0-9c64-6204576934c4","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.338669Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c1eb769e3737e9620a8ed826290dd9e79b6f76d759b55a530f6593375a786a5e","observation_id":"616311f7-9e01-49cd-bbf1-2bee4be39133","resolution":{"observed_at":"2026-08-06T21:52:21.372486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16770","last_updated":"2025-03-29T19:17:13Z","snapshot_observed_at":"2026-08-03T22:32:47.592540Z","submitted_at":"2024-10-22T07:40:20Z","title":"The Scene Language: Representing Scenes with Programs, Words, and Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16770","snapshot_observed_at":"2026-08-06T21:52:16.453656Z","title":"The scene language: Representing scenes with programs, words, and embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.453656Z"},"links":{"cited_paper":"/paper/2410.16770","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:93b26de386d611babf0847663cc3f83a6db43027d6ffbc4dc1b81eab88fb79f3","observation_id":"a1d01f54-7b0d-4d4d-ac16-f51c5f1babf8","resolution":{"observed_at":"2026-08-06T21:52:16.453656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12945","last_updated":"2024-05-29T01:35:15Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:41:48Z","title":"3D-GPT: Procedural 3D Modeling with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12945","snapshot_observed_at":"2026-08-06T21:52:16.602426Z","title":"3d-gpt: Procedural 3d modeling with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.602426Z"},"links":{"cited_paper":"/paper/2310.12945","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:98d1c05f827e4734287a3b76068feb8e83b5aa471af53ead9eec1fa0d44b7da1","observation_id":"a6f75e8e-096c-4c4f-82dd-00bfbd5e88a2","resolution":{"observed_at":"2026-08-06T21:52:16.602426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02211","last_updated":"2025-06-03T10:28:20Z","snapshot_observed_at":"2026-07-06T18:56:45.173494Z","submitted_at":"2024-08-05T03:24:45Z","title":"SceneMotifCoder: Example-driven Visual Program Learning for Generating 3D Object Arrangements","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02211","snapshot_observed_at":"2026-08-06T21:52:16.700146Z","title":"Scenemotifcoder: Example-driven visual program learning for generating 3d object arrange- ments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.700146Z"},"links":{"cited_paper":"/paper/2408.02211","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b6f7a86e1e59d17c19079e2a837fd89eac1bb7223a2b40d11b6f52c2b74e0b2f","observation_id":"c0e1084c-6cc2-4184-af33-3f98af61bc67","resolution":{"observed_at":"2026-08-06T21:52:16.700146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09052","last_updated":"2024-02-14T09:51:05Z","snapshot_observed_at":"2026-08-04T04:05:17.132241Z","submitted_at":"2024-02-14T09:51:05Z","title":"L3GO: Language Agents with Chain-of-3D-Thoughts for Generating Unconventional Objects","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09052","snapshot_observed_at":"2026-08-06T21:52:16.816617Z","title":"L3go: Language agents with chain-of-3d-thoughts for generating unconventional objects","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.816617Z"},"links":{"cited_paper":"/paper/2402.09052","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c0b78d12d54181b4ec8e3674ed2112b567f311d960131bb82d4c5707ab590d96","observation_id":"2abac4fd-99b5-4555-9d70-d6c9bc572221","resolution":{"observed_at":"2026-08-06T21:52:16.816617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:16.883085Z","title":"Creative agents: Empowering agents with imagination for creative tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.883085Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:57cd081364dabc5e2184acd851cc3a2798421dc927b06b6de7a23d1748fc79fc","observation_id":"d6757f77-95e2-4fef-8b62-63e1a9ee112f","resolution":{"observed_at":"2026-08-06T21:52:16.883085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:21.096105Z","title":"Scenex: Procedural controllable large-scale scene generation via large-language models","venue":null,"work_id":"b656cd8e-1d79-4f62-bd86-125a24cb77e6","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:16.958079Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:e1fcca1911a4b467ebde648a0c643f1d23f61e9fa0a1e8a079106298e0ea1368","observation_id":"79bd3400-c7c6-46cb-b80a-a8beebee358c","resolution":{"observed_at":"2026-08-06T21:52:21.193430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.923128Z","title":"Program-guided image manipulators","venue":null,"work_id":"6ec9d768-5bfe-4a34-9daf-a60b866fad3c","year":2019},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.034681Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:0fd9ee37b161f2a1b7321e393f6279e1a663b18d60e538649aeae1295ce87f9a","observation_id":"c70a0e45-e2d4-4063-9d60-a6cd36e02871","resolution":{"observed_at":"2026-08-06T21:52:20.997606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02193","last_updated":"2025-03-11T05:58:39Z","snapshot_observed_at":"2026-07-06T20:00:41.813099Z","submitted_at":"2024-12-03T06:15:04Z","title":"LayoutVLM: Differentiable Optimization of 3D Layout via Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02193","snapshot_observed_at":"2026-08-06T21:52:17.103306Z","title":"Layoutvlm: Differentiable optimization of 3d layout via vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.103306Z"},"links":{"cited_paper":"/paper/2412.02193","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:f54fe1499c87ef3b07f5d3b0cbce82b7048490bd9799c4a11ec9531c9cf79a44","observation_id":"56d960d6-db08-4b58-8524-19e5526477d4","resolution":{"observed_at":"2026-08-06T21:52:17.103306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.730146Z","title":"Virtualhome: Simulating household activities via programs","venue":null,"work_id":"d774378a-d6d5-42c0-bf3a-aafe11edbdb8","year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.197318Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:18fe50a36fa65a1d44bbb1f4a41edc7cfe54b5eabf36f4eb9afaf36b9716b8c4","observation_id":"ef41b7f0-8b70-486f-bd19-089ce59ad090","resolution":{"observed_at":"2026-08-06T21:52:20.787871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.517042Z","title":"Xia, Peng Xu, Karol Hausman, Brian Ichter, Peter R","venue":null,"work_id":"accc538f-cdac-4c50-82fd-aab9bb46ccda","year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.287964Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:c2c23afe30a12a025e6b39405881f625504a603ef88637ae9090bc1230ae9fab","observation_id":"bfd141a2-30a4-4447-96ec-8d97ac1962a1","resolution":{"observed_at":"2026-08-06T21:52:20.637410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11390","last_updated":"2019-01-22T18:55:34Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-22T18:55:34Z","title":"MONet: Unsupervised Scene Decomposition and Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.11390","snapshot_observed_at":"2026-08-06T21:52:17.363407Z","title":"Monet: Unsupervised scene decomposition and representa- tion","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.363407Z"},"links":{"cited_paper":"/paper/1901.11390","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:7d2ad96a904eb261c90ea3a2ab01ad7fb50532cae877b9c5642a6942e2cf261c","observation_id":"a65d344b-a34a-4ad8-8d9e-6228213936f2","resolution":{"observed_at":"2026-08-06T21:52:17.363407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.13052","last_updated":"2020-11-23T10:31:22Z","snapshot_observed_at":"2026-07-06T08:11:14.851013Z","submitted_at":"2019-07-30T16:22:39Z","title":"GENESIS: Generative Scene Inference and Sampling with Object-Centric Latent Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.13052","snapshot_observed_at":"2026-08-06T21:52:17.455262Z","title":"Genesis: Generative scene inference and sampling with object-centric latent representations","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.455262Z"},"links":{"cited_paper":"/paper/1907.13052","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:8312c922fec79af1d728ed74c3135c92519320cdd01bf10d17dc461949f4fd0f","observation_id":"6d8a2049-58fe-4748-bb8a-c73c40b2b546","resolution":{"observed_at":"2026-08-06T21:52:17.455262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.337366Z","title":"Giraffe: Representing scenes as compositional genera- tive neural feature fields","venue":null,"work_id":"bdc68b20-3791-4d45-a645-c13f067f0fd8","year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.543148Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:1e50f42b4bfa61d0e700df56a25db94484e58e10202b280eb5eb8ce65631ed52","observation_id":"a4f98124-b414-415b-a5d4-c4825010d2c2","resolution":{"observed_at":"2026-08-06T21:52:20.430818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:20.146681Z","title":"A simple neural network module for relational reasoning","venue":null,"work_id":"4d8bdfc5-e5ca-4641-ab12-f49346310ad6","year":2017},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.637002Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:27df25f6fc334685b925bf5c725cd7ad2c307b4919b3bee773b80a60e85bfd91","observation_id":"e66a6f52-80df-424c-844f-adb73f893c23","resolution":{"observed_at":"2026-08-06T21:52:20.210637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03067","last_updated":"2018-04-24T10:25:07Z","snapshot_observed_at":"2026-07-06T06:27:14.996782Z","submitted_at":"2018-03-08T12:37:14Z","title":"Compositional Attention Networks for Machine Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03067","snapshot_observed_at":"2026-08-06T21:52:17.725712Z","title":"Compositional attention networks for machine reasoning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.725712Z"},"links":{"cited_paper":"/paper/1803.03067","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:86305d190038bc86d6b3f8c71829b1967535755b18ff0058b0d834bd706bf0e2","observation_id":"0c3d53fe-8b34-406e-a0f3-bcdcb4df24c8","resolution":{"observed_at":"2026-08-06T21:52:17.725712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:17.799376Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.799376Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:275c388e042407844698327c9f70839194edaa5398fb67307d8e13d29bf2ce54","observation_id":"b22eba6e-6dc0-4ade-97a4-8535b2058c59","resolution":{"observed_at":"2026-08-06T21:52:17.799376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:17.870461Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.870461Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:5f6b03e027074617d66b00b7b9f1e9547e30ab6e40ce28bec929ce6c333fa15d","observation_id":"e8e258f8-9e15-4947-b421-1b5902e24e86","resolution":{"observed_at":"2026-08-06T21:52:17.870461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T21:52:17.945267Z","title":"GPT-4 Technical Report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:17.945267Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a0cb023d3b748db37dc3aebae3fa9034d89ed8ba1e8173b8aca62d0140d8da83","observation_id":"3eda3f9c-55df-4792-a0c4-65ce2a8f4966","resolution":{"observed_at":"2026-08-06T21:52:17.945267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:19.878846Z","title":"The Gemini 2 Model Family: Google Deepmind","venue":null,"work_id":"9fe10a14-926f-44a4-ba47-9860117b95dd","year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.015298Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:fac65e6fd16a235ffce7e17398b548067b2f0877feb7b9381ab4a6e5b8fdd5a6","observation_id":"0d9e3326-48fc-4d65-ad73-61666236654d","resolution":{"observed_at":"2026-08-06T21:52:19.994411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:19.677871Z","title":"The Grok Model Family: xAI","venue":null,"work_id":"95696eb8-d620-4e94-b96a-e2779810ac15","year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.083136Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:0e55315c60354596ca64d5c3799a8ad4728e8de7caf917c13c02bce44a7e0810","observation_id":"3c804746-c846-4535-9ac2-932819b67dd7","resolution":{"observed_at":"2026-08-06T21:52:19.789753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-06T21:52:18.167303Z","title":"Deepseek-vl2: Mixture-of-experts vision- language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.167303Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:d5b2ff622dbe13d3281e266047b47448f978e9abece8874eaea35f59fd774650","observation_id":"fd58f6e1-3696-4dba-9f93-904ae09d03a6","resolution":{"observed_at":"2026-08-06T21:52:18.167303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:52:19.576548Z","title":"Llava-next: A strong zero-shot video understanding model, 2024","venue":null,"work_id":"7d0b5cdf-91de-4c62-a52f-691eec90ad16","year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.247348Z"},"links":{"citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:275c8008cb8ae202a959ea2d8d32ec3494795f69e761430ab0c1bd70b3958ac5","observation_id":"70584297-2efd-4ea7-a61b-8ecc834cb15a","resolution":{"observed_at":"2026-08-06T21:52:19.606170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:52:18.335284Z","title":"The Llama 3 Herd of Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.335284Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:147c345b495cc6e8a9ef0506aed9bb0231327be69b4f39bff6215e1a279f9ada","observation_id":"4ba9f124-075a-4a11-962e-08cfa35bf935","resolution":{"observed_at":"2026-08-06T21:52:18.335284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13611","last_updated":"2024-10-17T14:46:34Z","snapshot_observed_at":"2026-07-06T19:35:21.868885Z","submitted_at":"2024-10-17T14:46:34Z","title":"H2OVL-Mississippi Vision Language Models Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13611","snapshot_observed_at":"2026-08-06T21:52:18.427568Z","title":"Galib, Shanshan Wang, Guanshuo Xu, Pascal Pfeiffer, Ryan Chesler, Mark Landry, and SriSatish Ambati","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.427568Z"},"links":{"cited_paper":"/paper/2410.13611","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a675792f3cba34d4f237596c89cb992b19bdabff351585700c4c58109a1552f4","observation_id":"ddad7a53-b8f2-4202-8256-79c24da2b0b9","resolution":{"observed_at":"2026-08-06T21:52:18.427568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T21:52:18.492837Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.492837Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:28cc155919620f4c2ffdea343480ed51d282a83a87cd1afa3cfbfd4d81df0d71","observation_id":"33af74a0-f683-449d-ad39-85af9eb13b2c","resolution":{"observed_at":"2026-08-06T21:52:18.492837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-06T21:52:18.563315Z","title":"Pixtral 12B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.563315Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:362eee8f2fb4a3b604399d89ee79202efcadf227a7e29885dd574f2866f7d09b","observation_id":"f76e75a6-afe5-4cc8-b853-38164d5b91a9","resolution":{"observed_at":"2026-08-06T21:52:18.563315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05993","last_updated":"2025-01-10T08:35:13Z","snapshot_observed_at":"2026-07-06T19:29:46.997580Z","submitted_at":"2024-10-08T12:44:57Z","title":"Aria: An Open Multimodal Native Mixture-of-Experts Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05993","snapshot_observed_at":"2026-08-06T21:52:18.651138Z","title":"Aria: An open multimodal native mixture-of-experts model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.651138Z"},"links":{"cited_paper":"/paper/2410.05993","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:51f527d2b94ed9ba66ebb6c3b8d09dc6346f0e2222182f23ece598460104e608","observation_id":"84e3669f-09fa-4e89-bf38-aecdd5b59f7a","resolution":{"observed_at":"2026-08-06T21:52:18.651138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.16527","last_updated":"2023-08-21T09:35:52Z","snapshot_observed_at":"2026-07-06T15:48:01.777256Z","submitted_at":"2023-06-21T14:01:01Z","title":"OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.16527","snapshot_observed_at":"2026-08-06T21:52:18.730268Z","title":"Rush, Douwe Kiela, Matthieu Cord, and Victor Sanh","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.730268Z"},"links":{"cited_paper":"/paper/2306.16527","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:b2cb47dc4df405b75d64db80fa5eb945e019ee44b7699c6c87f020ceaef609e8","observation_id":"66574c34-677a-4271-8694-6f96025fe335","resolution":{"observed_at":"2026-08-06T21:52:18.730268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-06T21:52:18.821199Z","title":"Expanding performance boundaries of open- source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.821199Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:4f00341559a6ea90f1bc24ff0878a2c931957c1f29b83d7ff9ff1285ec47cc57","observation_id":"b05f4901-3c8d-45b0-beb2-d76b513b1823","resolution":{"observed_at":"2026-08-06T21:52:18.821199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-06T21:52:18.924233Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.924233Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:bcf468c15ba0deb7183cb0f1626b0f8c2771c822bfc48b9c03c266468236797d","observation_id":"862d55c2-a190-4aa5-983e-591ccce7ca14","resolution":{"observed_at":"2026-08-06T21:52:18.924233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T21:52:18.990164Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:18.990164Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:fad2256e8e9f584c731111a873683df7b02526bc9408290a7f78db4e4c25874d","observation_id":"b1dbb342-9b92-4151-94cc-b8c1d253e240","resolution":{"observed_at":"2026-08-06T21:52:18.990164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-06T21:52:19.061479Z","title":"‘json","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:19.061479Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.23329"},"observation_digest":"sha256:a172d9d58c2be15d2bd4ed61b0087cf5167185a9dea64fd255d7b0e15bc99013","observation_id":"bbb341f6-1094-4204-bbad-c1ad333a3a6b","resolution":{"observed_at":"2026-08-06T21:52:19.061479Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.23329","last_updated":"2025-06-29T17:02:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T17:07:15.412812Z","submitted_at":"2025-06-29T17:02:57Z","title":"IR3D-Bench: Evaluating Vision-Language Model Scene Understanding as Agentic Inverse Rendering"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 4 inbound Pith citation observations for arXiv:2506.23329."}