{"as_of":"2026-08-11T12:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecb70cc009884ee80ee990fbb770fa12b4e5dcf0e8b39a23e7685361ea6084cf","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T13:50:19.988813Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:13:38.497502Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T14:08:21.569823Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2604.09781","last_updated":"2026-06-29T09:07:17Z","snapshot_observed_at":"2026-07-12T23:07:19.301563Z","submitted_at":"2026-04-10T18:06:02Z","title":"Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:48.506049Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2604.09781"},"observation_digest":"sha256:46fe84cb79cfee73e72df65737649b2eb90dd024dd1ab13c019cafcb10367285","observation_id":"12434dbf-3219-4d9f-b3e0-4d18c75df05f","resolution":{"observed_at":"2026-05-11T07:51:01.973346Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-12T23:07:40.699400Z","title":"arXiv:2601.11109 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2604.09781","last_updated":"2026-06-29T09:07:17Z","snapshot_observed_at":"2026-07-12T23:07:19.301563Z","submitted_at":"2026-04-10T18:06:02Z","title":"Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-12T23:07:40.699400Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2604.09781"},"observation_digest":"sha256:94e728bddfe472cbecf36439a41fc3b3b1fe80ef0d36b572c4c9e8d329eaaaa0","observation_id":"ad32293e-0ed6-4ddb-b58e-7c4ef210f2e1","resolution":{"observed_at":"2026-07-12T23:07:40.699400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2604.19907","last_updated":"2026-04-21T18:33:15Z","snapshot_observed_at":"2026-07-06T23:06:26.596990Z","submitted_at":"2026-04-21T18:33:15Z","title":"SceneOrchestra: Efficient Agentic 3D Scene Synthesis via Full Tool-Call Trajectory Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-10T03:22:30.012610Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2604.19907"},"observation_digest":"sha256:86dd63d9f8837d65bcc11b634665b97bb6b214b5e3ab849220b91a5c10a19f14","observation_id":"73ccf823-7d85-42f2-8bec-3f0b0dffde40","resolution":{"observed_at":"2026-05-11T12:31:06.664620Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2605.12449","last_updated":"2026-05-12T17:40:38Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:40:38Z","title":"LychSim: A Controllable and Interactive Simulation Framework for Vision Research","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-13T06:26:14.825783Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2605.12449"},"observation_digest":"sha256:2ff13864c9cc27ebd317d91afa7bdb4db85dad61dc9edd34c5ba716bf12f4758","observation_id":"05bf3e08-cbd7-44fa-8a2c-7a5eeeb91c75","resolution":{"observed_at":"2026-05-13T06:27:24.568631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2605.18451","last_updated":"2026-05-18T14:18:36Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:18:36Z","title":"Code-as-Room: Generating 3D Rooms from Top-Down View Images via Agentic Code Synthesis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T11:49:53.113415Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2605.18451"},"observation_digest":"sha256:b478aecee3536272005db0ef33c648276b25f26d965ade214887e2bcae6af277","observation_id":"233093c2-e75f-402c-bc90-12aede6a698b","resolution":{"observed_at":"2026-05-20T11:53:15.009674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2605.30338","last_updated":"2026-05-28T17:59:01Z","snapshot_observed_at":"2026-07-06T23:39:38.845840Z","submitted_at":"2026-05-28T17:59:01Z","title":"REST3D: Reconstructing Physically Stable 3D Scenes from a Single Image","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T07:44:41.469789Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2605.30338"},"observation_digest":"sha256:a066335a0fe678478eeaeaeda93fb5bdbf546558c2f73b98d5ae06b8d165f111","observation_id":"ec967844-92aa-481f-86ff-3215e6faa23b","resolution":{"observed_at":"2026-06-29T07:53:14.077572Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2606.02580","last_updated":"2026-06-01T17:59:53Z","snapshot_observed_at":"2026-08-07T05:56:16.163586Z","submitted_at":"2026-06-01T17:59:53Z","title":"Thinking in Blender: Staged Executable Inverse Graphics with Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T15:04:01.773923Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2606.02580"},"observation_digest":"sha256:c690d999c3b527a116ec4fb50f321a5dc3760c28491b29350fd725baf76a04b0","observation_id":"7d1a75a9-4996-482e-bee2-7cdeaae4ebeb","resolution":{"observed_at":"2026-07-01T22:46:19.340650Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2606.08402","last_updated":"2026-06-16T06:24:38Z","snapshot_observed_at":"2026-08-03T11:49:18.264925Z","submitted_at":"2026-06-07T01:38:39Z","title":"SceneConductor: 3D Scene Generation from a Single Image with Multi-Agent Orchestration","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T19:08:08.329817Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2606.08402"},"observation_digest":"sha256:93853c579cd199a257b0b91ca614ca69d93a712edc148bb2c745447dcf13a031","observation_id":"3e449962-bc7c-47f3-9cf4-681470997143","resolution":{"observed_at":"2026-07-02T22:07:26.681136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2606.11152","last_updated":"2026-06-10T16:12:45Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:36:34Z","title":"P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T13:48:07.845039Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2606.11152"},"observation_digest":"sha256:f8210ab0951b9df86b814ab1f32e7cc99df94b14dc34f0698396bb24c0e32a11","observation_id":"bf1e5520-b144-4cee-a9a0-b5aad6b724ac","resolution":{"observed_at":"2026-07-03T04:37:37.018009Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2606.31388","last_updated":"2026-06-30T09:16:21Z","snapshot_observed_at":"2026-08-02T07:18:38.830324Z","submitted_at":"2026-06-30T09:16:21Z","title":"One Video, One World: Turning Monocular Video into Physical 4D Scenes","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-07-01T05:38:19.541391Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2606.31388"},"observation_digest":"sha256:7c3838ab2f52bbdde6680677c528086a049b0dedd684c618b005a354960dde9a","observation_id":"b992f767-7967-42cf-ad78-a615661714b5","resolution":{"observed_at":"2026-07-01T10:15:44.975015Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":"2601.11109","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-03T14:08:21.569823Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","venue":"cs.CV","work_id":"e619db7b-0f78-4797-981e-d0ba4483b5ea","year":2026},"citing_paper":{"arxiv_id":"2607.01766","last_updated":"2026-07-02T06:29:18Z","snapshot_observed_at":"2026-07-07T00:07:19.026006Z","submitted_at":"2026-07-02T06:29:18Z","title":"SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-03T13:58:48.681254Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2607.01766"},"observation_digest":"sha256:3cef06018a2390121a186241317879fe1554a59f829d7aec6f6b17f9edb48bbe","observation_id":"e891bd6f-f983-46fb-9bdb-574c2688185d","resolution":{"observed_at":"2026-07-03T14:08:21.570989Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-07-14T07:27:08.281893Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11044","last_updated":"2026-07-13T03:13:39Z","snapshot_observed_at":"2026-08-07T01:14:39.218300Z","submitted_at":"2026-07-13T03:13:39Z","title":"RetroHolmes: When Semantic Plausibility Fails Retrospective Physical Process Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T07:27:08.281893Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2607.11044"},"observation_digest":"sha256:637ec13b24c7a7cfede368e76a263f6edaad9f598669977a8530b0184dcd0b2f","observation_id":"d4df9963-96db-47a8-9f5c-bbf1c540e153","resolution":{"observed_at":"2026-07-14T07:27:08.281893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-08-01T22:27:52.771740Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16355","last_updated":"2026-07-17T08:55:09Z","snapshot_observed_at":"2026-08-06T21:24:19.058779Z","submitted_at":"2026-07-17T08:55:09Z","title":"PhysAgent: Reflective Agentic Physics Control for Physically Plausible Video Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T22:27:52.771740Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2607.16355"},"observation_digest":"sha256:2c37c18040b4d5653740cb31ebba97bf380fc903ba7a875b86f08c16cd28c3dc","observation_id":"e9f83500-712b-42d9-94c2-2f4dd2aaf774","resolution":{"observed_at":"2026-08-01T22:27:52.771740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-08-01T09:10:35.430779Z","title":"arXiv preprint arXiv:2601.11109 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20889","last_updated":"2026-07-23T03:26:02Z","snapshot_observed_at":"2026-08-08T20:50:31.542667Z","submitted_at":"2026-07-23T03:26:02Z","title":"Engine-Native Editable 3D World Reconstruction with Objects and Lighting","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T09:10:35.430779Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2607.20889"},"observation_digest":"sha256:e74725c08e15d4f1d435b67efcb46fbe9e21165388e8ce6a2b2a61d408b97ad2","observation_id":"933db3c9-f77e-4290-99c6-26cf3c1ba743","resolution":{"observed_at":"2026-08-01T09:10:35.430779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-08-01T07:14:42.538868Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21522","last_updated":"2026-07-23T17:04:36Z","snapshot_observed_at":"2026-08-07T01:35:32.908201Z","submitted_at":"2026-07-23T17:04:36Z","title":"GS-Agent: Creating 4D Physical Worlds With Generative Simulation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-01T07:14:42.538868Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2607.21522"},"observation_digest":"sha256:45bc8791f63a6d6aa8b8918210709464d6e235fd4e0d6ebf7e85ac39e73eaee8","observation_id":"9d8488da-0138-4911-b589-d0f22ddd9d42","resolution":{"observed_at":"2026-08-01T07:14:42.538868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11109","snapshot_observed_at":"2026-08-08T17:13:38.497502Z","title":"Vision-as-inverse-graphics agent via interleaved multimodal reasoning.arXiv preprint arXiv:2601.11109, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.05248","last_updated":"2026-08-05T15:46:38Z","snapshot_observed_at":"2026-08-09T23:10:24.503797Z","submitted_at":"2026-08-05T15:46:38Z","title":"WorldClaw: Agentic 3D Open-World Generation at Scale","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-08T17:13:38.497502Z"},"links":{"cited_paper":"/paper/2601.11109","citing_paper":"/paper/2608.05248"},"observation_digest":"sha256:6cd769f587a7e904f3f16449ee37d13ab710faaac8749ac21970da7a576c3fe6","observation_id":"3b8bc932-0f4f-4ce2-b3f4-bd13d13cddaf","resolution":{"observed_at":"2026-08-08T17:13:38.497502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.11109/citation-record","integrity":"/paper/2601.11109/integrity","json":"/paper/2601.11109/citation-record.json","paper":"/paper/2601.11109"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.09675","last_updated":"2024-02-05T01:59:31Z","snapshot_observed_at":"2026-07-06T17:44:45.924645Z","submitted_at":"2024-02-05T01:59:31Z","title":"Open-Universe Indoor Scene Generation using LLM Program Synthesis and Uncurated Object Databases","version":1},"cited_work":{"arxiv_id":"2403.09675","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.09675","snapshot_observed_at":"2026-07-03T13:28:18.318367Z","title":"Kenny Jones, Qiuhong Anna Wei, Kailiang Fu, and Daniel Ritchie","venue":null,"work_id":"cfb31cbc-2cf9-4d7c-be4d-556025bdda1f","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2403.09675","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:4c96ef088fd42da55a708d62d56fff38ca6e4ac751a5feaf8a81f906d2bf7a52","observation_id":"371c5de1-0fc7-4f98-8964-caa73b782aa0","resolution":{"observed_at":"2026-05-16T13:51:00.618680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieved from https://deepmind.google/models/gemini/pro/ 22","venue":null,"work_id":"2274099c-a138-4729-a77a-78cc99f5cf99","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:254675cf73455c48eb3233d0956989b5071a80963554f65444c58f2ad322fbf7","observation_id":"b527588f-3ccc-42be-973b-84b89c6335e3","resolution":{"observed_at":"2026-05-16T13:51:00.798004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieved from https://docs.cloud.google.com/vertex- ai/generative-ai/docs/partner-models/claude/sonnet-4 22","venue":null,"work_id":"03681da4-0517-48dd-a86b-fe0821cd8b5d","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:667869e58c89ec10af1e49c1b451b2e2e75ba9209503c1361fcaa98689dbc965","observation_id":"164f08a6-a54c-4c04-9b02-566c5954b76b","resolution":{"observed_at":"2026-05-16T13:51:00.802405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"34a0681c-9aef-4c17-8bbb-620328c8e8ec","year":2026},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:eb1737ed6336f1f5f9263b5ff649592ebf8e89970a786f9d0d68a581e844ad17","observation_id":"8ecbb215-b6d2-4639-ba5c-a0f0e681b0e1","resolution":{"observed_at":"2026-05-16T13:51:00.793704Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02158","last_updated":"2025-06-02T18:39:55Z","snapshot_observed_at":"2026-08-11T04:38:59.465494Z","submitted_at":"2025-06-02T18:39:55Z","title":"Reflection-Based Memory For Web navigation Agents","version":1},"cited_work":{"arxiv_id":"2506.02158","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02158","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"49a4977e-62f2-4726-8fe7-7ced8577feef","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2506.02158","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:2db6a4832fb34999e0b18f4b919dc4660c1acbaff4d7696c0fd3ea039e3dc8d7","observation_id":"7cf3085e-b683-4840-b211-be58240804eb","resolution":{"observed_at":"2026-05-16T13:51:00.615430Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Mahamood, S., Minh, N.L., Ippolito, D","venue":null,"work_id":"f2aac72e-6ef4-4f68-8b48-976195973e82","year":null},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:e4f901ac8f6eb6b4ff0bb8bee103d8c9833a8e0f29716cc639e3a1e3f9b133d2","observation_id":"0b501b7a-0aa3-49d4-abcc-4513611c61b1","resolution":{"observed_at":"2026-05-16T13:51:00.808281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.inlg-main.184","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://doi.org/10.18653/v1/2024.inlg-main.184","venue":null,"work_id":"d9b4addb-a5c2-44d5-81a0-ce318d51b639","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:18fbb0c011e2a7a6ed9656d871c79ec1c060fa72b90125bbb41d73385859ea22","observation_id":"8dc5bddb-07ea-4b2c-9b08-e6c8fda876aa","resolution":{"observed_at":"2026-05-16T13:51:00.548634Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Seminal Graphics Papers: Pushing the Boundaries, Volume 2 (1999),https: //api.semanticscholar.org/CorpusID:2037052112","venue":null,"work_id":"7a4f2a52-2cc7-4b09-b73d-39a167bc1e04","year":1999},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:2e61da0d8f04b2463cd139009158e31860f3cd8cf16d887c9d6e3ee717d23039","observation_id":"d609d1c3-e535-4552-92b3-414fcdb573ee","resolution":{"observed_at":"2026-05-16T13:51:00.800364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"7ed49fd3-b324-4bca-8a33-446e59d90855","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:ec390041b5866e33c9796b4ce0b0f3a544e6b2d28180ad2f987ac2f41126af32","observation_id":"d5af8d3f-9186-4b77-9d55-809644fa4f07","resolution":{"observed_at":"2026-05-16T13:51:00.791578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2024) 4","venue":null,"work_id":"05acd1e2-e569-4de0-8d16-bcca7259dc68","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:28440468732ae895c2e8c038b25ba5cebb28da6c3bdf2377b0a13b01f879b956","observation_id":"407a0dc7-594c-45b0-81ec-cf1d4d6d2aa7","resolution":{"observed_at":"2026-05-16T13:51:00.795979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: NeurIPS (2022), outstanding Paper Award 4","venue":null,"work_id":"08784019-2dc0-4a70-847a-25142ebf7ece","year":2022},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:2a70e9143b420c80d1fddaa7f59d92c8b0ba5c4fc732d8e39e2aa49ba7c97b8f","observation_id":"5f81eebe-1ad7-4115-ae69-72cad6d5a42d","resolution":{"observed_at":"2026-05-16T13:51:00.814147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the British Machine Vision Conference (BMVC)","venue":null,"work_id":"e85a32b5-9e5a-4832-8b88-49312b80355b","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:3d284be8f6faa5f0ff2fb33db3a0af2379218d79274e85bbfd33b69f79c6a811","observation_id":"444e5b12-2622-44a3-9302-58fee1755a50","resolution":{"observed_at":"2026-05-16T13:51:00.804251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 37th International Conference on Neural Information Processing Systems","venue":null,"work_id":"9d781827-6bc3-4f23-9638-1add1b795ab3","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:841ef34e96d227edf4343ae316114a3e35d05d5833edf17eb994e53825cde867","observation_id":"4343d635-5364-4de9-bb4d-7a95fe1c92b0","resolution":{"observed_at":"2026-05-16T13:51:00.806393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ACM Transactions on Graphics (ToG), Proc","venue":null,"work_id":"16bef6e4-34a6-44ee-adb9-cafb426815cd","year":2021},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:515586ffbdd6e49cedf4d7de1b8f51d8007b41c3e71d5a0a022687f427484b8b","observation_id":"484d6337-c0f9-43b1-8518-502f5028c185","resolution":{"observed_at":"2026-05-16T13:51:00.810281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"b289d098-197a-4ed3-ba33-6bbebd76c1d5","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:64ee59322da8e9480fdcfc2b1349c3979728f1a52d4f771bf28473d6f4f52e42","observation_id":"541e9ff6-9545-4429-8ce9-bfd7d4e6639a","resolution":{"observed_at":"2026-05-16T13:51:00.860950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"e9460737-8997-490a-a69b-5c179aae3832","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:7cf06f23d1cb0b8e9111614fb4e13c198c1aa037cf08300a21c38b4c6488b31f","observation_id":"60d50e7d-a8b3-4a7f-ac73-c75935132fc0","resolution":{"observed_at":"2026-05-16T13:51:00.850281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"61e7e659-3d53-4426-9f99-2e0ec9aa4591","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:1573406b6708967ff215139b2e513f29b012c9f0c39632e3f5102490430ca0ab","observation_id":"9409b5e1-e2b5-4269-bda1-2c4e5a47e506","resolution":{"observed_at":"2026-05-16T13:51:00.867204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1561/2500000010","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Founda- tions and Trends® in Programming Languages 4(1-2), 1–119 (2017)","venue":"Foundations and Trends® in Programming Languages","work_id":"425f7a57-a70f-4464-808f-11b26a0cda5a","year":2017},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:ad6199581c4a804c02f5b57094a2bf453649d9c4b028f5e21f8aba2102c1bccd","observation_id":"f8130f4e-dbe3-494f-8107-6995eefdc330","resolution":{"observed_at":"2026-05-16T13:51:00.539776Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T20:22:43.858187+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T20:22:43.858187+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":"5b725707-bf1f-4bcb-85a3-151fa13fca1b","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:6fcabbd509e3a5961025bedc86ab8bedd9dd09f36e374c866f0591031f8be61f","observation_id":"cd414a45-69a3-43e1-b9e2-6445f6a81cc7","resolution":{"observed_at":"2026-05-16T13:51:00.886490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3712003","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:44:40.486861Z","title":"Llm-based multi-agent systems for software engineering: Literature review, vision, and the road ahead.ACM Trans.Softw","venue":"ACM Transactions on Software Engineering and Methodology","work_id":"0caaec0f-69fb-4b25-add7-217ae6f62d51","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:293dd4278816011ebef4d389345546a61102a318c684460c4497e63cac9203df","observation_id":"c5ff00fa-d536-4160-8ace-9c389acc50dd","resolution":{"observed_at":"2026-05-16T13:51:00.530952Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-07-12T02:20:27.767336+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T02:20:27.767336+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1a40c69a-3683-4999-aa77-6eb1ea63d4f1","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:136d50292d3c093f2957e4a71d50423cd429e42789a8a2fe494a40a4ec466d35","observation_id":"21fa6a76-cd7c-4afa-839e-26bdf5d9b1ca","resolution":{"observed_at":"2026-05-16T13:51:00.854817Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS)","venue":null,"work_id":"15d4cfef-8e33-4fe6-b3f7-5502e9a404c6","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:d5ef74b9fc89fea24d40c1e15631c04774502a772764f0c81d3237d2d272bbdb","observation_id":"f340bcf5-1739-47a8-936d-06356552470b","resolution":{"observed_at":"2026-05-16T13:51:00.865280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"834ab465-3777-4c06-8c2d-4dad5d70d45f","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:90b1cadee53c677749063bbeb47303ebd04c0e10cb0681a6cd608b72efda7fe6","observation_id":"878fd20e-0dbd-47ff-8fdf-d7f80e3ca6ef","resolution":{"observed_at":"2026-05-16T13:51:00.855680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Forty-first International Conference on Machine Learning (2024) 4","venue":null,"work_id":"6de0ca8f-df88-46de-8ff4-b37c473ae79f","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:79d156919bb55ee57ecc7359d4da644fc34b8efce5d6cfbf8e0765b3cd598b0a","observation_id":"8a98f5e5-2177-4678-80a4-f37001827aec","resolution":{"observed_at":"2026-05-16T13:51:00.852689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision","venue":null,"work_id":"0e225923-124f-4ea4-b051-462615ba65b8","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:267e367cef7be234c068c57a22bb4a2073ec5f19a6604430913b21ee623d3caa","observation_id":"5c79f49c-924f-4bcc-8aed-a1a2bf98b6b0","resolution":{"observed_at":"2026-05-16T13:51:00.848218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"0548.361821","doi":"10.1145/3610548.36182194","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: ACM SIGGRAPH Asia 2023 Conference Papers","venue":null,"work_id":"9481e5d0-b337-44b1-bb9a-ed30625d9752","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:29acab6791530a9fe92d3788d62cc4332bbdfe9c6a17fbc042dea1c68fa46846","observation_id":"e8976720-1c81-4e36-8a37-811d8449837d","resolution":{"observed_at":"2026-05-16T13:51:00.543037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: ICLR 2024 Workshop on Large Language Model (LLM) Agents (2024),https://openreview.net/ forum?id=RPKxrKTJbj4","venue":null,"work_id":"a9a2a384-ced4-43ee-bb90-f527539f3f4a","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:730f8d22e4c5802f605715f0b7b1753ad17426d7ff6ec1bb41d6f9fbe117b00e","observation_id":"6fb05802-7256-427e-8fda-30bf651d87e6","resolution":{"observed_at":"2026-05-16T13:51:00.863043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions on Machine Learning Research (2024) 5","venue":null,"work_id":"898b10cf-0986-463c-9b80-da6ada8b1553","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:74f99c29ee233cc70e96aaccfb4dfa573d10e2bf1ce8f05577621d44c67abc74","observation_id":"207aa4ea-dbdb-4e23-a81b-c0d571f9d4e3","resolution":{"observed_at":"2026-05-16T13:51:00.888571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"d769930c-f547-4baa-a1c1-de02b37eccc0","year":2015},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:8f86d979b329c42a2c8b11107c46bf44d7bc0e1171d148521a2c304dcae95ae6","observation_id":"f399d897-2f0e-42e8-8823-72affdf89085","resolution":{"observed_at":"2026-05-16T13:51:00.869170Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02836","last_updated":"2025-05-05T17:59:58Z","snapshot_observed_at":"2026-08-07T15:56:18.164743Z","submitted_at":"2025-05-05T17:59:58Z","title":"Scenethesis: A Language and Vision Agentic Framework for 3D Scene Generation","version":1},"cited_work":{"arxiv_id":"2505.02836","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.02836","snapshot_observed_at":"2026-07-04T06:09:37.256195Z","title":"Scenethesis: A language and vision agentic framework for 3d scene generation","venue":null,"work_id":"30f1cb71-9f42-4e54-bf65-ab62eef4c221","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2505.02836","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:95097fa2438992846102df3572d63c844df95d54e94caad890f3f2185cdbb2c2","observation_id":"26543a02-6378-46d7-9a85-33f1673708c1","resolution":{"observed_at":"2026-05-16T13:51:00.560832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1162/tacl_a_006388","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics12, 157–173 (2024).https://doi.org/10.1162/tacl_a_006388","venue":null,"work_id":"f71e88fe-0420-46b9-b363-d3621d1fd9a5","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:88f39309b92eaaa5917ed6db2d0aa7586e056496de6afe003f43c14576a707c6","observation_id":"5c744b66-c031-4f5a-8bb9-f76855bc56a4","resolution":{"observed_at":"2026-05-16T13:51:00.528281Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 IEEE/CVF International Con- ference on Computer Vision (ICCV) pp","venue":null,"work_id":"45410761-5954-44e3-a05b-be29b8ce8a81","year":2019},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:6110eabb1adb28eaa1efdc821b49f6dc0983fb6eea9011a581d732ff46d6c120","observation_id":"13af9cb6-c9c3-4893-919f-bc8dc4bd4168","resolution":{"observed_at":"2026-05-16T13:51:00.840621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: European Conference on Computer Vision (2014), https : / / api","venue":null,"work_id":"690ce21b-1128-45ce-bd38-23ae2264a43e","year":2014},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:e3b1cc3aac9cca5e13aff4ccc462f454e86c5670cc029c1d35be6bcaa2bd818d","observation_id":"c81bc145-271a-486c-9224-9aec7c6d6165","resolution":{"observed_at":"2026-05-16T13:51:00.856973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"95d0ceaf-04a7-4ef4-b488-48dc850c4178","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:a90d697ceda26101183c6aa292d4095fa519b63aca38d60481712e1bfe78030c","observation_id":"9ca72ab7-c5ef-402f-be68-5254b961c7b6","resolution":{"observed_at":"2026-05-16T13:51:00.873364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:16:16.764150Z","title":"In: Proc","venue":null,"work_id":"452f975d-5e1f-47e0-967f-db1ed9da0d80","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:b53eb86a4a9a43c915181274157c260c1275a59d0ddde387fcf217604c2bc370","observation_id":"8a58ab86-189b-461a-b252-ff97ea8c8174","resolution":{"observed_at":"2026-05-16T13:51:00.537582Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieved from https://cdn.openai.com/gpt-4o-system-card.pdf 22","venue":null,"work_id":"a2e58ba1-f44e-45d3-8f25-73a5b8b4ea85","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:5e732bf322964664d1e47abf7d6f13b5fb59228aaf285887cbec031b9bd8af46","observation_id":"8fe158ad-1e68-4968-ace2-4c000babd0fc","resolution":{"observed_at":"2026-05-16T13:51:00.842666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"26b5cee0-56f1-4b7d-9dd6-b5f8e1e2378d","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:e004e40e134e9a27452f52fc363ed75387946c3fff760db3f6ec9a8de0215e4e","observation_id":"e53af463-6432-487f-8608-e63c38be9800","resolution":{"observed_at":"2026-05-16T13:51:00.835682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) pp","venue":null,"work_id":"cc49279e-14a3-4aa8-8d02-0754ce17af25","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:7495537041dd859c4e4e05e1e3b12062e7e6c99aafa34d6587d861ca19ca9fac","observation_id":"aec74e1c-1346-44ef-8790-e3bd404c777c","resolution":{"observed_at":"2026-05-16T13:51:00.837965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12326","last_updated":"2025-01-21T17:48:10Z","snapshot_observed_at":"2026-07-06T20:23:58.426780Z","submitted_at":"2025-01-21T17:48:10Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","version":1},"cited_work":{"arxiv_id":"2501.12326","doi":"10.48550/arxiv.2501.12326","metadata_source":"pith","pith_arxiv_id":"2501.12326","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UI-TARS: Pioneering Automated GUI Interaction with Native Agents","venue":"cs.AI","work_id":"0bbcf263-a46d-4525-a438-11fce3316568","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2501.12326","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:ff42e91e5cd405f5bfad935499e0936e199ba93cc924928666e0ec1c82ac7a2f","observation_id":"ec5bcde4-39a0-4ec3-8bb4-aa7f4460780f","resolution":{"observed_at":"2026-05-16T13:51:00.606417Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T22:22:19.638951+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"J.: Infinite photorealistic worlds using procedural generation","venue":null,"work_id":"8397ddda-f999-456b-bb88-b7522c4f96dd","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:2aff5945f764a894c4e723c9a110b04bbe68f881029ae3f6bace2f7c41071c01","observation_id":"1c76c414-2e31-4329-b358-5c0f8eb4cb8d","resolution":{"observed_at":"2026-05-16T13:51:00.845206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"9c14e033-27dc-4472-b446-6a7a191ca602","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:6d88ce425b44b538c248ca8054fbb5078c251a696eed50ec7f2925f32ca23067","observation_id":"cbeda6c2-20d7-42c4-aa65-6af3af57ef49","resolution":{"observed_at":"2026-05-16T13:51:00.818648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1111/cgf.147754","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Computer Graphics Forum42(2), 545–568 (2023),https://onlinelibrary.wiley.com/doi/ abs/10.1111/cgf.147754","venue":null,"work_id":"19d6186f-492a-4744-a7ff-a75e5e892578","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:ece7579f65ca229a8f193ace16a9b0d68b934af57bc5e8ece7822141e04800f4","observation_id":"dcb0fb20-8b0e-4a97-b101-5e514784ca79","resolution":{"observed_at":"2026-05-16T13:51:00.546030Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e37471b0-0015-4cfc-bf2d-6b890ef84c38","year":1963},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:c1ab3ca7b152edd7b7a8a39873a5c06871717940aa2d814de13e569a941460e9","observation_id":"fed75475-b447-4ee4-9a42-05b0c2057468","resolution":{"observed_at":"2026-05-16T13:51:00.884547Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05392","last_updated":"2023-06-08T17:45:14Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:45:14Z","title":"Modular Visual Question Answering via Code Generation","version":1},"cited_work":{"arxiv_id":"2306.05392","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.05392","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.05392 (2023) 4","venue":null,"work_id":"03a1510c-5771-4bfe-9483-3f327ebfd38e","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2306.05392","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:5b52fa99e097873d960f5dcc1560d3e678fe36ab56adcc7838631df870ffc04d","observation_id":"9f6a2258-fcd0-4f7b-9d1e-b470ce550375","resolution":{"observed_at":"2026-05-16T13:51:00.599385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: 2025 International Conference on 3D Vision (3DV)","venue":null,"work_id":"fec2f6f5-8820-4b35-8f7e-c248527ef29c","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:8f42efb6b073d9913c2388a88fd1a41fefb4b06d93f0e94606dc40847d769e08","observation_id":"3c184239-d8fc-4f6c-96a5-5f73dcc8795d","resolution":{"observed_at":"2026-05-16T13:51:00.820589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"9f33082f-a42c-4eaa-82aa-2b2766e2df12","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:61c0e12c9e6e019a672565ea55a8ca3281f130ade35015384f9efc8b8f893f6f","observation_id":"4ba3e97b-74b5-4a40-a4b8-793b50e84fa1","resolution":{"observed_at":"2026-05-16T13:51:00.875369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06484","last_updated":"2025-08-19T19:36:27Z","snapshot_observed_at":"2026-08-07T09:17:00.032323Z","submitted_at":"2025-07-09T02:00:17Z","title":"3D-Generalist: Self-Improving Vision-Language-Action Models for Crafting 3D Worlds","version":2},"cited_work":{"arxiv_id":"2507.06484","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.06484","snapshot_observed_at":"2026-07-02T03:56:34.752902Z","title":"3d-generalist: Self-improving vision-language-action models for crafting 3d worlds","venue":null,"work_id":"6158aec4-fec5-421f-af05-4eed17f71d07","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2507.06484","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:d9b8beceb0aa91b9f3ff13eeae901007716be5e18d5b5f7faab88be013f34b93","observation_id":"f4882744-93ec-4c58-b0f6-95ce98fe92b5","resolution":{"observed_at":"2026-05-16T13:51:00.591108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":"6b234e8a-4b08-47a3-9598-cd0890eb9933","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:292fc3458fd60728073351bfa7171edbf7d8ef93677aa2f88e61ddd93afa3ec5","observation_id":"a5d730dc-0dda-4224-9629-1aac5f84fbeb","resolution":{"observed_at":"2026-05-16T13:51:00.828073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07952","last_updated":"2025-04-10T17:57:33Z","snapshot_observed_at":"2026-08-07T16:06:45.454822Z","submitted_at":"2025-04-10T17:57:33Z","title":"Dynamic Cheatsheet: Test-Time Learning with Adaptive Memory","version":1},"cited_work":{"arxiv_id":"2504.07952","doi":"10.48550/arxiv.2504.07952","metadata_source":"pith","pith_arxiv_id":"2504.07952","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dy- namic cheatsheet: Test-time learning with adaptive memory, 2025.URL https://arxiv","venue":"cs.LG","work_id":"c456160c-605b-4bcb-b322-6d1c3572bac4","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2504.07952","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:406becbee32d4a82c0ab91710acf1bb82d49f546f43aa04aa9cccd88c2aaf9c6","observation_id":"e940b29a-a7b7-49af-9b20-ca6569117ba6","resolution":{"observed_at":"2026-05-16T13:51:00.612599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07964","last_updated":"2025-06-09T17:39:48Z","snapshot_observed_at":"2026-08-11T09:36:52.750486Z","submitted_at":"2025-06-09T17:39:48Z","title":"SlideCoder: Layout-aware RAG-enhanced Hierarchical Slide Generation from Design","version":1},"cited_work":{"arxiv_id":"2506.07964","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07964","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1d9c0d9-0969-4b57-8541-018d8aeec756","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2506.07964","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:c7446c2d1c5286d8db7b2a5eeb53dbd5a2879b57d84f9da8a86545142f18c5e4","observation_id":"2bd1b1b6-6899-4aa2-b738-1a9fd0ffbb9d","resolution":{"observed_at":"2026-05-16T13:51:00.573620Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.03463","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2510.03463 , year=","venue":null,"work_id":"7a7ced0e-1e6c-46f6-bebf-d6a7ad3a7a41","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:41a6a3ee41583830e3ddead9a8f64eff2cfc6649e1e9cfa1c4a360fb4fb13f5b","observation_id":"b39c00d0-844e-43db-ba82-e0a3289bfaf6","resolution":{"observed_at":"2026-05-16T13:51:00.602888Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16624","last_updated":"2025-11-20T18:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:31:46Z","title":"SAM 3D: 3Dfy Anything in Images","version":1},"cited_work":{"arxiv_id":"2511.16624","doi":"10.48550/arxiv.2511.16624","metadata_source":"pith","pith_arxiv_id":"2511.16624","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SAM 3D: 3Dfy Anything in Images","venue":"cs.CV","work_id":"dc22e9ff-fcf5-4069-8ace-35ae3a0bfd7c","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2511.16624","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:1073940c123eb4208e9b525a6c18b584a9a383b056531ff18c4f40b554f66b87","observation_id":"6e5053e8-0703-41f2-8bac-514772dd65a9","resolution":{"observed_at":"2026-05-16T13:51:00.584496Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10d43bc1-7833-44dc-b9f7-8b31475f8695","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:124869b0eec0ab4af97bc9c5b0f1775068283f6e830aa294f50baa4eb0e2f67b","observation_id":"e64402fb-efde-4794-b56c-3899fddbd8a4","resolution":{"observed_at":"2026-05-16T13:51:00.829895Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"6027.375501","doi":"10.1145/3746027.37550114","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"4d90c285-634e-4c35-8b23-9dc4e60054b7","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:3a33e8b447959f781342722bb8ad7e7b536c027f93fc2e9f01c613954d93be50","observation_id":"acc1807f-a41c-45d3-ad2b-5c4f825ee005","resolution":{"observed_at":"2026-05-16T13:51:00.534303Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the 38th International Conference on Neural Information Processing Systems","venue":null,"work_id":"177ddb3b-8715-47f6-b0de-291969153916","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:d06bb4f7acf73ac1a5f4ec826a5f92bde33a0a3a0aea2b2dd833197ad535a12b","observation_id":"a67acf95-4f45-4594-b75c-bc98d67f28bf","resolution":{"observed_at":"2026-05-16T13:51:00.877766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Forty-second International Conference on Machine Learning (2025),https: //openreview.net/forum?id=NTAhi2JEEE4","venue":null,"work_id":"8309ea5b-6ad8-4805-926c-2f1d54ad5cb7","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:33121ef7ccad1464e1715e765096abc0b9d8b3695b695f0bfdf5dfce33060c5d","observation_id":"a8e9b2eb-b72c-440d-8f6c-3e59bb729acb","resolution":{"observed_at":"2026-05-16T13:51:00.879889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (2017) 2, 5","venue":null,"work_id":"2a95e164-bcf8-4f7c-acb8-648d3c53a7d6","year":2017},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:3089f3af3c37c7588f867fdf7adc20cff8015c109517332b60e58f4b5863519c","observation_id":"e7e59146-2991-4fad-8d4c-aab0a9d2c9ae","resolution":{"observed_at":"2026-05-16T13:51:00.825895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2025 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) pp","venue":null,"work_id":"4122017c-a6cd-4317-b18a-1366f4f4b5ee","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:bd0a1ef69d16e799cf521ef3d6aae168ec8ccf683a2cb8561d1651b23d62c987","observation_id":"878097ad-f5d3-440c-8bd3-27ab10c34382","resolution":{"observed_at":"2026-05-16T13:51:00.882064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track (2024), https://openreview.net/forum?id=tN61DTr4Ed4","venue":null,"work_id":"06bd6cc9-54cc-4dbc-aa32-843b39e557a4","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:8a0e311be711b33736d4056c7cd75de7739a671bb252e4d1f3aac412e85bda0a","observation_id":"7a0011f9-d010-4d99-9c6a-1fb655c36175","resolution":{"observed_at":"2026-05-16T13:51:00.890671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.11102","last_updated":"2025-03-25T15:35:29Z","snapshot_observed_at":"2026-07-06T20:07:14.913902Z","submitted_at":"2024-12-15T07:49:31Z","title":"Empowering LLMs to Understand and Generate Complex Vector Graphics","version":3},"cited_work":{"arxiv_id":"2412.11102","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.11102","snapshot_observed_at":"2026-06-30T13:54:43.828660Z","title":"Empowering llms to understand and generate complex vector graphics","venue":null,"work_id":"9a7565c8-cb7a-48f6-a8e6-86a33abf0e49","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2412.11102","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:432f9a1552643e31dbb7792916fdc5d80dfad2282cde6991cb810cf214822326","observation_id":"1d861f24-5261-44cb-b1b8-8d61f35c727c","resolution":{"observed_at":"2026-05-16T13:51:00.595047Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Advances in Neural Information Processing Systems (2025) 4","venue":null,"work_id":"09011612-8ecc-4e15-84e4-2b9baddcef42","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:b7fd6dcbfd34aad076f2cd5d34ce2d3b02a38f31db1fead4ef38f819b848a200","observation_id":"9aaaaaba-843d-4444-8f2f-a042b049bfc3","resolution":{"observed_at":"2026-05-16T13:51:00.833127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"96a5a1f7-41cc-4c80-8aa0-85b1759c4e79","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:fc7bf316b3355b8e1a8c173a8dad8399fe9889a43a13dc00ac2420b860bd288a","observation_id":"b8621659-e1ca-4a32-986e-7a374ee44afa","resolution":{"observed_at":"2026-05-16T13:51:00.858950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems37, 50528– 50652 (2024) 4 20 Shaofeng Yin et al","venue":null,"work_id":"23a0bf6d-5651-4b37-9077-ec5c5785af74","year":2024},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:3b7bd6b7c0b3b9f1cf8fa2aca27472d967e85a5ad8ae23dedfca6c354978d41a","observation_id":"90fd00fc-410b-4101-b98d-442049d7b322","resolution":{"observed_at":"2026-05-16T13:51:00.894993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.06263","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:54:43.821476Z","title":"Omnisvg: A unified scalable vector graphics generation model","venue":null,"work_id":"e1da3e7b-b2cc-4055-982f-477cbcace176","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:473218dde4057d26fcdf50a5c2151a1f63ad330df13179f4b0523ebdf5c1fca3","observation_id":"1d700583-cc2f-4797-933a-23f6f382254e","resolution":{"observed_at":"2026-05-16T13:51:00.565341Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems35, 20744–20757 (2022) 4","venue":null,"work_id":"03daeaaf-544b-484a-9a65-3d89e4f9978b","year":2022},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:9ada6ef9d713f082af0dae754b799003560762081f9dbd31812e514f5b535f0c","observation_id":"d4262a74-aeb6-45c6-bebf-bce1881ad9db","resolution":{"observed_at":"2026-05-16T13:51:00.871326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19436","last_updated":"2025-05-26T02:53:22Z","snapshot_observed_at":"2026-08-09T07:11:05.819514Z","submitted_at":"2025-05-26T02:53:22Z","title":"Task Memory Engine: Spatial Memory for Robust Multi-Step LLM Agents","version":1},"cited_work":{"arxiv_id":"2505.19436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4269cc49-de04-4151-8df1-df25352cfd7a","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2505.19436","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:78cce2400d3c3bf91b9e1fd00d8eec64deb1dd128ba2a5eab00a4eb6fecbdd85","observation_id":"bbfacc65-4d64-4c1d-bc03-cb59c9df8d4f","resolution":{"observed_at":"2026-05-16T13:51:00.587813Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In: Advances in Neural Information Processing Systems (NeurIPS) 31","venue":null,"work_id":"3686ccee-68ff-45d7-805b-bd440e43a06a","year":2018},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:e9f4add09ffae40fb1708e90b7ddf1e3a6e7f68624e84f8baf5e1beecea458af","observation_id":"57730518-1e78-4bd4-b881-0a2144cf83f0","resolution":{"observed_at":"2026-05-16T13:51:00.816324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02485","last_updated":"2024-02-17T05:27:56Z","snapshot_observed_at":"2026-08-02T22:53:12.613357Z","submitted_at":"2023-07-05T17:59:27Z","title":"Building Cooperative Embodied Agents Modularly with Large Language Models","version":2},"cited_work":{"arxiv_id":"2307.02485","doi":"10.48550/arxiv.2307.02485","metadata_source":"pith","pith_arxiv_id":"2307.02485","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2307.02485 , year=","venue":"cs.AI","work_id":"43dfc983-b0e8-4a51-a15f-665fe191963b","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2307.02485","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:89c0a30ffa912e8b9931a6daf9c9551fbeec08157be1f2811962429b2189dd76","observation_id":"1ee5d6c3-6c23-4704-b481-cccf5bd1ac9c","resolution":{"observed_at":"2026-05-16T13:51:00.568852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04618","last_updated":"2026-03-29T09:18:02Z","snapshot_observed_at":"2026-07-06T22:31:49.574184Z","submitted_at":"2025-10-06T09:30:18Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","version":3},"cited_work":{"arxiv_id":"2510.04618","doi":"10.48550/arxiv.2510.04618","metadata_source":"pith","pith_arxiv_id":"2510.04618","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Agentic Context Engineering: Evolving Contexts for Self-Improving Language Models","venue":"cs.LG","work_id":"c1d09cf9-9176-403d-8028-630bbc0cbc5d","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2510.04618","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:6f1f9399158fd9a9575d108c846528f3fb53947fff68b6b94cc4a58992210b69","observation_id":"f232206d-afa5-4bd5-bc4e-c3d84b801b4c","resolution":{"observed_at":"2026-05-16T13:51:00.581200Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:03.57435+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03936","last_updated":"2025-02-21T07:52:39Z","snapshot_observed_at":"2026-08-10T21:41:33.930879Z","submitted_at":"2025-01-07T16:53:01Z","title":"PPTAgent: Generating and Evaluating Presentations Beyond Text-to-Slides","version":3},"cited_work":{"arxiv_id":"2501.03936","doi":"10.48550/arxiv.2501.03936","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.03936","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ID\": \"2401.13641","venue":"arXiv (Cornell University)","work_id":"0b9cb317-a801-498b-ad2d-901bdcafe50e","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2501.03936","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:fe10e3852f819b42a5815958bd89790d013364afea41c25024cd6529d2c9e90e","observation_id":"7038641c-9f60-4ded-b1f1-ca46e5bdd22c","resolution":{"observed_at":"2026-05-16T13:51:00.609420Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d372a17b-a7d1-4c20-ae45-d958695080c6","year":2025},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:3d081d9496c2aab2230211e9d035e25ae308d536422a62aefdca24c6fb31806b","observation_id":"5886d0d9-e7ed-498d-aaee-4502c81eba68","resolution":{"observed_at":"2026-05-16T13:51:00.892950Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13854","last_updated":"2024-04-16T15:13:18Z","snapshot_observed_at":"2026-08-06T12:47:01.809185Z","submitted_at":"2023-07-25T22:59:32Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","version":4},"cited_work":{"arxiv_id":"2307.13854","doi":"10.48550/arxiv.2307.13854","metadata_source":"pith","pith_arxiv_id":"2307.13854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WebArena: A Realistic Web Environment for Building Autonomous Agents","venue":"cs.AI","work_id":"7058ffd2-a339-4102-89eb-248eeb074652","year":2023},"citing_paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T13:50:19.988813Z"},"links":{"cited_paper":"/paper/2307.13854","citing_paper":"/paper/2601.11109"},"observation_digest":"sha256:2c572bcef251f64fdf59aa59fe8fba86064535de4aa1697efead502d55729231","observation_id":"2d4cad1f-a241-43ed-a3a2-e9299db4027c","resolution":{"observed_at":"2026-05-16T13:51:00.577861Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T18:52:18.85917+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2601.11109","last_updated":"2026-04-06T13:27:26Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T22:44:08.083817Z","submitted_at":"2026-01-16T09:11:55Z","title":"Vision-as-Inverse-Graphics Agent via Interleaved Multimodal Reasoning"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":2,"metadata_mismatch":13,"parse_uncertain":0,"unresolved":8,"verified_exact":10,"verified_fuzzy":39},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 16 inbound Pith citation observations for arXiv:2601.11109."}