{"as_of":"2026-08-04T09:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eb63f9bc37409a6cfaee74b028d1860b8f5f3318e0f75c2ad5abd2269eac0652","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T05:52:46.575173Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.19382/citation-record","integrity":"/paper/2605.19382/integrity","json":"/paper/2605.19382/citation-record.json","paper":"/paper/2605.19382"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Projudge: A multi-modal multi-discipline benchmark and instruction-tuning dataset for mllm-based process judges","venue":null,"work_id":"e5101880-0a87-4485-9d41-dec8d722bde1","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:94c3aad75f43bcfe390a2ea884481923a0b4ac0bbc4030e7af02e0364788554e","observation_id":"8a708b0c-9974-4318-a485-72a96fcc4f9c","resolution":{"observed_at":"2026-05-20T05:53:05.393151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:41acbe02f5a675a6e47f73b71008077b457d9525ae5881b72dfaf65868c47bfe","observation_id":"3bbbd9e2-e93e-4e81-9665-4b0124dd63ae","resolution":{"observed_at":"2026-05-20T05:53:04.344256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06471","last_updated":"2025-08-08T17:21:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T17:21:06Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","version":1},"cited_work":{"arxiv_id":"2508.06471","doi":"10.48550/arxiv.2508.06471","metadata_source":"pith","pith_arxiv_id":"2508.06471","snapshot_observed_at":"2026-07-11T01:07:44.097694Z","title":"GLM-4.5: Agentic, Reasoning, and Coding (ARC) Foundation Models","venue":"cs.CL","work_id":"5bb4e5d7-985e-431b-bb0d-75576cdc2950","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2508.06471","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:3a9127933268c2c75c8c3979d2b409c7944f812c2a23667933a0ebfae23690e2","observation_id":"9b01d3c7-f0e9-44a3-ba96-c7b3af20e1e6","resolution":{"observed_at":"2026-05-20T05:53:04.347056Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T05:23:01.474969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude’s extended thinking","venue":null,"work_id":"40592c8e-f74a-488d-bc85-6ca9a0a34bb4","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:bce78493e1f2f4a9a42626d95565891744ad12eac9b9ae0d53ca967e42d19877","observation_id":"59e15b20-0f79-4722-b640-d2e3b2cdd088","resolution":{"observed_at":"2026-05-20T05:53:05.385671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude opus 4 & claude sonnet 4 system card","venue":null,"work_id":"dbfce6a3-7bd3-4f7d-a4b7-2d4f29914f8e","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:c60525c57a2e020ede92e79a394a19eeb5eecbaf32c04b7398fcfabadbbf214a","observation_id":"bad6dd79-10d0-497c-ad4e-a233d9c5418d","resolution":{"observed_at":"2026-05-20T05:53:05.391286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dash: Detection and assessment of systematic hallucinations of vlms","venue":null,"work_id":"e850848e-cc65-4b8a-a82a-a52f72b562e3","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:2181cc558e98efbf1b5ac407dd962fc914e6fae16833a2563c835c32bc12154c","observation_id":"dc7e8086-4356-4f91-bde7-8d66c8487e2c","resolution":{"observed_at":"2026-05-20T05:53:05.381983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tikzero: Zero-shot text-guided graphics program synthesis","venue":null,"work_id":"8ab998ac-2504-43fb-ae2c-49a36e47380a","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:544ab04120d4636dfe2f45c850bac73178c3e22291d723eccba77b84f6c02f0e","observation_id":"e23f9b1f-c494-4f4a-9586-4498d3a71d67","resolution":{"observed_at":"2026-05-20T05:53:05.383657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"b2eed8ff-006e-497a-ad2f-0561cb730583","year":2024},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:169f9066840e5a3a138514df929bde153e7bc55e27b8f2b0881f823b90a213d6","observation_id":"21f3be61-40a5-4470-b308-95134baa1020","resolution":{"observed_at":"2026-05-20T05:53:05.378412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualedu: A benchmark for assessing coding and visual comprehension through educational problem-solving video generation","venue":null,"work_id":"beb19701-9826-466a-b0a9-41f9596b1e4d","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:371407932dd01779b0202d0ee649b4b5c45900186b1e177dd42cad1cbee1233f","observation_id":"e6440870-8364-46ae-8199-b97ece5c3dcd","resolution":{"observed_at":"2026-05-20T05:53:05.397015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.01174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:29:59.438619Z","title":"arXiv preprint arXiv:2510.01174 (2025)","venue":null,"work_id":"ec5d8bb0-a21f-453d-b4a5-dbf747f55523","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:f1d42b6961824369bec47ec08d31ba377e002a6d7fdfe80d5522b5df67e3e888","observation_id":"36507277-95c5-42fb-8303-f092191772f1","resolution":{"observed_at":"2026-05-20T05:53:04.341474Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wan-move: Motion-controllable video generation via latent trajectory guidance","venue":null,"work_id":"fc36ba64-24e8-4bf2-bd0f-98e181b1a949","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:c2ab0ac008c01eb4e1d12be49776052a7643cd9dfe5b6266f4a5983ffe1bf390","observation_id":"21cadd12-d7ad-4208-b2f0-e2f848bf911e","resolution":{"observed_at":"2026-05-20T05:53:05.376439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:f1b9d0bec03efdea9a35cb7edab33356a9a7b9ae42c807e8604841e215f0423a","observation_id":"cd637ea1-60b4-41e2-9fa6-1b6c1cbbddc8","resolution":{"observed_at":"2026-05-20T05:53:04.331841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.02556","last_updated":"2025-12-02T09:25:14Z","snapshot_observed_at":"2026-07-31T23:49:25.878472Z","submitted_at":"2025-12-02T09:25:14Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","version":1},"cited_work":{"arxiv_id":"2512.02556","doi":"10.18653/v1/d18-1512","metadata_source":"pith","pith_arxiv_id":"2512.02556","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3.2: Pushing the Frontier of Open Large Language Models","venue":"cs.CL","work_id":"07c85cc5-4086-4abc-823b-6d0f4ff784d0","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2512.02556","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:78f1b9ee7719643e9bce3ba0c5f4517314e8c4a946d4e123d8f65de3aba74e79","observation_id":"49eb2f2a-6888-47ed-815a-ebedb3fcab1d","resolution":{"observed_at":"2026-05-20T05:53:04.338212Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Codescore: Evaluating code generation by learning code execution","venue":null,"work_id":"a6f55e38-0f37-45b5-9993-a322538ece23","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:4d2ebc0c76d0eb0ba76da62f68c149c255bacf463e52bd6fd6c1c0a376fbbb12","observation_id":"d66958c7-531c-45e4-b0a5-de628f5232a9","resolution":{"observed_at":"2026-05-20T05:53:05.372822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.00083","last_updated":"2025-09-30T03:34:50Z","snapshot_observed_at":"2026-07-06T22:05:57.485783Z","submitted_at":"2025-07-31T18:17:36Z","title":"A Survey on Code Generation with LLM-based Agents","version":2},"cited_work":{"arxiv_id":"2508.00083","doi":"10.1007/s41233-023-00059-2","metadata_source":"pith","pith_arxiv_id":"2508.00083","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"A Survey on Code Generation with LLM-based Agents","venue":"cs.SE","work_id":"d958445f-408f-4ff3-bd9a-decd431c419a","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2508.00083","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:3f097fd2e03e20c7f34142bdb4dd0c654ca9ac9e1ca8876ff2bcc06d1da52cbf","observation_id":"e6650db5-0bf8-4511-9fcc-613539c46b97","resolution":{"observed_at":"2026-05-20T05:53:04.321892Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Video-mme: The first-ever comprehensive evaluation benchmark of multi-modal llms in video analysis","venue":null,"work_id":"98625ee1-d2a3-4260-8baa-9181c3d47b61","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:a73f0d9bb84bdd34fb1352c4c83e5e30ad42ac3ca9deae3a98c741fa2af5277e","observation_id":"60caa1ad-baa0-403d-9af0-90150ed57672","resolution":{"observed_at":"2026-05-20T05:53:05.413600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cad-coder: Text-to-cad generation with chain-of-thought and geometric reward","venue":null,"work_id":"b783d6d6-4c01-48f5-b7a3-e85fd6c4068c","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:b67ebdb5e2f5a40f74250326ce076a9611d3c0564a973bd029d1cbcb4e2633b7","observation_id":"a5dc679a-e866-426a-af43-43cd357fa5c4","resolution":{"observed_at":"2026-05-20T05:53:05.410111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flaw or artifact? rethinking prompt sensitivity in evaluating llms","venue":null,"work_id":"8d7f9f64-bf71-4cb3-92e8-61fe5e2daa96","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:e52eaff313c1481127b2c6b8acd6f566838203baa69f33edcbd314ce1e7f8e34","observation_id":"df0e43c0-a025-4366-b325-49c1bbf6f3d6","resolution":{"observed_at":"2026-05-20T05:53:05.371117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scipostgen: Bridging the gap between scientific papers and poster layouts","venue":null,"work_id":"7dae0de1-6d40-43f8-b5b0-4f02ad5ece2e","year":2026},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:e1f11693dbb0befcd6a595461f34d3e3b6a8f74f9fe7dcb347b4bc53a87a2fcc","observation_id":"5c6bdbbc-c277-4ac1-bff3-de6a2c415b79","resolution":{"observed_at":"2026-05-20T05:53:05.374510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19355","last_updated":"2025-03-26T05:32:54Z","snapshot_observed_at":"2026-07-06T20:58:14.950470Z","submitted_at":"2025-03-25T05:08:06Z","title":"ST-VLM: Kinematic Instruction Tuning for Spatio-Temporal Reasoning in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2503.19355","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.19355","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"St-vlm: Kinematic instruction tuning for spatio-temporal reasoning in vision-language models","venue":null,"work_id":"65a4b16b-2af1-4106-ad6f-37626bbe5e12","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2503.19355","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:15b1c59a720177621cb21870e7e08c43b4a1cb149b7127fe4169e68c1d87db2d","observation_id":"21018879-d272-40f5-96ec-59373d4922c6","resolution":{"observed_at":"2026-05-20T05:53:04.328749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InAnnual Conference of the North American Chapter of the Association for Computational Linguistics (NAACL)","venue":null,"work_id":"3f5f9e60-bc32-4ca4-a733-4c2440e36638","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:1a301d9d3efc8646632c7d25698b1d074a62eba79c41b422f2dc0ba8395ab21a","observation_id":"be2c55a6-1d44-42b5-8edb-ec8643d4db34","resolution":{"observed_at":"2026-05-20T05:53:05.369323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":"2412.03603","doi":"10.48550/arxiv.2412.03603","metadata_source":"pith","pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T01:07:45.135143Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","venue":"cs.CV","work_id":"881efa7e-7e73-4c66-9cc3-2803e551061c","year":2024},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:2993fb26f5279513ffb3d295c53ab0da982563db4b7a244ba0730210ae0f5229","observation_id":"7af748af-0e92-47a3-8e17-24ce9ba8fc80","resolution":{"observed_at":"2026-05-20T05:53:04.309218Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.433177+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Theorem- explainagent: Towards video-based multimodal explanations for llm theorem understanding","venue":null,"work_id":"fe2b51cc-966c-45e3-8ef1-2ff951ff0b8a","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:a384f74fc79d59c9d8340788b567e5c4876cc3085be8199234fa7adedc98d145","observation_id":"7117697f-41c2-44dd-a088-469919799f8e","resolution":{"observed_at":"2026-05-20T05:53:05.359821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":"c71c661e-7dad-48f8-a964-3ff3eff2c36c","year":2024},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:2074ae5c07934f63f301725c0962be4add6d77dda314af8c0ef4a03505a5a67a","observation_id":"8e70c2db-b95b-405a-a12d-9fd0ad7f3dfa","resolution":{"observed_at":"2026-05-20T05:53:05.361581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A sur- vey of state of the art large vision language models: Alignment, benchmark, evaluations and challenges","venue":null,"work_id":"98d53907-776f-4a6f-aa3c-af656547a477","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:f54b0f6b03247d28f0229aa9e14368a62dc5617e9094b7ad8de6efc3028f69f3","observation_id":"0b67ef02-b2b5-4997-9b92-e8b790073409","resolution":{"observed_at":"2026-05-20T05:53:05.363325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Can multimodal large language models understand spatial relations? InAnnual Meeting of the Association for Computational Linguistics (ACL)","venue":null,"work_id":"f6b4149f-213c-48bd-a366-2f69d44df7c2","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:30dfdbf3429262ec85e83eb132d25b41533ee2781b474d936e8c4766b8ef9146","observation_id":"9aa91fc9-6e96-4bde-b903-3ca44232f1cd","resolution":{"observed_at":"2026-05-20T05:53:05.356011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.04013","last_updated":"2025-09-04T08:43:27Z","snapshot_observed_at":"2026-07-06T22:23:48.679487Z","submitted_at":"2025-09-04T08:43:27Z","title":"On Robustness and Reliability of Benchmark-Based Evaluation of LLMs","version":1},"cited_work":{"arxiv_id":"2509.04013","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04013","snapshot_observed_at":"2026-06-30T23:45:07.998622Z","title":"On robustness and reliability of benchmark-based evaluation of llms","venue":null,"work_id":"b9028098-f624-4214-ba6e-82cd64cb2a14","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2509.04013","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:576f20ddbbab41674bc28bc8ea892ad3fbd6d6d00bf218b8039da4047e0f34d2","observation_id":"8e54f074-d4a3-4308-8237-8717c9608525","resolution":{"observed_at":"2026-05-20T05:53:04.325279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Geogram- bench: Benchmarking the geometric program reasoning in modern llms","venue":null,"work_id":"03376fdc-7553-4b7d-9f5e-603a6811596d","year":2026},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:91271a67bc36f57738b40ab41c3a5035672f97c22340ec5bd2cfde8f7c060f46","observation_id":"b94a7f1d-aeaf-425e-8af2-02f8391e5f9a","resolution":{"observed_at":"2026-05-20T05:53:05.380283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rethinking verification for llm code generation: From generation to testing","venue":null,"work_id":"46e08457-2d50-4e9b-9cc1-9b10c53a27db","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:3cd962045a2d414df4f85d582ad8bfc430f6dd94f7be42c5aaa38899185d5565","observation_id":"d1a9a95d-46df-4985-bc1c-97c23e3f14c8","resolution":{"observed_at":"2026-05-20T05:53:05.389654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ivispar – an interactive visual-spatial reasoning benchmark for vlms","venue":null,"work_id":"f1b932fb-906c-466e-a613-f3a8beaf1ab4","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:f64f99f99285a256c3ed2a7e56fe1eeaa87705d1bed4320d96fba4fc314bbc95","observation_id":"6e25f25c-4d14-476b-b802-ea1b49d822c9","resolution":{"observed_at":"2026-05-20T05:53:05.406210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.16644","last_updated":"2026-04-11T08:03:25Z","snapshot_observed_at":"2026-07-06T22:16:52.874707Z","submitted_at":"2025-08-18T11:28:02Z","title":"CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance","version":4},"cited_work":{"arxiv_id":"2508.16644","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.16644","snapshot_observed_at":"2026-07-04T10:29:44.482897Z","title":"CountLoop: Training-Free High-Instance Image Generation via Iterative Agent Guidance","venue":"cs.CV","work_id":"daa220bb-e5ac-43de-bee0-955dfc3e2c85","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2508.16644","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:460483cd61f58663bbdbf792af02f6738c50b25bab63d7b11bbdbe385047e823","observation_id":"6ae5d81f-7de9-42b6-9de9-7c9511722349","resolution":{"observed_at":"2026-05-20T05:53:04.353109Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spare: Enhancing spatial reasoning in vision-language models with synthetic data","venue":null,"work_id":"1bfacda4-88fe-4a56-89c9-f0de3be6ee16","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:f251fb3d5732b6fd7dfc8b5bcc2a4fbcaff88d0b821f48d38cb5e13bdfa0815f","observation_id":"32e647ca-9fd0-473b-b063-0b4517cf6489","resolution":{"observed_at":"2026-05-20T05:53:05.430291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.13251","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2603.13251 , year =","venue":null,"work_id":"91d13f38-9e41-4414-91e3-96d59e5dc29c","year":2026},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:d301c281d24fa6a123a917bfab865022734aceceeac25b03cdcc703a05e5102d","observation_id":"ad2a794c-8f60-4a35-88d6-f4b355e2ad6a","resolution":{"observed_at":"2026-05-20T05:53:04.350197Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpt-4.5 system card","venue":null,"work_id":"2a910d5a-a0bb-4cda-a3e5-4658ffefcd50","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:d882d1c541e2d1b18af4729759d1141aea591fa8ca70969e32ca8b630fb36012","observation_id":"6d2ece4d-cff4-449a-9dc7-d61de9681ef5","resolution":{"observed_at":"2026-05-20T05:53:05.415779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2ebcc633-d5e0-4870-8366-0f5beed02af9","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:1505c060bb93d11e380b0939a324993cb90168756a12d07a7f30ebe654bf4b0b","observation_id":"83077d83-d504-40be-bf59-07a9a7d18fc9","resolution":{"observed_at":"2026-05-20T05:53:05.424888Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Capture: Evaluating spatial reasoning in vision language models via occluded object counting","venue":null,"work_id":"32b89545-921d-40d9-af80-ca9fb732a987","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:01486c4fefa815f53ad4c914d6f1d2816fa8fafc8eda335ad546d5637ffa7170","observation_id":"4ba094f7-af21-4b9f-a288-c0e81494ebab","resolution":{"observed_at":"2026-05-20T05:53:05.444205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Forest: Frame of reference evaluation in spatial rea- soning tasks","venue":null,"work_id":"02aae4e6-1feb-4431-a202-bdcc8463f2ed","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:49fe9783061da5f256297a091319e1ec5b558b6afe7e791a603f253b3183ee7e","observation_id":"6c7affdc-6cfc-4cef-9901-f87b4a05d8ff","resolution":{"observed_at":"2026-05-20T05:53:05.403976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xiao, Katherine M","venue":null,"work_id":"0f8abc01-03b9-4a91-9e15-d8d9965a67e1","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:3d8a441a5a7477b841d80a2d416af51777d5cf5c3876350ca965d97ae5af07af","observation_id":"147db6c6-420e-4d16-ab4f-3fdd1fda9a6c","resolution":{"observed_at":"2026-05-20T05:53:05.402234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking spatiotemporal reasoning in llms and reasoning models: Capabilities and challenges","venue":null,"work_id":"70dcc24b-1902-4cd8-8f91-0da6d4f3b1dd","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:fe838b5e15109cfc32ba01a68d6fa199b5a6eeeffbca473fa0f25948a32841bb","observation_id":"dbba8596-7659-403b-991e-cd8f32d06207","resolution":{"observed_at":"2026-05-20T05:53:05.398766Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Text2vis: A challenging and diverse benchmark for generating multimodal visualizations from text","venue":null,"work_id":"c444da77-7e07-4de9-821e-5bbee5ecede2","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:f884a895a75403eb6e0b8abd09466df4bbddd7cc864d5e1d197be56c5b0bb954","observation_id":"e6d4ea17-5c77-4410-85d7-ada5a29bdf33","resolution":{"observed_at":"2026-05-20T05:53:05.400500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.13285","last_updated":"2026-04-06T08:31:43Z","snapshot_observed_at":"2026-07-06T22:48:57.474272Z","submitted_at":"2026-02-27T21:12:13Z","title":"Brittlebench: Quantifying LLM robustness via prompt sensitivity","version":2},"cited_work":{"arxiv_id":"2603.13285","doi":"10.48550/arxiv.2603.13285","metadata_source":"pith","pith_arxiv_id":"2603.13285","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Brittlebench: Quantifying LLM robustness via prompt sensitivity","venue":"cs.LG","work_id":"abfaa460-b8c0-49b6-a24b-5ad82f804632","year":2026},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2603.13285","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:4ca6d09501dc2b488fcbe2aa9bddb564f72fa76f8620fb2cb9959dd0d463f31b","observation_id":"4f575ed2-671c-4c77-a08d-5b6e9ae173f7","resolution":{"observed_at":"2026-05-20T05:53:04.315416Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Design2code: Benchmarking multimodal code generation for automated front-end engineering","venue":null,"work_id":"f9bb1835-ce54-4dc7-b0d8-4470002c658f","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:11138422601226dd80fa3e2c081c7cc907e9b05c32c11a701ccd2f212a6e2b1f","observation_id":"1ea880ba-0999-41e2-be2f-18b53629c118","resolution":{"observed_at":"2026-05-20T05:53:05.408297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.18364","last_updated":"2026-04-20T14:54:06Z","snapshot_observed_at":"2026-07-31T08:39:17.254491Z","submitted_at":"2026-04-20T14:54:06Z","title":"Training and Agentic Inference Strategies for LLM-based Manim Animation Generation","version":1},"cited_work":{"arxiv_id":"2604.18364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.18364","snapshot_observed_at":"2026-07-02T20:47:22.445667Z","title":"Training and Agentic Inference Strategies for LLM-based Manim Animation Generation","venue":"cs.AI","work_id":"4d455cad-af94-4ede-a85b-a8ef0951df87","year":2026},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2604.18364","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:fbc7c8b3ac0421123e7228ebd2b5d02e4ed75e36905193f93dab7e470fba616c","observation_id":"c649528e-5567-473d-a1fb-313b252ec15c","resolution":{"observed_at":"2026-05-20T05:53:04.312281Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5281/zenodo.14699705","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Manim - mathematical animation framework (v0.19.0)","venue":null,"work_id":"675ec816-3236-4ca2-b621-16b429eb627a","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:de719b7ddf88f05a99608f5fb503507b417726d6d508aef7b33e9e18a3e5d0ae","observation_id":"3745eaf0-5980-4463-8fd4-23d26a985bc4","resolution":{"observed_at":"2026-05-20T05:53:04.215760Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T14:22:20.02223+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T14:22:20.02223+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ode: Open-set evaluation of hallucinations in multimodal large language models","venue":null,"work_id":"7d228ff8-d1d2-46a7-8fd5-8ae4e753e524","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:1ce9eef1b1af193cd0736638e70cb7b288d89978c0a5d8d0e91600a264cb2932","observation_id":"ca2411c4-116d-4c4c-8033-b549db8f748d","resolution":{"observed_at":"2026-05-20T05:53:05.394908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:7bad5f3ff21de0efda2ede11bc77e27b8b4d8d9713d3e573639189c96273a45b","observation_id":"3d43a918-b822-4a0f-b95b-e795af0b9553","resolution":{"observed_at":"2026-05-20T05:53:04.318855Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4b318b4c-8536-4da9-b502-13dcab002910","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:bf07439ee41457e3d5aa97623eff2f748a4c938cec8ae18b56e1e2b46eb96b30","observation_id":"0c674adf-c100-4184-afd4-f015fcf96731","resolution":{"observed_at":"2026-05-20T05:53:05.357986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ske- layout: Spatial knowledge enhanced layout generation with llms","venue":null,"work_id":"f5d20b34-37e6-464b-abb2-06d9ae87bacf","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:39f24c9267822769507f48f6188760b878322b7f56415f02a43c261360483464","observation_id":"054c3384-13ed-4aa2-9a82-1dab1473e680","resolution":{"observed_at":"2026-05-20T05:53:05.367031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spatial457: A diagnostic benchmark for 6d spatial reasoning of large multimodal models","venue":null,"work_id":"2abe79c3-2f9d-42f3-8c49-863c17e446e9","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:64f31008f7d08deae4c7f4c07a355878603b264e34eb7a4b13a3c3463de7f096","observation_id":"913682d6-73f8-4832-84a6-2b876f08d630","resolution":{"observed_at":"2026-05-20T05:53:05.365106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From words to structured visuals: A benchmark and framework for text-to-diagram generation and editing","venue":null,"work_id":"39f37908-a2f4-42f0-bb2f-dd108b9c1db2","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:6ed29681f7aec8fd04c87811dfe28d8633d40a0f6b0e0c81cab843621f7cc301","observation_id":"ef8e1f98-295d-4037-a3b6-c22a28af19b8","resolution":{"observed_at":"2026-05-20T05:53:05.387942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Plot2code: A comprehensive benchmark for evaluating multi-modal large language models in code generation from scientific plots","venue":null,"work_id":"9bbdc51b-272c-44c5-93d3-ba83689c5487","year":2024},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:05e121e55aeb253b8ffa83e0b1c9d80f8737f108e1ba18bb9e6e368853291cf1","observation_id":"47296624-b4ad-463b-8dc4-eea1f442266e","resolution":{"observed_at":"2026-05-20T05:53:05.411848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PanoWan: Lifting diffusion video generation models to 360◦ with latitude/longitude-aware mechanisms","venue":null,"work_id":"44c28d89-2364-4c8d-98bb-eddb978ce5c8","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:7148c34ce257b4c4d19e2c1cae07b5d9bd708a73b788ca41a5a27083aa5adb4d","observation_id":"721ecf38-364c-4dcf-803c-ab9caa095502","resolution":{"observed_at":"2026-05-20T05:53:05.440467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Core: Benchmarking llms code reasoning capabilities through static analysis tasks","venue":null,"work_id":"53d2c137-59e4-45bd-a4c7-c9bd3c319aaf","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:3cb3fe3b991a51cf3059250ccdea45abc877490eae6536f2368de68c28693dc6","observation_id":"e6dcf653-eccc-4a3e-9b05-bb46c8cbcd9c","resolution":{"observed_at":"2026-05-20T05:53:05.442234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Empower- ing llms to understand and generate complex vector graphics","venue":null,"work_id":"7060d47a-9fe1-4fca-afee-8b0beaa45758","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:2487302d2c37925aa078e1ad55447540bc22e2e2869fdee0a6a3767ba809d36b","observation_id":"a4febb77-9b20-4063-b984-20d2606f10ea","resolution":{"observed_at":"2026-05-20T05:53:05.432061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Defining and evaluating visual language models’ basic spatial abilities: A perspective from psychometrics","venue":null,"work_id":"ea88f834-e624-48b0-91ae-135d9001ee59","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:83ca3a5c433163965e713f641ffb3d60bb86ef70d5b1d9bf127cde905c47a51b","observation_id":"fb61ece8-debe-491e-83da-ae1c423b065a","resolution":{"observed_at":"2026-05-20T05:53:05.434735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:5216b15e00117c679fbceb1ee0c6d6d9dd2cbf3aecc798c39b6311ab43daaff4","observation_id":"34f421d3-de84-4e8e-a301-812e1d8afbeb","resolution":{"observed_at":"2026-05-20T05:53:04.335421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chart- mimic: Evaluating lmm’s cross-modal reasoning capability via chart-to-code generation","venue":null,"work_id":"f533dae2-081c-4ded-b913-296e49aa9e23","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:004b40fb56c5dc6c7b8c0dc1afe4d2c3ffa5f0528286969340d1f80da956c05a","observation_id":"e600174e-2548-44cb-89e1-786278b865a7","resolution":{"observed_at":"2026-05-20T05:53:05.436900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gupta, Rilyn Han, Li Fei-Fei, and Saining Xie","venue":null,"work_id":"cc5899dc-9176-4bce-adc5-b15e507afced","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:1050c01eb02e5d87e40c0a85878a40cfd7e92c22d31b57d3b196bc6e16db912d","observation_id":"5cca5557-48b0-4fcc-b284-8d7e616fa4bd","resolution":{"observed_at":"2026-05-20T05:53:05.438534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Omnisvg: A unified scalable vector graphics generation model","venue":null,"work_id":"6a508817-487a-4a1d-aad4-349e892abf72","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:1c50d0e060142b3f58009fab994f7a8c8685e4847c656bf66d596f0e0c7d599a","observation_id":"c3843e86-6945-411d-91e7-ff3f88983c63","resolution":{"observed_at":"2026-05-20T05:53:05.446168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":"d5b1e73a-15c3-4447-b889-b28c3ae7c2a9","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:1c471c76518a13c737d58c30da0558a1629d72918b184bb3bdfb973f08d22b01","observation_id":"dd593232-616e-4e04-8e15-73d4f9ac97b4","resolution":{"observed_at":"2026-05-20T05:53:05.426689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating spatial hallucination in large language models for path planning via prompt engineering","venue":null,"work_id":"7d868cf7-4d7d-4073-8ace-13c35db67314","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:9ddbe0bd5632fe1d24bc6a4f19a99bb7eafd4805be487fc3de691e8131a34f7c","observation_id":"c0b96806-57f6-4af2-b9ea-aa75aa5778e8","resolution":{"observed_at":"2026-05-20T05:53:05.428497Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sphere: Unveiling spatial blind spots in vision-language models through hierarchical evaluation","venue":null,"work_id":"20437375-4aa9-4974-a429-c9347d9e1fff","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:754200a94253c4a0a3094174960b4136eacd630ea4ee797a9f6e6cc81b3bcf45","observation_id":"0d515743-129f-4415-9540-794a405896de","resolution":{"observed_at":"2026-05-20T05:53:05.422848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chartcoder: Advancing multimodal large language model for chart-to-code generation","venue":null,"work_id":"e3fbb086-79cb-469e-b50a-cdc0d188acd2","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:9d9c882d3218645831478a26826bb26cd14f3d47738d0a160971b31fa1b82be6","observation_id":"f00ea15c-b51b-4645-8b6d-7b837228a1f3","resolution":{"observed_at":"2026-05-20T05:53:05.417506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Knowledge- enhanced large language models for automatic lesson plan generation","venue":null,"work_id":"f6645111-1285-4118-84fe-c05f778b09be","year":2025},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:284459820e14cf597a9f190c5cdf03c62bfcf4f8af196128bd0bd41d7e134e00","observation_id":"044fddd4-91e7-46c6-b435-82d31e28044c","resolution":{"observed_at":"2026-05-20T05:53:05.419226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Autofigure: Generating and refining publication-ready scientific illustrations","venue":null,"work_id":"a5139087-e93c-48e1-8e83-e21f9ddd836b","year":2026},"citing_paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-20T05:52:46.575173Z"},"links":{"citing_paper":"/paper/2605.19382"},"observation_digest":"sha256:c8ce386246d49a71b3a48a5df93225aa513bd2a79ee3b654411bfe86d0c8c722","observation_id":"63fdfdea-572c-4a8a-a0e3-710b12c07a86","resolution":{"observed_at":"2026-05-20T05:53:05.420949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.19382","last_updated":"2026-05-19T05:28:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T23:30:06.876413Z","submitted_at":"2026-05-19T05:28:54Z","title":"PRISM: A Benchmark for Programmatic Spatial-Temporal Reasoning"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":2,"verified_exact":12,"verified_fuzzy":47},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2605.19382."}