{"as_of":"2026-08-18T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34b9792b87a8a83b04f66845660352c84b0ced923618b0657433a78d329513ff","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T17:09:48.465115Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.13964/citation-record","integrity":"/paper/2501.13964/integrity","json":"/paper/2501.13964/citation-record.json","paper":"/paper/2501.13964"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:49.017186Z","title":"Introducing the next generation of Claude","venue":null,"work_id":"d2af8c44-ab03-4a3e-a6bc-5d1768144f99","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.311927Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:d27ac6796cf0f5e7679036f10ad86471a2a4b6ab824dfaf7e4d73097c73d6e9c","observation_id":"e9a62dea-d8e9-4f80-9c3f-95337e335358","resolution":{"observed_at":"2026-08-10T17:09:49.023341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.996718Z","title":"Bitton-Guetta, Y","venue":null,"work_id":"7af52b73-5dad-4475-bb39-d16da152d8d6","year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.321028Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:ca0709293f1e4f842c37d211c8d3744b47be89578f6126f11aea754b0548a15c","observation_id":"6048df04-d97c-4d88-97a4-9fd8448d451c","resolution":{"observed_at":"2026-08-10T17:09:49.004374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-16T13:41:24.654042Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-10T17:09:48.328251Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.328251Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:2e8e519403fdcdbb140196b7932739985b57ab6410ebeb25184d4956191c46b7","observation_id":"542845cb-54ef-43e4-9204-295821593865","resolution":{"observed_at":"2026-08-10T17:09:48.328251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15663","last_updated":"2023-12-25T09:13:18Z","snapshot_observed_at":"2026-08-16T14:31:47.257951Z","submitted_at":"2023-12-25T09:13:18Z","title":"IQAGPT: Image Quality Assessment with Vision-language and ChatGPT Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15663","snapshot_observed_at":"2026-08-10T17:09:48.334099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.334099Z"},"links":{"cited_paper":"/paper/2312.15663","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:924b782b18d0cb43ac4819d2b386c9670d3e3fb428d19e9dd23733e59c663d06","observation_id":"c17b7471-dd61-4aab-865d-69d14317f968","resolution":{"observed_at":"2026-08-10T17:09:48.334099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.979523Z","title":"AR shopping for glasses, 2024","venue":null,"work_id":"97d9d109-f9bc-4022-8f58-3c7bd26bf7d5","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.339512Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:3a9f37830ea2feb5bbe4680588933ac35b9ff18ff2b258c88111513845c16b0a","observation_id":"7d9c6339-4de4-4d00-a8f4-525916618e96","resolution":{"observed_at":"2026-08-10T17:09:48.984466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.963223Z","title":null,"venue":null,"work_id":"cad69db3-0c00-4256-b47b-0646382b8cf0","year":2022},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.346299Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:1c41f5121afbbe6656f87d08277265956c5d5ddd193570b73c570b8f96fb6f0a","observation_id":"87182d6f-ae21-4b31-8de6-d7dfc5f79c4f","resolution":{"observed_at":"2026-08-10T17:09:48.968206Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.945111Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":"a796b9fd-e8ba-401b-b917-496360d4ffed","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.354209Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:99964ccaa77afc608ac02ef55b76e1925f6584bedc4b7c00c33ca4462841f557","observation_id":"6ce20968-349b-4398-ac92-78450cf7b04e","resolution":{"observed_at":"2026-08-10T17:09:48.949926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.928610Z","title":null,"venue":null,"work_id":"74028f0c-fc2f-4d3a-ab88-cc862cbaf533","year":2022},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.360794Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:1e184c5f00a055a711ef78a0a406c72f3bc2848e7facaddb8ff1e1dc2ff97199","observation_id":"e545ea6c-8c0c-4533-b85b-2d1b61d5941d","resolution":{"observed_at":"2026-08-10T17:09:48.933564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.912413Z","title":"Hore and D","venue":null,"work_id":"63d41f17-7f44-41a9-9e2a-6a2bf65b6d1b","year":2010},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.367757Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:655d70b2cc2e0420d0a0e4f26fc22a6fe63e064160185bf7c293a5596c6effc8","observation_id":"216774a1-63c3-40f6-a22c-553cfe270964","resolution":{"observed_at":"2026-08-10T17:09:48.917510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.896897Z","title":null,"venue":null,"work_id":"9e18d749-31e0-42de-b173-91a9910a81e7","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.373793Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:1a048a2e2719f909e2d49d3a66ce168ac46dac173a8557f7d3f6462d40761893","observation_id":"e19a9ae2-0c26-4474-a797-493a1514c884","resolution":{"observed_at":"2026-08-10T17:09:48.901400Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.881721Z","title":"Langlotz, T","venue":null,"work_id":"0d576fff-2a74-4df0-8b86-eb9b6d7c0509","year":2014},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.380146Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:b452d5ad035169cfbe8d2576ad84682340784711cdd1f37d44b7607e530ce234","observation_id":"f1d7a737-8ec1-4728-b7dc-d2077da8efda","resolution":{"observed_at":"2026-08-10T17:09:48.886693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.865849Z","title":"Lin and G","venue":null,"work_id":"9546be52-16cb-4c1a-b030-786379205d5a","year":2018},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.386300Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:9bd7c75a64eaff0d84b9152b85dd1c621e0c026eb23bedd344ad75c0976bc738","observation_id":"b14c3b4f-d6e3-4940-9894-146bfd19dfb9","resolution":{"observed_at":"2026-08-10T17:09:48.871113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10719","last_updated":"2024-12-16T00:37:54Z","snapshot_observed_at":"2026-08-16T13:18:01.861483Z","submitted_at":"2024-09-16T20:47:00Z","title":"Benchmarking VLMs' Reasoning About Persuasive Atypical Images","version":3},"cited_work":{"arxiv_id":"2409.10719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.10719","snapshot_observed_at":"2026-08-10T17:09:48.594110Z","title":"Benchmarking VLMs' Reasoning About Persuasive Atypical Images","venue":"cs.CV","work_id":"217a2b27-1580-4411-a8d1-a6400b604bdf","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.391280Z"},"links":{"cited_paper":"/paper/2409.10719","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:2f6761494e4c9c30af2fd10ecd4b5f5c6d7fc1332f7d76b841c4a2ba8c0894dd","observation_id":"6824137e-d066-4920-bdc4-fb628ad5dbce","resolution":{"observed_at":"2026-08-10T17:09:48.605900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.846318Z","title":"Merino, M","venue":null,"work_id":"439a53d0-fbc2-403f-b111-449dc9a1cae5","year":2009},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.399229Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:7296f4668fe98608b14b5573f8fd40034c29c962b6a44062dc0a2e67c6053421","observation_id":"b75f2670-a0ef-4fcf-96f6-8540535099e0","resolution":{"observed_at":"2026-08-10T17:09:48.853280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.829104Z","title":"Scaniverse - 3D scanner","venue":null,"work_id":"bc7484f6-d8bc-484f-ae51-1db6c221238f","year":null},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.405624Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:4300a7eb4d1868bc0a2f92dfcbb30d6d31edd1075962bec4f8b3ddff81897023","observation_id":"90f8b250-aa44-4eaf-a0f4-e9c787e3f638","resolution":{"observed_at":"2026-08-10T17:09:48.834386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-10T17:09:48.411289Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.411289Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:ae3037829ecdf158748888ef3b0c17d222bc038193882e1adf162b186997f994","observation_id":"7df0c80f-d97a-42aa-aafb-6a74e51137b3","resolution":{"observed_at":"2026-08-10T17:09:48.411289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.811675Z","title":null,"venue":null,"work_id":"5d50b6d2-ef49-4eff-881b-9699a64106eb","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.416606Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:68accc61d87724982c467ce238a4f27935fb609a63733d2a2e9d664f47ce25ba","observation_id":"0e55db64-d06d-405e-a545-f2ba9e6984f7","resolution":{"observed_at":"2026-08-10T17:09:48.816749Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.793608Z","title":null,"venue":null,"work_id":"16fbf2a2-584a-4229-a1a6-2f02f6dee606","year":2015},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.423492Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:49aa52e7b5486902dfc07b0bfc0603fa7e50e8603cd2e2e29ef2ed74ec00a11b","observation_id":"aab4727b-d344-4b8f-b653-d0687564adb2","resolution":{"observed_at":"2026-08-10T17:09:48.800306Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.775466Z","title":"Scargill, S","venue":null,"work_id":"c2da29bb-dfef-4cd1-a0f1-f68d5bd10f5d","year":2021},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.429702Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:676608e491dc68e413f7ca3ec49b662bc6c8e15098c283e5278551c3d036114e","observation_id":"d7101241-8bbe-434a-8a3c-fe30bec96e77","resolution":{"observed_at":"2026-08-10T17:09:48.780959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.754261Z","title":null,"venue":null,"work_id":"c5740470-fa59-461d-aa18-de9ff157dc79","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.434251Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:b4457995673e77e49a531beb8e26277da821534dfad30a50d4c99971af6353c3","observation_id":"0faaf8fa-95cf-4e38-bb40-abd9c9300118","resolution":{"observed_at":"2026-08-10T17:09:48.761752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.732745Z","title":null,"venue":null,"work_id":"09a9734f-b2f4-4df7-828f-460000417d1d","year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.439765Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:d0dbfebdc3249a15845d3f69fab20fd22ffe79f975adf9267c3691f86f686fb6","observation_id":"83519a63-059b-4b5f-bfa4-f1a9399b445e","resolution":{"observed_at":"2026-08-10T17:09:48.737090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.710521Z","title":"Wasenm¨uller, M","venue":null,"work_id":"cd36bb56-3343-4197-a4d2-014899b0ecd2","year":2016},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.446260Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:8682950faf24c650fefb5a7d78287ebd6f88ee7d5ca9bf628836b7e5837100b0","observation_id":"64432e7a-7bbc-423c-b409-42cd7e0247e6","resolution":{"observed_at":"2026-08-10T17:09:48.716731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.687685Z","title":null,"venue":null,"work_id":"d7933a1c-b9d8-4185-9454-1297b77c1fad","year":2025},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.451543Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:771e3b96a6c26497e08f38d15f2d8ab7391c9acaf2749330030ee8169ea7152a","observation_id":"ef7108f6-6ed3-4630-9745-08e0ad1a87fe","resolution":{"observed_at":"2026-08-10T17:09:48.693970Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T17:09:48.668826Z","title":"Zhang, J","venue":null,"work_id":"5e46ed21-1b3a-443c-9f9c-daae59c5c9b2","year":2024},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.457458Z"},"links":{"citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:fc48007819f11ab7a3a2fe6728fd333e3ffc34771e06c2cd1855ed2c7140b932","observation_id":"0079f7c2-cd58-48fc-ba6b-e3c337c1efa4","resolution":{"observed_at":"2026-08-10T17:09:48.674479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19301","last_updated":"2023-10-30T06:35:37Z","snapshot_observed_at":"2026-08-17T15:43:41.171640Z","submitted_at":"2023-10-30T06:35:37Z","title":"ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense","version":1},"cited_work":{"arxiv_id":"2310.19301","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.19301","snapshot_observed_at":"2026-08-10T17:09:48.529103Z","title":"ROME: Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense","venue":"cs.CL","work_id":"ed51f253-7d14-41bf-8634-cb2fd70098d8","year":2023},"citing_paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T17:09:48.465115Z"},"links":{"cited_paper":"/paper/2310.19301","citing_paper":"/paper/2501.13964"},"observation_digest":"sha256:302b89e1fa58446528e8f36623fbae53ceb86852dbe0506e7a30042e23ae6b42","observation_id":"654e44fd-1398-4e1b-ac84-d7cc2cf08f6c","resolution":{"observed_at":"2026-08-10T17:09:48.538210Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.13964","last_updated":"2025-02-01T20:27:00Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T15:01:12.682271Z","submitted_at":"2025-01-21T23:07:03Z","title":"Advancing the Understanding and Evaluation of AR-Generated Scenes: When Vision-Language Models Shine and Stumble"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":12},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2501.13964."}