{"as_of":"2026-08-22T05:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7fac3203c355c8bf0d8ce1312f572a2aff9e7c39b014278e430c0e3071456198","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:29:00.908466Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T05:57:08.155113Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-12T15:03:23.786991Z","title":"Al-Tahan, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14725","last_updated":"2025-06-03T08:55:05Z","snapshot_observed_at":"2026-08-16T05:08:51.624496Z","submitted_at":"2024-11-22T04:41:20Z","title":"Evaluating and Advancing Multimodal Large Language Models in Perception Ability Lens","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:03:23.786991Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2411.14725"},"observation_digest":"sha256:4082b915460f56511d6935068b166b9476431a23a65d0140cb7e85b0e9565a0c","observation_id":"17e6553f-9f94-4f44-aac6-1cd611c55cae","resolution":{"observed_at":"2026-08-12T15:03:23.786991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-11T22:56:44.434584Z","title":"Unibench: Visual reasoning requires rethinking vision- language beyond scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03002","last_updated":"2025-03-09T13:26:29Z","snapshot_observed_at":"2026-08-13T16:32:15.424504Z","submitted_at":"2024-12-04T03:42:39Z","title":"AdvDreamer Unveils: Are Vision-Language Models Truly Ready for Real-World 3D Variations?","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:56:44.434584Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2412.03002"},"observation_digest":"sha256:1cf7adcaea3ec3314ace4b2b60328384338bc626a3e2beb053f8dd656b6f0bc0","observation_id":"c1ee6603-8a4c-402e-a9eb-f70f557932e4","resolution":{"observed_at":"2026-08-11T22:56:44.434584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-10T18:53:00.226717Z","title":"Unibench: Visual reasoning requires rethinking vision-language beyond scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10928","last_updated":"2025-04-19T14:52:08Z","snapshot_observed_at":"2026-08-10T18:47:01.186615Z","submitted_at":"2025-01-19T03:19:47Z","title":"Generative Physical AI in Vision: A Survey","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-10T18:53:00.226717Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2501.10928"},"observation_digest":"sha256:531898170ca00365675122867a5a9ae0e826e87e511e0e810ef9564e81f4ac35","observation_id":"03e8894b-d264-443c-920a-ab6fd4bb7e97","resolution":{"observed_at":"2026-08-10T18:53:00.226717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-16T11:29:00.908466Z","title":"Unibench: Visual reasoning requires rethinking vision- language beyond scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15485","last_updated":"2025-08-13T18:39:29Z","snapshot_observed_at":"2026-08-17T13:14:57.271778Z","submitted_at":"2025-04-21T23:38:43Z","title":"CAPTURe: Evaluating Spatial Reasoning in Vision Language Models via Occluded Object Counting","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:29:00.908466Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2504.15485"},"observation_digest":"sha256:b3d827870df72277082020bc6aab663a55d922f5abd587c0f15695ff8708f89f","observation_id":"6499a395-ef09-4816-90d8-3637fc2a5575","resolution":{"observed_at":"2026-08-16T11:29:00.908466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-07T10:35:40.558440Z","title":"Unibench: Visual reasoning requires rethinking vision-language beyond scaling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05440","last_updated":"2025-06-05T12:43:10Z","snapshot_observed_at":"2026-08-07T21:22:23.284742Z","submitted_at":"2025-06-05T12:43:10Z","title":"BYO-Eval: Build Your Own Dataset for Fine-Grained Visual Assessment of Multimodal Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:40.558440Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2506.05440"},"observation_digest":"sha256:8aa371f30321759438d2915b1a1b1558018f45a4d62a11e2bd785296e92b2a02","observation_id":"9771b082-b0d9-4e98-a987-f8f79d71e0b5","resolution":{"observed_at":"2026-08-07T10:35:40.558440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":"2408.04810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unibench: Visual reasoning requires rethinking vision- language beyond scaling","venue":null,"work_id":"f885dbdc-2c09-404f-a8af-eedf200e2479","year":2024},"citing_paper":{"arxiv_id":"2507.01955","last_updated":"2026-05-01T00:57:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-02T17:59:07Z","title":"How Well Does GPT-4o Understand Vision? Evaluating Multimodal Foundation Models on Standard Computer Vision Tasks","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-19T05:55:09.188048Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2507.01955"},"observation_digest":"sha256:9b40be9564a5bf2fdbecc4756a1f0d5514cde206021270e6aa44955656a3d332","observation_id":"cc4905d7-0b8d-4292-9cb9-a399ab984a99","resolution":{"observed_at":"2026-05-19T05:57:08.159043Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-08-03T21:09:21.007755Z","title":"Garrido, Randall Balestriero, Diane Bouchacourt, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.16672","last_updated":"2026-06-09T22:19:41Z","snapshot_observed_at":"2026-08-17T13:52:38.567720Z","submitted_at":"2025-11-20T18:59:54Z","title":"EvoLMM: Self-Evolving Large Multimodal Models with Continuous Rewards","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T21:09:21.007755Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2511.16672"},"observation_digest":"sha256:6d849642b363fa9058436f36d6132f8c483ac5425b234e4a3e273b723b9a03af","observation_id":"5d1b1a9b-21ad-4476-b3a4-bd2a3f721114","resolution":{"observed_at":"2026-08-03T21:09:21.007755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":"2408.04810","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unibench: Visual reasoning requires rethinking vision- language beyond scaling","venue":null,"work_id":"f885dbdc-2c09-404f-a8af-eedf200e2479","year":2024},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-08-12T12:39:42.402287Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T16:51:48.705876Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:6b7541acf83b08ff457cd6b2b11b4ba5978c26ea84331245fd81e1eb13a5de34","observation_id":"4de9475d-178e-4730-b397-5851b843b4a1","resolution":{"observed_at":"2026-05-13T16:52:59.939322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04810","snapshot_observed_at":"2026-07-13T12:10:53.720348Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.03893","last_updated":"2026-06-01T03:09:36Z","snapshot_observed_at":"2026-08-12T12:39:42.402287Z","submitted_at":"2026-04-04T23:18:58Z","title":"FeynmanBench: Benchmarking Multimodal LLMs on Diagrammatic Physics Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T12:10:53.720348Z"},"links":{"cited_paper":"/paper/2408.04810","citing_paper":"/paper/2604.03893"},"observation_digest":"sha256:7271faf02b39ebba2d300df61f7426e53d42b5607c4469483c269f63905e49a6","observation_id":"332e3cb4-fafd-4284-aa76-18dfda44f7e1","resolution":{"observed_at":"2026-07-13T12:10:53.720348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.04810/citation-record","integrity":"/paper/2408.04810/integrity","json":"/paper/2408.04810/citation-record.json","paper":"/paper/2408.04810"},"outbound":[],"paper":{"arxiv_id":"2408.04810","last_updated":"2024-08-09T01:41:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T13:27:33.647349Z","submitted_at":"2024-08-09T01:41:05Z","title":"UniBench: Visual Reasoning Requires Rethinking Vision-Language Beyond Scaling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2408.04810."}