{"as_of":"2026-08-04T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:69710fb569490732e05468fb530a93d1c2d2e8d48bc6c996899a2cbe801c2d32","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T05:01:30.517621Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-03T06:30:56.289259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24957/citation-record","integrity":"/paper/2607.24957/integrity","json":"/paper/2607.24957/citation-record.json","paper":"/paper/2607.24957"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.156595Z","title":"Nature Machine Intelligence , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.156595Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:6471ffbc834420b0e64f9083648f19289eecbb392d595af40047f6e02cf3d2d0","observation_id":"1156ce4d-1b22-4ccb-8343-877b3a4f239b","resolution":{"observed_at":"2026-07-31T05:01:26.156595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.245318Z","title":"Science China Information Sciences , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.245318Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:1492937ed23333fbefc73b6cc43fac6ebf01b909e10aa08367c9cc005022483d","observation_id":"5eac475e-9483-43d0-861a-1df17935c96d","resolution":{"observed_at":"2026-07-31T05:01:26.245318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16863","last_updated":"2026-06-24T02:13:52Z","snapshot_observed_at":"2026-07-06T22:01:16.878652Z","submitted_at":"2025-07-21T21:50:16Z","title":"Position: Reasoning After Perception Means Reasoning Without Vision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16863","snapshot_observed_at":"2026-07-31T05:01:26.350549Z","title":"arXiv preprint arXiv:2507.16863 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.350549Z"},"links":{"cited_paper":"/paper/2507.16863","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:c122b6607dca7c8ab0e168e5c3f77262d99756e8fc93c0593bcddc1524b4c6bb","observation_id":"92ff5ac7-d6b8-4e03-b724-d04e61c7d374","resolution":{"observed_at":"2026-07-31T05:01:26.350549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.450404Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.450404Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:081819d7dd6894c902e1c29c71c832408dc83036416b4fa74477a4ddda9a2970","observation_id":"ee0b5f6e-8a67-4829-b359-62c47f9e71b4","resolution":{"observed_at":"2026-07-31T05:01:26.450404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.09669","last_updated":"2026-06-08T15:51:51Z","snapshot_observed_at":"2026-08-02T20:17:41.727375Z","submitted_at":"2026-06-08T15:51:51Z","title":"SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.09669","snapshot_observed_at":"2026-07-31T05:01:26.556632Z","title":"arXiv preprint arXiv:2606.09669 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.556632Z"},"links":{"cited_paper":"/paper/2606.09669","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:a6d5318debc39d0eae6de8eeee9c7851c633f56fddf4dd6e0fbc94ec6aa0f323","observation_id":"38384984-b82d-4c47-a2c8-d907d08dc60d","resolution":{"observed_at":"2026-07-31T05:01:26.556632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.647381Z","title":"Proceedings of the 33rd ACM International Conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.647381Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:26669c9cd061714d499c86ea85b10e52c2c9fe1b07858122703d30c95d9bc811","observation_id":"eff033cd-f9c3-488b-9aae-3aa142ca30b8","resolution":{"observed_at":"2026-07-31T05:01:26.647381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.752307Z","title":"Proceedings of the IEEE international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.752307Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:d2b2935fb1132b8d8eda42bc086fe154b7d49e0a358aa8b3d7c215721d27dbef","observation_id":"7aadae96-8d84-4b41-8d94-8cd05c51ca98","resolution":{"observed_at":"2026-07-31T05:01:26.752307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.812502Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.812502Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:6920ee8cd1651ba853ef0fab124f5d25c332b843d9ab4f6b8cd3edf8fa3e9a2d","observation_id":"85dae68c-eeec-43d0-9900-afa081b3a3d8","resolution":{"observed_at":"2026-07-31T05:01:26.812502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.902041Z","title":"Proceedings of the IEEE conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.902041Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:726bf9fc20082f6eaebc1961e152d14878d536f131f9403535465f1e12d945bf","observation_id":"4bf06950-9345-46e1-8a98-77ff34279ef8","resolution":{"observed_at":"2026-07-31T05:01:26.902041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:26.983743Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:26.983743Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:3e1f7ea74e64fe4b2c9e51e5926f842f591037018b1dd8caace732dd732eafa2","observation_id":"6560bc5a-19a5-4702-8141-5225867886cd","resolution":{"observed_at":"2026-07-31T05:01:26.983743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.145517Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.145517Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:82c6de4910c6e430c54b0c350a27f42c7220f02cb94853fa629055aff567c4b7","observation_id":"d716b651-3efb-4f9e-b0aa-7fb65523c551","resolution":{"observed_at":"2026-07-31T05:01:27.145517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.213296Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.213296Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:9a71a55ad0d842dfd51a2fa02e2f094e397ce5370cdd6ef0222613c3516bc4a7","observation_id":"330cc4d1-2ad5-405f-9e5f-ecd59891287c","resolution":{"observed_at":"2026-07-31T05:01:27.213296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.300228Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.300228Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:bd13e801b2dd423d1fc2795e2714b536db366e39e3def2da89edd942a01a1411","observation_id":"63e373eb-2354-44ba-8349-4a14d237caef","resolution":{"observed_at":"2026-07-31T05:01:27.300228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.371742Z","title":"Proceedings of the IEEE/CVF winter conference on applications of computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.371742Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:5d6ac175ddc1b746a23976c0472396606a45337c421f6ea88c8a56c807bb6b9b","observation_id":"8d4ebf91-6006-48fc-a042-3162b5e5aba6","resolution":{"observed_at":"2026-07-31T05:01:27.371742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.416019Z","title":"Findings of the association for computational linguistics: ACL 2022 , pages=","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.416019Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:5498eeef58ed44009a2cc7c527fef90f10e1487bb6784d6ddd4179ebbad1d5a9","observation_id":"092873c1-846a-49da-a787-7f8f804a45d7","resolution":{"observed_at":"2026-07-31T05:01:27.416019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.518824Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.518824Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:4698c2dea09fc03efab85dbd363c79b64949cfc1bc01c4958f7d211b2541d1cd","observation_id":"5f9f920a-5219-4100-9ba4-48132eca9972","resolution":{"observed_at":"2026-07-31T05:01:27.518824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.621125Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.621125Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:983d9907b368d26b62645da376a8e7e28fad1bd24b10cdb39c57b73ccde1c65a","observation_id":"33b6ebd4-63f7-4018-9cbf-248dcd0337ce","resolution":{"observed_at":"2026-07-31T05:01:27.621125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.777902Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.777902Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:c0a2b13c7a2b0360423fe4815c66a829adbfca68569b5a114700b58259bdf526","observation_id":"06bdd388-d80a-4a4d-a06e-25c17fe02661","resolution":{"observed_at":"2026-07-31T05:01:27.777902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.807425Z","title":"International journal of computer vision , volume=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.807425Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:9628069e9e5f0f2a9d58f4fe0dc46dbff521362ce008da579f556235a4a3ff3e","observation_id":"fb137b65-ca91-4bf7-a813-c5af48ec5f49","resolution":{"observed_at":"2026-07-31T05:01:27.807425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.882250Z","title":"The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.882250Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:c991eeab4a845cf034073be846b85b058470749e8db19b45c5e1ecb9b7a9475c","observation_id":"db622f92-2aaa-42cc-ac07-3b1d4bdda228","resolution":{"observed_at":"2026-07-31T05:01:27.882250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:27.988373Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:27.988373Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:03c6db151754738912d53dd68e898eaeff392e7078c64ab4396da7605cda2482","observation_id":"ee20badb-d451-40f5-b953-940ce8ba09f5","resolution":{"observed_at":"2026-07-31T05:01:27.988373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:28.083552Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.083552Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:13085204425bc432dbaec0c04c7d5bc95c905d71b4381eee20174d28b681f484","observation_id":"e0f381d7-5a36-4000-9bcd-216cbc0bb292","resolution":{"observed_at":"2026-07-31T05:01:28.083552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-03T03:43:59.496973Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15929","snapshot_observed_at":"2026-07-31T05:01:28.195478Z","title":"arXiv preprint arXiv:2505.15929 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.195478Z"},"links":{"cited_paper":"/paper/2505.15929","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:f6b8db60e8a3aa81a1c3d0c111d4634ae52bc57fe6d145499372b69106cda7e9","observation_id":"6f8d2294-ff27-4414-8eeb-3f337f4b4874","resolution":{"observed_at":"2026-07-31T05:01:28.195478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:28.264576Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.264576Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:bdd3790a6f0dc684211405fd2a9d4486009701d37996b575f8383c09cbded81e","observation_id":"b71a6037-8873-4d11-b572-8d17d35c3861","resolution":{"observed_at":"2026-07-31T05:01:28.264576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23941","last_updated":"2026-04-19T17:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T18:47:58Z","title":"Vision Language Models are Biased","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23941","snapshot_observed_at":"2026-07-31T05:01:28.317659Z","title":"arXiv preprint arXiv:2505.23941 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.317659Z"},"links":{"cited_paper":"/paper/2505.23941","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:1d8e76ea1d746ca1e229d41f0c1e237c225527d1c771e675c37d98ae10975594","observation_id":"b4d44ad0-a6b1-4b95-b44c-4595f1990d2d","resolution":{"observed_at":"2026-07-31T05:01:28.317659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-07-06T20:18:53.977126Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-07-31T05:01:28.384980Z","title":"arXiv preprint arXiv:2501.05444 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.384980Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:e58d4b17cd7fe5c38eb64bdf812f2a876aa7da6fca87859ff665aaffb46c3bac","observation_id":"e6992855-794e-4037-b7d3-00ab9c601dcb","resolution":{"observed_at":"2026-07-31T05:01:28.384980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-07-31T05:01:28.440761Z","title":"arXiv preprint arXiv:2407.04973 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.440761Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:a8f342a0a424dde9a4bbae1713edf18398e4176cfd64ff0b09160bd21c29cf30","observation_id":"d508ce6b-0b66-40a5-b6c9-405ee6e2d15a","resolution":{"observed_at":"2026-07-31T05:01:28.440761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:28.513634Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.513634Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:ecca55aecf6942fcd5578e4771ec3a27eb3c59323047cebf26190ba54b1305a0","observation_id":"b7c034ec-a817-4ba0-9576-542ed53aeced","resolution":{"observed_at":"2026-07-31T05:01:28.513634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:28.579726Z","title":"Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers) , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.579726Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:385cbd038c59c27be04845a094522910fe2d74bf602b11ff88702b6446d464b6","observation_id":"04624801-6712-4362-b4d7-0ac6ea2479a5","resolution":{"observed_at":"2026-07-31T05:01:28.579726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:28.685183Z","title":"Proceedings of the Asian Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.685183Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:ef1056dedac4032050abe4f2bdad52b2d494bd354f7408a9f5aa5edac933fdf4","observation_id":"db17d2f2-6e41-4f76-9427-9465de0611a3","resolution":{"observed_at":"2026-07-31T05:01:28.685183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16435","last_updated":"2026-05-03T19:46:16Z","snapshot_observed_at":"2026-08-01T07:16:47.081829Z","submitted_at":"2025-02-23T04:21:32Z","title":"Human Cognitive Benchmarks Reveal Foundational Visual Gaps in MLLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16435","snapshot_observed_at":"2026-07-31T05:01:28.735215Z","title":"arXiv preprint arXiv:2502.16435 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.735215Z"},"links":{"cited_paper":"/paper/2502.16435","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:832effb98e636ab7e4a0b9518b370ea1855d2ebc3face35debee42b5100c6a1f","observation_id":"d28ecc56-8a77-4b8a-bc6e-26f725367fa4","resolution":{"observed_at":"2026-07-31T05:01:28.735215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-31T05:01:28.838169Z","title":"arXiv preprint arXiv:2601.06521 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.838169Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:a727aa70f6266a1a4873c36544e5c216ec30f8a7245a73e77eb485a3b0018ac7","observation_id":"d51a5525-1455-4600-a670-736d17b93e09","resolution":{"observed_at":"2026-07-31T05:01:28.838169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09990","last_updated":"2025-05-16T18:37:26Z","snapshot_observed_at":"2026-07-06T21:24:10.996004Z","submitted_at":"2025-05-15T06:04:42Z","title":"PointArena: Probing Multimodal Grounding Through Language-Guided Pointing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09990","snapshot_observed_at":"2026-07-31T05:01:28.883339Z","title":"arXiv preprint arXiv:2505.09990 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.883339Z"},"links":{"cited_paper":"/paper/2505.09990","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:7cb70fb02db99496802790b2759d5d846ebcaecbfd6e7ed7991d862241b35a37","observation_id":"6b4cab17-7f1f-4779-ac9d-03673e7b6a88","resolution":{"observed_at":"2026-07-31T05:01:28.883339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:28.949981Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:28.949981Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:aee9511d3d8916ffa0511c4c6f307e57a0c954c73c7a0ec03631805e7e3eca74","observation_id":"594f2ce4-c5f3-4932-be55-cc28432efe65","resolution":{"observed_at":"2026-07-31T05:01:28.949981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09696","last_updated":"2026-07-07T14:07:33Z","snapshot_observed_at":"2026-08-03T11:27:21.448208Z","submitted_at":"2025-02-13T18:59:11Z","title":"ZeroBench: An Impossible Visual Benchmark for Contemporary Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09696","snapshot_observed_at":"2026-07-31T05:01:29.035002Z","title":"arXiv preprint arXiv:2502.09696 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.035002Z"},"links":{"cited_paper":"/paper/2502.09696","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:810696f66cea3674894c64aad24d07aa03e2e3b56ebe629ffb594ca2a7f8af11","observation_id":"4f6d477b-d9a0-4c0e-9363-d00355a128cb","resolution":{"observed_at":"2026-07-31T05:01:29.035002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.089488Z","title":"arXiv preprint arXiv:2510.13804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.089488Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:a802b9526101cde126ef2a789e059f45aca6997de3e341bd657bbd8113a611d9","observation_id":"53cb83b1-30a3-4c63-8835-13a0c94dec03","resolution":{"observed_at":"2026-07-31T05:01:29.089488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-07-30T04:21:00.152864Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-07-31T05:01:29.210636Z","title":"arXiv preprint arXiv:2410.23218 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.210636Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:d069f8c44872e611c837e005d9d4802b84571e8c04cdce31c13d98f36e0eb0c4","observation_id":"8ad357b7-46d3-4455-ad48-3b10454a83a7","resolution":{"observed_at":"2026-07-31T05:01:29.210636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23764","last_updated":"2026-05-23T03:42:56Z","snapshot_observed_at":"2026-07-06T21:33:07.415628Z","submitted_at":"2025-05-29T17:59:52Z","title":"MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23764","snapshot_observed_at":"2026-07-31T05:01:29.271997Z","title":"arXiv preprint arXiv:2505.23764 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.271997Z"},"links":{"cited_paper":"/paper/2505.23764","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:cce98cfaeb6687dcafba470b37ff021b8cdf9112f45aac510d3bcaab6ed02262","observation_id":"f39c7fbe-a7c2-44fe-b051-49559d5409b8","resolution":{"observed_at":"2026-07-31T05:01:29.271997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.392334Z","title":"arXiv preprint arXiv:2511.03146 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.392334Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:7b14936818f84ac4790c77c241f54b31eb45521af700cf2a5b8526a94014d6ab","observation_id":"18ae6d45-b37c-4187-ae4c-1d3ba49a1c6c","resolution":{"observed_at":"2026-07-31T05:01:29.392334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.447386Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.447386Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:dbbe61c7eed4cf0b28261cd70797d07df0009c743a162f5ddaf3ae0c715cf510","observation_id":"9959456d-6c39-445c-9c24-adbd788847b0","resolution":{"observed_at":"2026-07-31T05:01:29.447386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.556601Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.556601Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:727cd13ea9d910457a55d3f372b6d778e9f4ae7940bfbb2efa53f98ce712f524","observation_id":"50b80e12-ccaa-47c5-8424-6d134cc366c5","resolution":{"observed_at":"2026-07-31T05:01:29.556601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.722354Z","title":"arXiv preprint arXiv:2505.13227 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.722354Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:6974a5c69b216e0ed51b72b2daff19574c715a229dd36f2e7f94ca5d013aac5f","observation_id":"d5eb2269-11d3-4f5e-bd89-c265ce2f5e8a","resolution":{"observed_at":"2026-07-31T05:01:29.722354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.799630Z","title":"Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.799630Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:d4d977f7b71731f24fbe489fda06f8d7280e6d92af05c1ed1aa75f59c5a754b9","observation_id":"47498e98-71e7-45bf-85fc-cf5518ce82d5","resolution":{"observed_at":"2026-07-31T05:01:29.799630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.843214Z","title":"arXiv preprint arXiv:2507.07999 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.843214Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:0c6a197a621c1d93158bb4b7f79ec6c588a38c396d2afbf7c22dfac440637e48","observation_id":"2278697f-a04f-44bd-8c21-bc289a0150b0","resolution":{"observed_at":"2026-07-31T05:01:29.843214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.908810Z","title":"The Thirty-eight Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.908810Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:df6343afc5c2b0bfcbc9647060a60967a24206ed823a354efa5c7f876bdae4a5","observation_id":"3253df54-c6b2-4f0e-a8b0-27a965a2490d","resolution":{"observed_at":"2026-07-31T05:01:29.908810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:29.958635Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:29.958635Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:22cb34d48dfee61d0de03f8fdf6034615cc55d76ceb0651cfb9d6336213f9a90","observation_id":"aece2096-710f-402b-9224-7ce431befe0a","resolution":{"observed_at":"2026-07-31T05:01:29.958635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.010480Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.010480Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:2bee6c2a406fae83a996cf97ac23a45ea4423bdfb9098befe5fd4c1e1978ee45","observation_id":"b9b0d3f4-bc59-42bb-8dc7-0c1fff085dd0","resolution":{"observed_at":"2026-07-31T05:01:30.010480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.069081Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.069081Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:fdcfc044421baa778ef288a6f15e95f8e2c7cfface370139bfcd58370a7043cb","observation_id":"822e5bed-558e-4978-8481-0cffc67c013c","resolution":{"observed_at":"2026-07-31T05:01:30.069081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.120700Z","title":"arXiv preprint arXiv:2506.04308 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.120700Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:1070b0867b2e4501ab14bae6a85678640bb47e711508bd7f6ea6a2db3f9713a4","observation_id":"cf9261ab-f88a-444b-a2a6-ace7018e129f","resolution":{"observed_at":"2026-07-31T05:01:30.120700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.173933Z","title":"DynaMath: A Dynamic Visual Benchmark for Evaluating Mathematical Reasoning Robustness of Vision Language Models , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.173933Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:9b72a327e37407ce90ff93f2164870a1185872019527b422b9a36117b8d0616a","observation_id":"2fd6c674-b9a0-4578-b857-132c067de8e4","resolution":{"observed_at":"2026-07-31T05:01:30.173933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20020","last_updated":"2025-03-25T19:02:56Z","snapshot_observed_at":"2026-08-02T07:15:58.798604Z","submitted_at":"2025-03-25T19:02:56Z","title":"Gemini Robotics: Bringing AI into the Physical World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20020","snapshot_observed_at":"2026-07-31T05:01:30.230081Z","title":"arXiv preprint arXiv:2503.20020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.230081Z"},"links":{"cited_paper":"/paper/2503.20020","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:46eb221a58420c5fe2dcc97ee403e1df2902ee659924a4fdfd10fca6eb981d0b","observation_id":"a44773f6-0729-4a0e-98d2-9089bfe1082e","resolution":{"observed_at":"2026-07-31T05:01:30.230081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.284127Z","title":"Findings of the Association for Computational Linguistics: ACL 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.284127Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:079138619d38eac6495ad21cd3a055e53f3c516e72203853e0eba8a8c2119f76","observation_id":"533c3b84-8ccd-4a66-aa31-fdc74361f5c3","resolution":{"observed_at":"2026-07-31T05:01:30.284127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.346111Z","title":"2025 , howpublished=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.346111Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:030f24f1946cd4733ae03ea1f3ec902ece00872bcbe4fa798d85f8c7c6dfd5f0","observation_id":"53746efd-75f9-4f36-b768-b55d9b434f31","resolution":{"observed_at":"2026-07-31T05:01:30.346111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T05:01:30.411809Z","title":"2024 , howpublished=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.411809Z"},"links":{"citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:0f02888491eefc83b6fc1f45fef8fe0219c6a22345014f9deb4e0cb74f5981ca","observation_id":"e53b0488-08fe-4f75-acd0-7e4fe76d39aa","resolution":{"observed_at":"2026-07-31T05:01:30.411809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15279","last_updated":"2025-04-21T17:59:53Z","snapshot_observed_at":"2026-07-06T21:12:37.115803Z","submitted_at":"2025-04-21T17:59:53Z","title":"VisuLogic: A Benchmark for Evaluating Visual Reasoning in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15279","snapshot_observed_at":"2026-07-31T05:01:30.468951Z","title":"arXiv preprint arXiv:2504.15279 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.468951Z"},"links":{"cited_paper":"/paper/2504.15279","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:87dba7fda42d2d84fc0aa0e059fce5659faa2ba55d463fda8c7f9a1901e3403d","observation_id":"6f07a2c6-2d4f-4227-b7fb-ad2f813f399e","resolution":{"observed_at":"2026-07-31T05:01:30.468951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04323","last_updated":"2021-12-08T15:08:10Z","snapshot_observed_at":"2026-07-06T12:16:33.912630Z","submitted_at":"2021-12-08T15:08:10Z","title":"Contrastive Learning with Large Memory Bank and Negative Embedding Subtraction for Accurate Copy Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04323","snapshot_observed_at":"2026-07-31T05:01:30.517621Z","title":"arXiv preprint arXiv:2112.04323 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T05:01:30.517621Z"},"links":{"cited_paper":"/paper/2112.04323","citing_paper":"/paper/2607.24957"},"observation_digest":"sha256:3707bfe1384d7b155036a119ff534a8b7abf9936d1732adb95ad7ed07f5b7f97","observation_id":"e504db0f-fe1a-4dc6-9bce-00f6e8e3e0fc","resolution":{"observed_at":"2026-07-31T05:01:30.517621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24957","last_updated":"2026-07-27T18:04:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T22:57:25.487048Z","submitted_at":"2026-07-27T18:04:54Z","title":"PerceptionBench: Evaluating Atomic Visual Perception in Multimodal Large Language Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":56,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-03T06:30:56.289259+00:00","source":"crossref"},{"observed_at":"2026-08-03T06:30:50.922721+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.24957."}