{"as_of":"2026-08-23T12:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cda4b203d8745ad61978f69b909de4f142378e2e8aa6ac32ee12cd6875c166f5","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T09:30:46.564013Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08317/citation-record","integrity":"/paper/2607.08317/integrity","json":"/paper/2607.08317/citation-record.json","paper":"/paper/2607.08317"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.210918Z","title":"DeepSeek-V4: Technical report.https://huggingface.co/deepseek-ai/ DeepSeek-V4-Pro/blob/main/DeepSeek_V4.pdf, 2026","venue":null,"work_id":"e115960a-0449-4dbb-a3bc-b096b47e63b6","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9696dddd1d0203a782eaedbaecdd7969d517370f59ab9a0d1bcbe4ce57c7309e","observation_id":"fb89b955-a765-46e9-9c14-7facc794262c","resolution":{"observed_at":"2026-07-10T09:37:01.212164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.244387Z","title":"Introducing GPT-5.5.https://openai.com/index/introducing-gpt-5-5/, 2026","venue":null,"work_id":"60003549-dd80-431a-ae76-b0561d481093","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:63da7e862b5b0a607f7d132f46d4fce0be203e628c045c8beddcff83de9b237f","observation_id":"6b6745db-9992-493e-999b-c363b4109f8c","resolution":{"observed_at":"2026-07-10T09:37:01.246226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.221351Z","title":"Gemini 3.1 Pro Model Card.https://deepmind.google/models/ model-cards/gemini-3-1-pro/, 2026","venue":null,"work_id":"17a00d65-6eea-4609-baff-a3b37389a426","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9e333d022b110dc3cb85e899d0f4d3a9ebb3937aec26e43f9b573b35c3749ef2","observation_id":"e920904f-6d1f-4d4e-a829-a553f9dffdcc","resolution":{"observed_at":"2026-07-10T09:37:01.222527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-21T17:04:32.090035Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8e74e7488ef826ba92dd80ed7e2191935d77429b2be227ac26842f9d6c2ca1bc","observation_id":"3fbcf0e2-3961-436e-b4c3-969ce403f57c","resolution":{"observed_at":"2026-07-10T09:37:00.870806Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07982","last_updated":"2025-06-09T17:52:18Z","snapshot_observed_at":"2026-08-14T06:34:01.114459Z","submitted_at":"2025-06-09T17:52:18Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","version":1},"cited_work":{"arxiv_id":"2506.07982","doi":"10.48550/arxiv.2506.07982","metadata_source":"pith","pith_arxiv_id":"2506.07982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"$\\tau^2$-Bench: Evaluating Conversational Agents in a Dual-Control Environment","venue":"cs.AI","work_id":"3a498b1a-455f-4667-b572-c5216c99a89c","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2506.07982","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8891bd36354f94435e188c389d0ecd614d5a541bbd9a3bf23f71e7aae61e0542","observation_id":"abf63560-7b78-4d65-a202-cd66e875d6fc","resolution":{"observed_at":"2026-07-10T09:37:00.767104Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.129969+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.239419Z","title":"Swe-bench: Can language models resolve real-world github issues? InThe twelfth international conference on learning representations, 2023","venue":null,"work_id":"2d55d3e9-74e7-45eb-847c-77ecbc1dfa86","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:90ed77d09edde68f3de4e108e8fc7e12977c50180e4f43cb1edb00cf3bfbb3a2","observation_id":"369e8e9f-774a-4347-b6df-b25c1b3ac7d5","resolution":{"observed_at":"2026-07-10T09:37:01.240601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-17T12:39:54.496393Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":"2605.00674","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-07-10T09:37:00.861422Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","venue":"cs.CL","work_id":"a302077a-ac03-4988-adce-c84a57db5425","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:40bee88d367b7d4ab46e81ba314994f1d64abaac6c18d5c8b94f4d7cc1f667a1","observation_id":"6d8cfb2e-dda7-437e-a630-cb38a66147e2","resolution":{"observed_at":"2026-07-10T09:37:00.862871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":"2310.02255","doi":"10.1109/cvpr52734.2025.01245","metadata_source":"pith","pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","venue":"cs.CV","work_id":"e22c3789-9e71-4242-b6ea-3e60e06e2b66","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5664e0abb526dd16717697f83ba4ceb81d8d40969d4e1f3e440a4014b2282330","observation_id":"1424dec4-ba42-4d34-a962-9c4813c9ba32","resolution":{"observed_at":"2026-07-10T09:37:00.857750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T17:17:26.741999Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":"08908afa-03c9-4035-9817-6ed61dde66a1","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:306bde0dc68c2f0cf8e9252add652bcb91a71cee223afe66cd33530198746747","observation_id":"19d5dd26-2ad7-478d-8f4a-0cfc988732c5","resolution":{"observed_at":"2026-07-10T09:37:01.242321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.242819Z","title":"Mmmu: A massive multi-discipline multi- modal understanding and reasoning benchmark for expert agi","venue":null,"work_id":"876c9b86-6597-4244-9256-1be52ac73bfe","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:18946b2ba8a0f626be952f55ca927d598ca6548627554ef017c4e7896044d56a","observation_id":"fb61c22b-424b-4e4b-a228-61f8ad37fca0","resolution":{"observed_at":"2026-07-10T09:37:01.243904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":"2311.07911","doi":"10.48550/arxiv.2311.07911","metadata_source":"pith","pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction-Following Evaluation for Large Language Models","venue":"cs.CL","work_id":"3aa06177-125a-4f5a-8f4a-8070c5986c26","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:fc9679300c0c82875a4dd873de7c12df1eb0045921f83b7e33f1db82c817283f","observation_id":"444e852c-2a98-42ef-b0f3-e00de145fcdb","resolution":{"observed_at":"2026-07-10T09:37:00.783817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16135","last_updated":"2025-05-22T02:24:35Z","snapshot_observed_at":"2026-08-13T13:49:12.284764Z","submitted_at":"2025-05-22T02:24:35Z","title":"Sudoku-Bench: Evaluating creative reasoning with Sudoku variants","version":1},"cited_work":{"arxiv_id":"2505.16135","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16135","snapshot_observed_at":"2026-07-10T09:37:00.822035Z","title":"Sudoku-bench: Evaluating creative reasoning with sudoku variants","venue":"cs.AI","work_id":"74aa17a5-6a31-423f-855c-216d5f929f64","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.16135","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:f08b8224c16fb7e525d24b657377b758baf414dfcccd4eeea6f647c4bc6c9506","observation_id":"e916a76a-2e68-4263-9b27-c63a14cdd725","resolution":{"observed_at":"2026-07-10T09:37:00.823453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.217816Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms","venue":null,"work_id":"a169b3e6-e66f-4128-afc4-96a23085ae1f","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:2482bf856d10655c54da3cde3f9064ad55668d38864f83729827c6d8e32b7e9f","observation_id":"cc5e9b3f-bb41-46b2-a272-d7e58a8ff10c","resolution":{"observed_at":"2026-07-10T09:37:01.218985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18626","last_updated":"2024-12-19T22:47:08Z","snapshot_observed_at":"2026-08-19T23:30:08.010312Z","submitted_at":"2024-12-19T22:47:08Z","title":"Why Do Large Language Models (LLMs) Struggle to Count Letters?","version":1},"cited_work":{"arxiv_id":"2412.18626","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.18626","snapshot_observed_at":"2026-07-10T09:37:00.787799Z","title":"Why Do Large Language Models (","venue":"cs.CL","work_id":"b8f957e9-4c71-4c2a-bcbd-0a897eb5423d","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2412.18626","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:2418cfa9d351c57b60a359616e608aeefadac3c9c89a3ed06b786350bfc833f5","observation_id":"04096664-3215-41c4-be42-7a4028081a90","resolution":{"observed_at":"2026-07-10T09:37:00.788988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-21T23:00:26.334772Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:552f1e65384a066f97fa07263569cef2bff3eca0049274a5adda69c35ef77caf","observation_id":"71f17e32-ee9b-4509-b9e9-2e4ec44e263e","resolution":{"observed_at":"2026-07-10T09:37:00.825956Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08180","last_updated":"2025-03-27T16:07:18Z","snapshot_observed_at":"2026-08-12T04:16:25.054962Z","submitted_at":"2025-02-12T07:37:39Z","title":"Enhancing LLM Character-Level Manipulation via Divide and Conquer","version":2},"cited_work":{"arxiv_id":"2502.08180","doi":"10.48550/arxiv.2502.08180","metadata_source":"pith","pith_arxiv_id":"2502.08180","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing LLM Character-Level Manipulation via Divide and Conquer","venue":"cs.CL","work_id":"83bd1187-b779-4778-9b6f-58ac139dfb3c","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2502.08180","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:382e67175a8881f5351f02a6edac1ead99b63cdd32a81200fba6a4fb3ddb1963","observation_id":"2c8f1418-6c6d-47e8-820a-f65a8c25c593","resolution":{"observed_at":"2026-07-10T09:37:00.852125Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.234721Z","title":"Com- positional generalization from first principles.Advances in Neural Information Processing Systems, 36:6941–6960, 2023","venue":null,"work_id":"c5acda82-3e88-4727-b3ad-e381223d4cb2","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ffcb0f5752c362460425e7c303a81537e60861367f2d9be54e375b40e3c0535d","observation_id":"80994607-8144-48c9-ae13-4de84877d84f","resolution":{"observed_at":"2026-07-10T09:37:01.236873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.237553Z","title":"Make it count: Text-to-image generation with an accurate number of objects","venue":null,"work_id":"eec4ba75-5766-4efe-9a2e-b32f40181baf","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:fa75f8091e22231aef53dd851e7bf11868a7add6ebe889d659e57f124677eb68","observation_id":"aee98673-0ab1-47a6-b4f8-44d5a8404c97","resolution":{"observed_at":"2026-07-10T09:37:01.238893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05092","last_updated":"2025-03-18T11:43:52Z","snapshot_observed_at":"2026-08-15T10:17:34.826000Z","submitted_at":"2025-02-07T17:11:23Z","title":"Lost in Time: Clock and Calendar Understanding Challenges in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2502.05092","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05092","snapshot_observed_at":"2026-07-10T09:37:00.846980Z","title":"Saxena, A","venue":"cs.CV","work_id":"2af6578a-e9da-47d4-b1a4-f80895392fa6","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2502.05092","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8d19f6246eea233b1043711120077719538ccce805777f6f591556fd2cef6d74","observation_id":"f324f054-04dd-4641-ac92-5e0bcd1808e0","resolution":{"observed_at":"2026-07-10T09:37:00.849556Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.22465","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:00.837582Z","title":"Constraintbench: Bench- marking llm constraint reasoning on direct optimization.arXiv preprint arXiv:2602.22465, 2026","venue":null,"work_id":"39a0d46f-e336-4014-9238-6f5ac0c9a7c3","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:6a4416ac1ee217f5931a7e5a8edac12246900e50f089464f396d1da830dfe2f7","observation_id":"4695c38f-5842-4c09-9368-5e0954083603","resolution":{"observed_at":"2026-07-10T09:37:00.839546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.03916","last_updated":"2026-05-10T15:38:24Z","snapshot_observed_at":"2026-08-02T06:58:52.885755Z","submitted_at":"2026-02-03T17:52:02Z","title":"SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?","version":3},"cited_work":{"arxiv_id":"2602.03916","doi":"10.48550/arxiv.2602.03916","metadata_source":"pith","pith_arxiv_id":"2602.03916","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SpatiaLab: Can Vision-Language Models Perform Spatial Reasoning in the Wild?","venue":"cs.CV","work_id":"1bc94b20-7b00-41ef-b993-991206d25ec9","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2602.03916","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:740ca013e19c25edfabcea0528ff37dc3c3d5aacba43bf05ceb5724613f74c9e","observation_id":"c8437ce7-c7ed-4f52-97ab-0d8769438b31","resolution":{"observed_at":"2026-07-10T09:37:00.835854Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11854","last_updated":"2025-05-17T05:36:14Z","snapshot_observed_at":"2026-08-16T17:40:54.467150Z","submitted_at":"2025-05-17T05:36:14Z","title":"Evaluating the Logical Reasoning Abilities of Large Reasoning Models","version":1},"cited_work":{"arxiv_id":"2505.11854","doi":"10.48550/arxiv.2505.11854","metadata_source":"pith","pith_arxiv_id":"2505.11854","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating the logical reasoning abilities of large reasoning models, 2025 a","venue":"cs.AI","work_id":"6dbfd621-0f11-4c5c-b082-a1f07aaf0ddc","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.11854","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:90689cfaf35f77d53e7c42d78fbd9a4fe61b929d513e813020607bddeaa3288f","observation_id":"8b3fd663-13d1-4edf-b255-7444bc170294","resolution":{"observed_at":"2026-07-10T09:37:00.772539Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.02018","last_updated":"2025-05-04T07:48:36Z","snapshot_observed_at":"2026-08-19T05:43:25.096121Z","submitted_at":"2025-05-04T07:48:36Z","title":"R-Bench: Graduate-level Multi-disciplinary Benchmarks for LLM & MLLM Complex Reasoning Evaluation","version":1},"cited_work":{"arxiv_id":"2505.02018","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.02018","snapshot_observed_at":"2026-07-10T09:37:00.794953Z","title":"R-bench: Graduate-level multi-disciplinary benchmarks for llm & mllm complex reasoning evaluation","venue":"cs.CV","work_id":"741dcc7b-4477-44f1-a131-a2598edc159f","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.02018","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:691df028b150824dfe86f13e0d683e2b2d3e376fcde649df995d2be0c26a4eb7","observation_id":"1bac3f50-ff3e-4870-b37c-ed52de082641","resolution":{"observed_at":"2026-07-10T09:37:00.796446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.224821Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models","venue":null,"work_id":"8f39aa4d-b93d-409e-8a38-2477cc7aa7de","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:2a49eb7f201232103a418ae2a988c7f89415d17d21e0bfbe910eb9eae172c156","observation_id":"6dde6904-aad2-46a8-89ac-2f44a5537624","resolution":{"observed_at":"2026-07-10T09:37:01.225974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.226462Z","title":"Beyond accuracy: Behavioral testing of nlp models with checklist","venue":null,"work_id":"66dbd026-31b8-42cb-924f-e840a5e68a82","year":2020},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:0e09843285dcdf40a4c4654449a56878da3c1b1e95fe645820dfa9a36eef3a71","observation_id":"d7e9917d-5c40-4f73-8cd6-a29dd819cb4c","resolution":{"observed_at":"2026-07-10T09:37:01.227610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.228115Z","title":"Right for the wrong reasons: Diagnosing syntactic heuristics in natural language inference","venue":null,"work_id":"0235e12f-20f4-4429-9206-3508f787b0fc","year":2019},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:2e7445219b9942aebe87481b735c11573e7eefe6812daf31d32f043755a7dac9","observation_id":"81fe030f-7e55-495f-a7f2-730fa174e8e2","resolution":{"observed_at":"2026-07-10T09:37:01.229229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.231522Z","title":"Dynabench: Rethink- ing benchmarking in nlp","venue":null,"work_id":"6b37433b-49da-47f5-b034-9c9e520e209a","year":2021},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:97ff3ff59a768490b3f3fc15bf4c18254edc1c2c63f561dedc0c493ec600c054","observation_id":"567220a3-61df-4673-b776-71b33ce6404f","resolution":{"observed_at":"2026-07-10T09:37:01.232558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.233065Z","title":"Evaluating models’ local deci- sion boundaries via contrast sets","venue":null,"work_id":"c13386a3-d628-4a36-92d5-3c4dcd63633d","year":2020},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:882d4dd88b4d39f368900af592c03a6334c7dc118d8ad52238a431c524d9254e","observation_id":"e98050e3-e60b-422c-9318-a6a5e7d6d264","resolution":{"observed_at":"2026-07-10T09:37:01.234199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":"2306.13394","doi":"10.48550/arxiv.2306.13394","metadata_source":"pith","pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-10T13:27:05.561984Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","venue":"cs.CV","work_id":"806d2e73-71b3-4d56-87e0-39d571cc15d6","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:be598a78ba66434fcb2b87fea4910f256209fbfdaf923cff0451f59ad11ea7e5","observation_id":"373e7d6a-d96a-48b6-9856-e196cb494499","resolution":{"observed_at":"2026-07-10T09:37:00.775167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:17.033703+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-20T06:11:48.391709Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":"2505.21327","doi":"10.48550/arxiv.2505.21327","metadata_source":"pith","pith_arxiv_id":"2505.21327","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mme-reasoning: A comprehensive benchmark for logical reasoning in mllms","venue":"cs.AI","work_id":"7f0cf532-adf5-4663-b708-1a3763ed47d0","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.21327","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9313bd967ec4fa5514a1a6b3958fa9c5eb32b64f8575affaac688a180fea07e4","observation_id":"26086492-4058-4ff1-b214-0862364f95a6","resolution":{"observed_at":"2026-07-10T09:37:00.791323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T05:19:18.592087+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T05:19:18.592087+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-21T04:07:07.949331Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":"2308.02490","doi":null,"metadata_source":"pith","pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-07-10T09:37:00.827227Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","venue":"cs.AI","work_id":"7f3bac41-a0a5-4a7a-bfd2-526b616db745","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:cd65b5556d54b8d58a20e1642777ed5fa55afc45c5bffe884d0d3685bc799287","observation_id":"6e374258-76b2-41eb-b4c9-fc9e553ed08e","resolution":{"observed_at":"2026-07-10T09:37:00.828567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.212698Z","title":"Glue: A multi-task benchmark and analysis platform for natural language understanding","venue":null,"work_id":"189206c3-17de-4465-90b9-8d62ebd0e8df","year":2018},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9287f8ac7bb1c95d58fc5cf48fa289828b640b09635ab29c96d22e294ac27f8e","observation_id":"e70337f8-d115-4ea9-8a37-4e19b0ba1fd7","resolution":{"observed_at":"2026-07-10T09:37:01.213885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05425","last_updated":"2026-04-28T02:01:09Z","snapshot_observed_at":"2026-08-20T00:15:58.158571Z","submitted_at":"2025-06-05T05:51:35Z","title":"SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning","version":3},"cited_work":{"arxiv_id":"2506.05425","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.05425","snapshot_observed_at":"2026-07-10T09:37:00.785220Z","title":"SIV-Bench: A Video Benchmark for Social Interaction Understanding and Reasoning","venue":"cs.CV","work_id":"d023fb0d-85c5-4139-b83f-c51613886c55","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2506.05425","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:22ce5a5dc9c940506d4997f9df0bc9b61810718e06dc0be6a5a5e68c911bd90d","observation_id":"4fefd41b-2774-4ea0-88ea-7bd0b739f767","resolution":{"observed_at":"2026-07-10T09:37:00.786672Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.229744Z","title":"A survey on large language model reasoning failures","venue":null,"work_id":"805af10a-432d-4b2e-9ee9-079f13e5bc57","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:cd9d3aebb9d506fb80b421292730e59df586f8595eb65f67df1cbb841ff3122a","observation_id":"ea6a7385-f114-4edb-8153-c20580e6ae86","resolution":{"observed_at":"2026-07-10T09:37:01.231040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.214431Z","title":"GSM-plus: A compre- hensive benchmark for evaluating the robustness of LLMs as mathematical problem solvers","venue":null,"work_id":"a2627f8e-62ac-4f2b-bfe0-402044c6d6a3","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ed7b17ac3d9d1f55622923412aa513e13f9fabdcd0c52071080ca2ffbc46e3c9","observation_id":"b48fcf0d-20e5-4070-ad95-94715a309822","resolution":{"observed_at":"2026-07-10T09:37:01.215615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06453","last_updated":"2025-02-12T23:16:27Z","snapshot_observed_at":"2026-08-20T16:37:00.586669Z","submitted_at":"2025-02-10T13:31:46Z","title":"MATH-Perturb: Benchmarking LLMs' Math Reasoning Abilities against Hard Perturbations","version":2},"cited_work":{"arxiv_id":"2502.06453","doi":"10.48550/arxiv.2502.06453","metadata_source":"pith","pith_arxiv_id":"2502.06453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Math-perturb: Benchmarking llms’ math reasoning abilities against hard perturbations","venue":"cs.LG","work_id":"621c78c6-7ff2-4364-8642-ceeac09ac208","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2502.06453","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:514c004b5d8db7d13ef64742d15152ca0aa27c387c2153d65e82cb7cb906b1eb","observation_id":"48682d90-85c8-46ef-9c78-9d6c89d3733e","resolution":{"observed_at":"2026-07-10T09:37:00.719526Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:19.366857+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:19.366857+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-21T14:11:30.905906Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":"2410.05229","doi":"10.48550/arxiv.2410.05229","metadata_source":"pith","pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","venue":"cs.LG","work_id":"7d26909d-cb69-48f7-b93e-7d6fcc281415","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5722ff0948fbc9b4ee59df075eb17ae8cc856ac23bc2c1fe7c8088c346073992","observation_id":"d84acaac-6e52-4e22-84b8-ca0cabfc0818","resolution":{"observed_at":"2026-07-10T09:37:00.716546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:19.596854+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:19.596854+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.216168Z","title":"Varbench: Robust language model benchmarking through dynamic variable perturbation","venue":null,"work_id":"79dde9a4-c3f0-428d-b330-36fbe5b97042","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:f67ea6f08ca7b58b7922b03c53940bab5bcc2cb641daeba6b066b93f580b012a","observation_id":"2a722544-6024-4835-9733-368f87fefe00","resolution":{"observed_at":"2026-07-10T09:37:01.217320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.251886Z","title":"Longbench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":"217e4962-b6b3-4402-ab00-96bc6344fb75","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:6cd4960118054a76a49e7771011970f34af6d62a3c91092e939fc0c354e25c25","observation_id":"53a8bb3c-d28a-45ea-9f43-a427250d9880","resolution":{"observed_at":"2026-07-10T09:37:01.253065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.248336Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"4ab99dcb-7e3e-44fa-bcd5-165364d12e2d","year":2022},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5ebe01569ea19aaab20ba022ce1ed8d8effc90031985633b0aca0d5284a2cd7d","observation_id":"86cf627b-7d55-4a3f-8910-5f6e1833cda0","resolution":{"observed_at":"2026-07-10T09:37:01.249610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19707","last_updated":"2025-03-25T14:34:06Z","snapshot_observed_at":"2026-08-16T12:46:58.006510Z","submitted_at":"2025-03-25T14:34:06Z","title":"Mind the Gap: Benchmarking Spatial Reasoning in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2503.19707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.19707","snapshot_observed_at":"2026-07-10T09:37:00.841150Z","title":"Mind the gap: Benchmarking spatial reasoning in vision-language models.arXiv preprint arXiv:2503.19707","venue":"cs.CV","work_id":"06006849-24f6-4955-9dd0-1cbe59b0fc66","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2503.19707","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:69835b4b221bd5b080f0e2f21f8385b45c0ca91bf87007f01e25900ab1589b0f","observation_id":"a6d702a7-d72f-4393-af86-8a1340ef24b8","resolution":{"observed_at":"2026-07-10T09:37:00.842655Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.205957Z","title":"Do vision language models rotate in mind? evalu- ating spatial transformation reasoning, 2026","venue":null,"work_id":"e4f7aca3-09dc-44ce-8895-9c09ab48a9a2","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:701a9bace508de1417f0701837c87b255bee77897f17f1f7250e6e006a46fee8","observation_id":"fd648ad6-4605-44c0-9ce8-e6505fedf286","resolution":{"observed_at":"2026-07-10T09:37:01.207110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.00686","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:00.871884Z","title":"Lvlm-count: Enhancing the count- ing ability of large vision-language models","venue":null,"work_id":"eaa7ff33-ba15-43ec-b7d0-45e269d2cb8e","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9cd2b3b18796720ad4b588a0314a92f0c309a576ef68c8e2dc66abeff187d825","observation_id":"acda9658-6897-4f41-8808-e375db2829ff","resolution":{"observed_at":"2026-07-10T09:37:00.873469Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-08-20T13:30:34.878342Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":"2210.01240","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-07-10T09:37:00.809818Z","title":"arXiv preprint arXiv:2210.01240 , year=","venue":"cs.CL","work_id":"ec643dee-886e-4ede-bc9d-bc244c397d0a","year":2022},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:a9c89859fdd07e23974b280d9ebf50ed9329732a9108e7094178188de32f53f0","observation_id":"2b03149e-7718-4fa4-bff7-dabc9643c160","resolution":{"observed_at":"2026-07-10T09:37:00.811042Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19730","last_updated":"2024-10-29T03:48:33Z","snapshot_observed_at":"2026-08-20T04:14:46.833330Z","submitted_at":"2024-10-25T17:56:24Z","title":"Counting Ability of Large Language Models and Impact of Tokenization","version":2},"cited_work":{"arxiv_id":"2410.19730","doi":"10.48550/arxiv.2410.19730","metadata_source":"pith","pith_arxiv_id":"2410.19730","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2410.19730 , year =","venue":"cs.CL","work_id":"03adbc37-2463-4298-b12c-afa9344ad2de","year":2024},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2410.19730","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5f4982627622e64772bf569ce7a41249289d0475e4b0176e08343a16b10def47","observation_id":"3cdbb8bb-b1f9-4ed2-854e-fce8ecb77e73","resolution":{"observed_at":"2026-07-10T09:37:00.803900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.209363Z","title":"Inspect AI: Framework for Large Language Model Evaluations, May","venue":null,"work_id":"a8b58292-344d-4f79-9a94-63947f8691b3","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:5621a83e0c436be1310735933ea9e15c9f34d301d02ce5a9ff0dbd8466584b08","observation_id":"debb9cac-ab1f-4d52-b5f5-93ee5966b07c","resolution":{"observed_at":"2026-07-10T09:37:01.210429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.246781Z","title":"MIT License","venue":null,"work_id":"0b529e5a-7cd1-4863-b6be-839ef07023bb","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:41b1db6b67bdf522c46ab9256dc1d339e9127b5b0e5cf55f4de8d3f441cbac22","observation_id":"c5fa324f-3a3c-41a0-99f6-c3bc31ae114c","resolution":{"observed_at":"2026-07-10T09:37:01.247831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:25a8b40e37ab490a6af2fd3d64f7151aee7c0e0c6bf6c84428f3beff41817825","observation_id":"bf73e651-ae8f-4b00-9d82-fbffd37af242","resolution":{"observed_at":"2026-07-10T09:37:00.860103Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":"2604.15804","doi":"10.48550/arxiv.2604.15804","metadata_source":"pith","pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Qwen3.5-Omni Technical Report","venue":"cs.CL","work_id":"9d0aeac4-3b94-4a09-af62-5e32286fdf5f","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:588350b062eb568f8711a14451a82c52a9788d2da24ce723f1a940ebfaaa19be","observation_id":"98b97f9b-5598-4661-a084-2f6dc2ed5391","resolution":{"observed_at":"2026-07-10T09:37:00.855021Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15763","last_updated":"2026-02-24T10:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T17:50:56Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","version":2},"cited_work":{"arxiv_id":"2602.15763","doi":"10.48550/arxiv.2602.15763","metadata_source":"pith","pith_arxiv_id":"2602.15763","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GLM-5: from Vibe Coding to Agentic Engineering","venue":"cs.LG","work_id":"ad29b1a2-bf77-46b3-9ead-fb62b1d2c6fe","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2602.15763","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:83e2bfed1c0d39a0d320b6a16269bb4e63bce67e7042bebdfeb41e6f344558d1","observation_id":"8eb2c0a7-7ef4-4b32-a435-0b6f8dfdcce2","resolution":{"observed_at":"2026-07-10T09:37:00.781400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.02276","last_updated":"2026-02-02T16:17:38Z","snapshot_observed_at":"2026-08-12T00:25:39.214406Z","submitted_at":"2026-02-02T16:17:38Z","title":"Kimi K2.5: Visual Agentic Intelligence","version":1},"cited_work":{"arxiv_id":"2602.02276","doi":"10.48550/arxiv.2602.02276","metadata_source":"pith","pith_arxiv_id":"2602.02276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2.5: Visual Agentic Intelligence","venue":"cs.CL","work_id":"d690be8f-5d53-49b0-b1e7-79668eb8fcdb","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2602.02276","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:24571157ce18634d7c489e59dcc54eeadaf634594e4b7000d4e46a7855b9d0ae","observation_id":"d6deaa6f-d614-4e12-81cb-bd358c064cd5","resolution":{"observed_at":"2026-07-10T09:37:00.777604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-07T20:38:24.673777+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.250180Z","title":"Gemma 4 model card.https://ai.google.dev/gemma/docs/core/model_ card_4, 2026","venue":null,"work_id":"b6154b39-ca51-40b1-a8aa-d329c6b20b58","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:013fb82efeabb8823f756eb7f8104cd50ec4760db7a964a3a9dbea6178fb80c6","observation_id":"87f7324f-5650-4da2-ab07-c4ea61ac4e52","resolution":{"observed_at":"2026-07-10T09:37:01.251362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-14T02:46:12.121034Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":"2508.10925","doi":"10.3115/1073083.1073135","metadata_source":"pith","pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","venue":"cs.CL","work_id":"178c1f7e-4f19-4392-a45d-45a6dfa88ead","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:d3e4ebfcab7325e935fa427200ee1172152d00a0550b3cb5c7b7889612588988","observation_id":"fdc1c3a6-7ccb-4da7-8117-e0a08ed0edea","resolution":{"observed_at":"2026-07-10T09:37:00.801393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T19:19:47.962081+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c45f07e390085bf24ecd1ab53a99456acbcaac15fb31c41e20f27a4267a15cc8","observation_id":"50764985-aa5c-4325-8fb2-2d2839654f24","resolution":{"observed_at":"2026-07-10T09:37:00.868256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.202470Z","title":"Gemini 3 Pro Model Card.https://storage.googleapis.com/ deepmind-media/Model-Cards/Gemini-3-Pro-Model-Card.pdf, 2025","venue":null,"work_id":"3ace207d-ba24-4eaf-8243-034764f3b4d9","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:502c0ae671c248d6232dcb99f549e88d2fb4c1afe5711a7e93faca708aa30a53","observation_id":"1cc6a025-70d0-4bff-b9bd-ef32b4b4c19b","resolution":{"observed_at":"2026-07-10T09:37:01.203644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-15T00:17:32.875866Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:82fe8665a6d815c9f48090e4ba84acc87731d34f1c7761e94e51d9a7adb69bde","observation_id":"9139270f-04c9-4150-a734-0c2733d9b247","resolution":{"observed_at":"2026-07-10T09:37:00.808527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-22T05:08:14.623228+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-22T05:08:14.623228+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.204167Z","title":"Introducing GPT-5.4.https://openai.com/index/introducing-gpt-5-4/","venue":null,"work_id":"203634bc-bc17-4e6c-98ec-60e7612f1484","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:40281f064af47bac6c15735896f4eb72e46a62e36f03be289299dcb408281780","observation_id":"0155e527-5608-4846-a879-1ac1c49d9020","resolution":{"observed_at":"2026-07-10T09:37:01.205427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.207619Z","title":"Efficient memory management for large lan- guage model serving with pagedattention","venue":null,"work_id":"b5180891-e1cc-485a-b9ce-6155d586b83e","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:d23cfcad8e18f571e4309ea6334d9ef491d11f981d8435647a10d7ad0cdbf520","observation_id":"cf198685-5152-4736-808d-bf269ca1b36d","resolution":{"observed_at":"2026-07-10T09:37:01.208853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.219494Z","title":"Artificial Analysis Intelligence Benchmarking Methodology: Artificial Analysis Intelligence Index v4.0.4.https://artificialanalysis.ai/methodology/ intelligence-benchmarking, 2026","venue":null,"work_id":"f24ee7f6-99ba-49d5-b55d-650623e95537","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c7f2ddcb6ae3a60b86c3aaffef50e02ec6b5043b8db388996395b5aad1ae8f62","observation_id":"34d34ffa-f213-4783-a425-799bb10c60b7","resolution":{"observed_at":"2026-07-10T09:37:01.220841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-08-20T14:04:31.329156Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":"2501.14249","doi":"10.1038/s41586-025-09962-4","metadata_source":"pith","pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Humanity's Last Exam","venue":"cs.LG","work_id":"59ea00d4-16a8-45e1-aafc-290a6f91d9f4","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:9b47a3a73a2e87b613b9071645fb2a2fd4f972a4000c4deef5146798f54d227a","observation_id":"acf5a55d-de7a-433a-ae07-7dbffe84280d","resolution":{"observed_at":"2026-07-10T09:37:00.710564Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T22:08:32.844211+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02833","last_updated":"2025-11-11T09:40:12Z","snapshot_observed_at":"2026-08-14T11:40:59.457005Z","submitted_at":"2025-07-03T17:44:33Z","title":"Generalizing Verifiable Instruction Following","version":3},"cited_work":{"arxiv_id":"2507.02833","doi":"10.48550/arxiv.2507.02833","metadata_source":"pith","pith_arxiv_id":"2507.02833","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generalizing Verifiable Instruction Following","venue":"cs.CL","work_id":"f761e9b8-8bc1-4bf7-bdab-175a13950f4e","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2507.02833","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:88c5e47b3811389ceeedafdc55c953a5ce3f7983bbeb9d1fcca1bbf4d88a8810","observation_id":"70d3d12c-f759-43c3-9068-e0e2a8fea382","resolution":{"observed_at":"2026-07-10T09:37:00.830888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-08-20T02:32:10.164015Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":"2601.11868","doi":"10.48550/arxiv.2302.01973","metadata_source":"pith","pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","venue":"cs.SE","work_id":"0624be05-1d97-4fd6-8300-b04b8a3ab04b","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:3fda224903142d70c7ad6e0febdccb1561175f7ece60849222ce10d4b8b9a6c1","observation_id":"b1db2c66-4082-4eb3-8e2a-a2830cc143a2","resolution":{"observed_at":"2026-07-10T09:37:00.702370Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23941","last_updated":"2026-04-19T17:09:48Z","snapshot_observed_at":"2026-08-20T05:51:01.664945Z","submitted_at":"2025-05-29T18:47:58Z","title":"Vision Language Models are Biased","version":4},"cited_work":{"arxiv_id":"2505.23941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23941","snapshot_observed_at":"2026-07-10T09:37:00.792500Z","title":"Vision Language Models are Biased","venue":"cs.LG","work_id":"7d4732f2-a4b0-4c6c-b9aa-6110e1f519cc","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2505.23941","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c388ba56299afc223f6e5775eb67472e622b2cd3c3cc1a0cc027b35b41419230","observation_id":"abc00e6f-8205-4830-9a9e-4daf195e6366","resolution":{"observed_at":"2026-07-10T09:37:00.793694Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.200663Z","title":"Inksight: Offline-to-online handwriting conversion by teaching vision-language models to read and write.Transactions on Machine Learning Research, 2025","venue":null,"work_id":"9a24d471-4357-4546-9942-586024651ed7","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ccf3f626c4a3f377e00404f20a66a703ba252f8b5efe9e20988e627c592bcd59","observation_id":"f7218e6a-85a1-4acb-ad60-dfa0b667a7f0","resolution":{"observed_at":"2026-07-10T09:37:01.201949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.253571Z","title":"Inkslop: Vibe-coded benchmark for spatial reasoning with digital ink, 2026","venue":null,"work_id":"0d37f831-624a-4d7b-bb53-f261daf8dc6d","year":2026},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c3d3f5f0d33dc57dd10ae9dea6004c9f907ae95621e7ff4ffc03738dedb285ac","observation_id":"c5f6d51d-54c6-4cc5-8836-8efc93655c12","resolution":{"observed_at":"2026-07-10T09:37:01.254722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.09713","last_updated":"2020-06-25T06:38:53Z","snapshot_observed_at":"2026-08-22T22:51:51.976592Z","submitted_at":"2019-12-20T09:32:41Z","title":"Measuring Compositional Generalization: A Comprehensive Method on Realistic Data","version":2},"cited_work":{"arxiv_id":"1912.09713","doi":null,"metadata_source":"pith","pith_arxiv_id":"1912.09713","snapshot_observed_at":"2026-07-10T09:37:00.864528Z","title":"Najoung Kim and Tal Linzen","venue":"cs.LG","work_id":"affca336-73c5-4192-9e27-b887f212cd11","year":2019},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/1912.09713","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:7ef69171720bd956ac8b1419a6836144fe7cb7a0a5a365addd11cda881fe684e","observation_id":"530aaa96-94cc-48fb-bb25-26a5d7b4347f","resolution":{"observed_at":"2026-07-10T09:37:00.865769Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.07207","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:00.768353Z","title":"Scaling can lead to compositional gener- alization.arXiv preprint arXiv:2507.07207, 2025","venue":null,"work_id":"37162369-5fcf-4e98-b45c-5be3e962d3cc","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:c26f18cbcf03e1a39cc65b22c2ef8acc7abe2e0922a7751f11e6a3f941958b7f","observation_id":"1bb143d9-7b11-472d-a777-f4f6912acf8f","resolution":{"observed_at":"2026-07-10T09:37:00.769972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05766","last_updated":"2018-02-15T21:16:59Z","snapshot_observed_at":"2026-08-15T06:59:08.861429Z","submitted_at":"2018-02-15T21:16:59Z","title":"Learning to Count Objects in Natural Images for Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1802.05766","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.05766","snapshot_observed_at":"2026-07-10T09:37:00.805098Z","title":"Learning to Count Objects in Natural Images for Visual Question Answering","venue":"cs.CV","work_id":"518a32d3-4b87-4774-ae3e-e5763f7a62ec","year":2018},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/1802.05766","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:17ee8db1324e87bcb0de5e685d01ce8c97b88d6912dc377e7f1f90483b65832a","observation_id":"3e329f58-ac1b-428a-8256-e254c68f0d50","resolution":{"observed_at":"2026-07-10T09:37:00.806324Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v33i01.33018076","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tallyqa: Answering complex counting questions","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"4938138e-5b36-451c-9fc3-2f4959afc75b","year":2019},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:4b99fcf57b75b9db9a4942c8688d37d3b4344052678447b371389370ce6be3c9","observation_id":"d4f8a6d8-75fe-4d04-9d06-7a577d1618bf","resolution":{"observed_at":"2026-07-10T09:37:00.713335Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-18T18:51:20.320447+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-18T18:51:20.320447+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15722","doi":"10.48550/arxiv.2511.15722","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Spatial reasoning in multimodal large language models: A survey of tasks, benchmarks and methods","venue":"ArXiv.org","work_id":"6a89950e-e68f-4ee1-92ca-4c617487ec7c","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:324246824b2a2bce365d15cedae1ebc267b7882231f8ea84724790413f4b3348","observation_id":"32d03d1e-7a59-40fd-acae-88b99c342c51","resolution":{"observed_at":"2026-07-10T09:37:00.820846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.193973Z","title":null,"venue":null,"work_id":"060809c3-c70f-4d9b-b00d-8d378002bddd","year":2023},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:4a612ecdcade411353f8b6a216969594f46035c4c72dba9dfd0521144c449901","observation_id":"9409d0a3-64a0-4482-bbab-a83c034dd832","resolution":{"observed_at":"2026-07-10T09:37:01.195107Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00545","last_updated":"2021-11-02T19:12:12Z","snapshot_observed_at":"2026-08-16T18:20:51.077477Z","submitted_at":"2021-05-31T14:39:38Z","title":"Counterfactual Invariance to Spurious Correlations: Why and How to Pass Stress Tests","version":3},"cited_work":{"arxiv_id":"2106.00545","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00545","snapshot_observed_at":"2026-07-10T09:37:00.797725Z","title":"Counterfactual invariance to spurious correlations: Why and how to pass stress tests.arXiv preprint arXiv:2106.00545","venue":"cs.LG","work_id":"369ae891-c73f-4984-813c-d885f1f99c61","year":2021},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"cited_paper":"/paper/2106.00545","citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:1c4d76c97be7f5da35d085f6066c8dbe4685a065f1d867ca6a983644c965f6e4","observation_id":"a7bb48b5-0540-4a8c-b251-485b6c798b6c","resolution":{"observed_at":"2026-07-10T09:37:00.798951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.198998Z","title":null,"venue":null,"work_id":"c2c880b6-7c4a-4855-bd52-a25e32d16ef4","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ef9e7ca0b9bf37d1270c7c97c64850a12462c0963b8c56024c6eb53b98defd74","observation_id":"aea1cd86-5799-4482-8ea5-d8d4e90d308b","resolution":{"observed_at":"2026-07-10T09:37:01.200122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.197384Z","title":null,"venue":null,"work_id":"fcc9eb61-ab30-4ff2-af5b-e110219c62b2","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:8c53ec1016bfa342adb32594bcba82cec8b76979b93dc6198935fc70de8df800","observation_id":"1fe88e11-1c9c-4851-a48d-b54a5d26e327","resolution":{"observed_at":"2026-07-10T09:37:01.198490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.195670Z","title":null,"venue":null,"work_id":"2cba6c06-c303-42e1-b626-e74348ad8ce2","year":null},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:bdfccf212ee3995e27a9c3e30e6c56a03f83754fa5541511292445d9650b9cc2","observation_id":"ed07be03-519f-4683-8cec-693cf8e8f640","resolution":{"observed_at":"2026-07-10T09:37:01.196836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T09:37:01.223127Z","title":"C\" for CORRECT: The generated image satisfies the task requirements -","venue":null,"work_id":"dd33523d-ebde-43d8-8935-97ca52a5d64a","year":2025},"citing_paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-10T09:30:46.564013Z"},"links":{"citing_paper":"/paper/2607.08317"},"observation_digest":"sha256:ef733a7fbab6304b9ae69cc61ab173c5adcf60c96be95eb0e5c7bbfcaddc2e29","observation_id":"5c002943-c9d0-4b32-ad42-9e90ace31818","resolution":{"observed_at":"2026-07-10T09:37:01.224324Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.08317","last_updated":"2026-07-09T09:56:50Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T21:53:44.151713Z","submitted_at":"2026-07-09T09:56:50Z","title":"Blind-Spots-Bench: Evaluating Blind Spots in Multimodal Models"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":1,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":4,"verified_exact":37,"verified_fuzzy":30},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2607.08317."}