{"as_of":"2026-08-18T06:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d88d396aae31b290d288c862af47afa1bfb254e646cf86767ef39b3c05d35ea7","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:13:01.238326Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:32:43.191067Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:53:16.341543Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02669","snapshot_observed_at":"2026-08-05T16:32:43.191067Z","title":"Generalizing from simple to hard visual reasoning: Can we mitigate modality imbalance in vlms? arXiv preprint arXiv:2501.02669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.191067Z"},"links":{"cited_paper":"/paper/2501.02669","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:ce5b06d627ae029d7196582297e99f77ccbc4f1c38ceb45ee094317ded302b40","observation_id":"1102cc23-3b0f-46de-8988-d3a531a0f46d","resolution":{"observed_at":"2026-08-05T16:32:43.191067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"cited_work":{"arxiv_id":"2501.02669","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.02669","snapshot_observed_at":"2026-06-29T08:53:16.341543Z","title":"Generalizing from simple to hard visual reasoning: Can we mitigate modality imbalance in vlms?arXiv preprint arXiv:2501.02669, 2025","venue":null,"work_id":"a315545f-5fc7-41c8-a658-b081e965596e","year":2025},"citing_paper":{"arxiv_id":"2605.29398","last_updated":"2026-05-28T05:47:40Z","snapshot_observed_at":"2026-07-06T23:38:51.349968Z","submitted_at":"2026-05-28T05:47:40Z","title":"GDSD: Reinforcement Learning as Guided Denoiser Self-Distillation for Diffusion Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T08:44:53.969301Z"},"links":{"cited_paper":"/paper/2501.02669","citing_paper":"/paper/2605.29398"},"observation_digest":"sha256:490c50d7049f5e2312d72d9493af96f62eda528e5347525eeb586b39f5c5a506","observation_id":"5f397b56-197c-44e0-9ad9-cc6c9852c6d3","resolution":{"observed_at":"2026-06-29T08:53:16.343122Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.02669/citation-record","integrity":"/paper/2501.02669/integrity","json":"/paper/2501.02669/citation-record.json","paper":"/paper/2501.02669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.897037Z","title":"shape type), the model first needs to correctly enumerate the attribute values (e.g","venue":null,"work_id":"ff406227-c8b5-4b23-ac30-88504d9c7b12","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.590633Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:9f68b3fda9a20475ff53491a32f4fab413bd657c40caef27ac9c47e26f26724c","observation_id":"d9b929af-00a5-4a12-a07f-ffbbe87e0c48","resolution":{"observed_at":"2026-08-10T22:13:03.945341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:04.282368Z","title":null,"venue":null,"work_id":"dc1d0f7b-e4bb-489d-8735-1965f67cb91f","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.491671Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:59cb234127a263182acd073b98d7992716b46483ad545de755d3ebddb3beb95f","observation_id":"4738033a-e60a-4a35-956d-6ed14f3af148","resolution":{"observed_at":"2026-08-10T22:13:04.316329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:04.144788Z","title":"backtracking","venue":null,"work_id":"2eb68966-c634-491b-89fe-3fb86ce70f17","year":2019},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.514749Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:714fa52fc479eadf974bd8c5d6dfc584c8b1da1252c1381328d93701952208fd","observation_id":"091f7cb5-6e71-487f-9f52-4ced86728735","resolution":{"observed_at":"2026-08-10T22:13:04.185468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.542822Z","title":"• To reason about the query: the model needs to correctly enumerate the attribute values for each image in the query similarly","venue":null,"work_id":"c5896df8-8d86-4aec-8f0c-07d322011c1e","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.715938Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:bfa18823cc3764f0c40a1c1d265744ec0e2b69a9c6666c06f0d2305a53d61e00","observation_id":"8e50b250-444e-4e1c-bf56-e893c2fd84f8","resolution":{"observed_at":"2026-08-10T22:13:03.583444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:04.498083Z","title":"Singh, A., Natarajan, V ., Shah, M., Jiang, Y ., Chen, X., Batra, D., Parikh, D., and Rohrbach, M","venue":null,"work_id":"0e3c9548-9376-484f-9566-3aab950ce447","year":2019},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.344750Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:bb7b64d50bb736e3eff25f4dc9ad08fd77f7ec24437b59ff72759082285ec1f1","observation_id":"6c348bf4-4c2b-4212-a0e3-77dd9ac44850","resolution":{"observed_at":"2026-08-10T22:13:04.534759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:04.470577Z","title":"Sun, Z., Yu, L., Shen, Y ., Liu, W., Yang, Y ., Welleck, S., and Gan, C","venue":null,"work_id":"15f36a35-37c9-4899-87a4-5b464fdbae4a","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.394167Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:86d95c26440a57e5327fe7fed2db6bde359d1167029de95745bd003bbe5c55d8","observation_id":"c049058d-af3d-4975-a6dd-142ba2e4f579","resolution":{"observed_at":"2026-08-10T22:13:04.485464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22597","last_updated":"2024-10-29T23:28:37Z","snapshot_observed_at":"2026-08-16T13:04:44.867999Z","submitted_at":"2024-10-29T23:28:37Z","title":"Are Large-Language Models Graph Algorithmic Reasoners?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22597","snapshot_observed_at":"2026-08-10T22:13:00.399401Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.399401Z"},"links":{"cited_paper":"/paper/2410.22597","citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:676290ff64bb99c6f84771708973c0c599084835d5f3eeadaaeeb2c5d8238f51","observation_id":"b1f6d2a1-d1f7-456c-823d-73939131dfb8","resolution":{"observed_at":"2026-08-10T22:13:00.399401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-10T22:13:00.424752Z","title":"Yue, X., Ni, Y ., Zhang, K., Zheng, T., Liu, R., Zhang, G., Stevens, S., Jiang, D., Ren, W., Sun, Y ., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.424752Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:8b103a39a518a404e7658eed1193e8dad331a85bc21a3f65d14be0019f76be9b","observation_id":"e3404e2f-cd44-4751-b728-0c2a890cb8ae","resolution":{"observed_at":"2026-08-10T22:13:00.424752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:04.404752Z","title":"single-hop","venue":null,"work_id":"05b9549a-9657-4f0f-be0f-c0b4415a24a3","year":2022},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.454746Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:30fc1e481dd8664bc58e356b38eb1277c37f96a12a244642b3ce569be7048587","observation_id":"978db19d-91f2-44da-93e8-ee725fb2899f","resolution":{"observed_at":"2026-08-10T22:13:04.444754Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.754843Z","title":null,"venue":null,"work_id":"a0152502-00ec-4527-a356-3b3a0713ca64","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.626799Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:7268a5d64ea5b44cfa3d9df8bbb05f296b5c5ecc8c9a3424fc4e002d1db6c2fd","observation_id":"08ac75a3-4241-45ca-a8be-d40be35b0bad","resolution":{"observed_at":"2026-08-10T22:13:03.794769Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.644747Z","title":null,"venue":null,"work_id":"22a4cd62-4ff8-4201-9a4b-d32e58111355","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.674277Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:df06a7dbf16612b51353fca8c0a51ffc40549d6d547fe37eed6422d8b1e9856f","observation_id":"06843895-1faa-4f65-bca3-c48f112ca72d","resolution":{"observed_at":"2026-08-10T22:13:03.679614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.444742Z","title":"(line type , XOR), the model needs to identify the correct values of the attribute domain d for each option image and the correct relationr","venue":null,"work_id":"dbcc7c52-773d-485c-98b1-fd3c2e9d96a1","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.754749Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:a8f628b2cc8c57877528e01f5c1bf2f6191fe99adc011012259249d9a73e1b8d","observation_id":"1eb820e9-c6d1-4b40-9924-28cc28c105b4","resolution":{"observed_at":"2026-08-10T22:13:03.474745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.331295Z","title":"46 Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs? Table 14","venue":null,"work_id":"451665ca-6f88-4031-abf1-72aaf0c6a7d8","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.784808Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:fe3721bf3a013da441e79a0cf332d4fe04ebfcf683dbe5410092011c0a8613c8","observation_id":"8b419063-6839-4715-8156-031645c3f018","resolution":{"observed_at":"2026-08-10T22:13:03.364749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.252325Z","title":null,"venue":null,"work_id":"6e884f8d-bb79-4cfb-b85e-2704359eaa0d","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.834746Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:9840137137f951576a1ec724d001c5ad1aa6a635306f839e63e568ac31da111e","observation_id":"7ae0808f-cb8f-4690-a4f4-9fc0568f3f2c","resolution":{"observed_at":"2026-08-10T22:13:03.263094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.147855Z","title":"Answer: 95 November December Figure 32.ASIMPLEexample fromTable Readout","venue":null,"work_id":"6fcc0791-5812-4a70-8ef8-842010b07f41","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.874880Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:0fa09d943084647ae1e61f8470521b20059b262443b2466902f3b7a409cb074b","observation_id":"ff329e0e-2a4a-4a88-bc39-a405a7262fdb","resolution":{"observed_at":"2026-08-10T22:13:03.182008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:03.061984Z","title":null,"venue":null,"work_id":"3a2be4ae-4fb7-4faf-b438-2c253b670a72","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.920852Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:78adfddaec6bf922b3a0201c6e1197c2c658a38928d829f9562009e4f8c53348","observation_id":"6309a005-e4a2-45e2-aa3e-7b52bb1c3aaa","resolution":{"observed_at":"2026-08-10T22:13:03.094820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.987912Z","title":"Answer: 233 Figure 33.AHARDexample fromTable Readout","venue":null,"work_id":"5cdf3430-b9b6-4838-a14a-df315700227e","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.961279Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:d954b307e3d07d854d12a77344916fc502c65ba44a03f9d93837f34572275de7","observation_id":"68bb3852-c4eb-48c8-ad6d-d2dfe5c2ff34","resolution":{"observed_at":"2026-08-10T22:13:03.025587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.868630Z","title":"The grid is filled up with objects, which you will be asked to recognize and collect, and obstacles, which you should avoid","venue":null,"work_id":"a4ecc9b7-8341-4a51-be47-d6b93fe3fe2c","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.994759Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:85c7370b42b9fe6ec7118a6d8688fee847e8653a0e74c3edcbf8ee9a6f3e5317","observation_id":"353eb138-7832-49d5-9b38-081d30de6fb4","resolution":{"observed_at":"2026-08-10T22:13:02.904748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.764825Z","title":null,"venue":null,"work_id":"c2305457-b2cb-43f3-a551-a8c12b9aee2b","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.044070Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:7d9de209397b06059d2524b0b6b6e815bc1ed53be361e6ec30a561de516d2577","observation_id":"bb8675ab-8c9c-4b48-91ce-fa88e39e2ca1","resolution":{"observed_at":"2026-08-10T22:13:02.788039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.634800Z","title":"The grid is filled up with objects, which you will be asked to recognize and collect, and obstacles, which you should avoid","venue":null,"work_id":"635ab065-7218-4840-b101-42865f11d0f4","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.059180Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:5abd66c504da3514fed5294f794fe776e2592cda87191c6666c6e4ecc5df84e2","observation_id":"f517d880-22c6-4f55-8aad-13066805e3a0","resolution":{"observed_at":"2026-08-10T22:13:02.663678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.538365Z","title":null,"venue":null,"work_id":"b74fee6d-d53d-49f5-9403-c38270b6c4fd","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.063216Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:e0fa662917e24eccfdd89b6d51b4e607978ca8a43867ed1bdfbe82beb35f4464","observation_id":"93957649-5c7b-4775-8d6c-c13322deba03","resolution":{"observed_at":"2026-08-10T22:13:02.569937Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.394739Z","title":"51 Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs? The image shows a a puzzle in a 3 by 3 grid followed by 4 options","venue":null,"work_id":"3b5504f5-4893-4f7c-a75b-baf4463e8a3e","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.086083Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:ecbf18b73eb8c80321d79ba53d2efdbe7cabec3625c1ec24feda08dea7514b28","observation_id":"244b66e0-b917-4c17-9f2c-6a9a29e89968","resolution":{"observed_at":"2026-08-10T22:13:02.435490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.334749Z","title":"… position: Image 1: (1, 0), (0, 2) Image 2: (0, 2), (1, 1) Image 3: (0, 2) This suggests the AND relation","venue":null,"work_id":"388b21b7-3ff0-4f8a-ad16-c49a69d14577","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.125099Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:45d81de511fa163770a8e5eb555347c9036b7f4987a32a4f847155ba97672b13","observation_id":"b3021570-a7b2-4bce-8e26-1ffd20f0dd7f","resolution":{"observed_at":"2026-08-10T22:13:02.378205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.194741Z","title":null,"venue":null,"work_id":"419fac3b-5634-40d4-9bfe-8e5e9c522545","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.146836Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:dbf17a2eff47e2221f94af193a49a191cd0cf14d494fd68401bcebb9b422a3e9","observation_id":"ff24848f-4171-4f07-85ec-70295e6d4e8f","resolution":{"observed_at":"2026-08-10T22:13:02.234271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:02.085504Z","title":"color: Image 1: 189, 135 Image 2: 189 Image 3: 189 This suggests the AND relation","venue":null,"work_id":"7dbb51b0-32c5-4dd7-a21e-3cebad730cda","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.192600Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:b6af17e9535d51c07a8d259a894b95d052380c2e8dbd7bcea6a6206d2b74080b","observation_id":"c6d5e29a-2eca-46f5-a933-a7fba6130d87","resolution":{"observed_at":"2026-08-10T22:13:02.124845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:01.970839Z","title":null,"venue":null,"work_id":"276fcd0a-36ed-428f-8e8c-2f72235d730c","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:01.238326Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:f65094c0f8414763298db8c281d94935f5a6ab85d4dc5f405473ee396f948207","observation_id":"4fd0a3a0-7f46-41c1-b50e-e97941bb5a47","resolution":{"observed_at":"2026-08-10T22:13:02.015722Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-10T22:13:00.234747Z","title":"findings-naacl.62/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.234747Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:7afc2ed237a1e0f7b3cf98cc4c3e57b6e8071026c6bb7b0c0e08fe84151c3736","observation_id":"bde4c299-e96c-446b-bf43-ee2ffed36c6d","resolution":{"observed_at":"2026-08-10T22:13:00.234747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09390","last_updated":"2023-12-14T23:07:33Z","snapshot_observed_at":"2026-08-16T14:34:35.228009Z","submitted_at":"2023-12-14T23:07:33Z","title":"Weak-to-Strong Generalization: Eliciting Strong Capabilities With Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09390","snapshot_observed_at":"2026-08-10T22:13:00.216677Z","title":"emnlp-main.576/","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":576,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.216677Z"},"links":{"cited_paper":"/paper/2312.09390","citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:fb948bbaf17ee7cb1008f322a7ff8498b47ea25f11eafaf5418a82b242b2f92c","observation_id":"a8a3da1c-c5fe-4d93-8c2b-3099b57c98ba","resolution":{"observed_at":"2026-08-10T22:13:00.216677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:04.036006Z","title":"Convert,","venue":null,"work_id":"3b7e16ed-b9a3-4bfe-8813-0e1aea179aa9","year":null},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.544835Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:1afdb6de3802bd81e2cd7dceb5117cb4bd17a7ef8605ad56f7c373d947d418eb","observation_id":"5bc9d72c-a524-41a7-89f5-4345f31dbb77","resolution":{"observed_at":"2026-08-10T22:13:04.074754Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:13:00.299514Z","title":"doi: 10.18653/v1/2023.acl-short.43","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.299514Z"},"links":{"citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:fe0715b33aab4a5d5164513ba8a52c85596a7ee83f02c686380ab70daa4f6eca","observation_id":"9a97e119-ad7e-4962-bab7-09c74feee0eb","resolution":{"observed_at":"2026-08-10T22:13:00.299514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14506","last_updated":"2025-07-17T18:53:04Z","snapshot_observed_at":"2026-08-18T03:58:48.686358Z","submitted_at":"2024-07-19T17:58:36Z","title":"On Pre-training of Multimodal Language Models Customized for Chart Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14506","snapshot_observed_at":"2026-08-10T22:13:00.264753Z","title":"Fan, W.-C., Chen, Y .-C., Liu, M., Yuan, L., and Sigal, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.264753Z"},"links":{"cited_paper":"/paper/2407.14506","citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:c066c11e7b25136643d79f5e33e38080c33dd37ab196582bc57bf548b119cb3a","observation_id":"42a01c31-c3bc-444b-8b05-59224c67ef9c","resolution":{"observed_at":"2026-08-10T22:13:00.264753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T22:13:00.271469Z","title":"Fu, C., Chen, P., Shen, Y ., Qin, Y ., Zhang, M., Lin, X., Qiu, Z., Lin, W., Yang, J., Zheng, X., Li, K., Sun, X., and Ji, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T22:13:00.271469Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.02669"},"observation_digest":"sha256:9cdae9707a4988d3c801d140c041784345298424f6688b1201773485b8d63063","observation_id":"db99015a-11da-4001-9936-ae37af6886cb","resolution":{"observed_at":"2026-08-10T22:13:00.271469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.02669","last_updated":"2025-06-02T16:48:29Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T02:39:26.764194Z","submitted_at":"2025-01-05T21:36:38Z","title":"Generalizing from SIMPLE to HARD Visual Reasoning: Can We Mitigate Modality Imbalance in VLMs?"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 2 inbound Pith citation observations for arXiv:2501.02669."}