{"as_of":"2026-08-09T07:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a94c985aab13505965ebbebb6adfa4288155978928017360aed0c589f5d8b3f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T22:13:55.098153Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-19T17:30:08.755545Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T17:32:41.699954Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"cited_work":{"arxiv_id":"2511.11440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.11440","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From synthetic scenes to real performance: Enhancing spatial reasoning in vlms","venue":null,"work_id":"24dc9c9e-bfd8-488e-8d7f-06b78e1be04f","year":2026},"citing_paper":{"arxiv_id":"2604.02812","last_updated":"2026-05-15T14:52:29Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:27:33Z","title":"Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T20:11:58.423612Z"},"links":{"cited_paper":"/paper/2511.11440","citing_paper":"/paper/2604.02812"},"observation_digest":"sha256:aae969e82080136acdd5e82ace06988d086bb67c05f249a169ed02698cf27e9f","observation_id":"e33b6d2c-f801-402b-be1b-d0f5f2b55709","resolution":{"observed_at":"2026-06-01T02:03:29.524259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"cited_work":{"arxiv_id":"2511.11440","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2511.11440","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From synthetic scenes to real performance: Enhancing spatial reasoning in vlms","venue":null,"work_id":"24dc9c9e-bfd8-488e-8d7f-06b78e1be04f","year":2026},"citing_paper":{"arxiv_id":"2604.02812","last_updated":"2026-05-15T14:52:29Z","snapshot_observed_at":"2026-07-06T22:52:06.460027Z","submitted_at":"2026-04-03T07:27:33Z","title":"Learning Structured Robot Policies from Vision-Language Models via Synthetic Neuro-Symbolic Supervision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T17:30:08.755545Z"},"links":{"cited_paper":"/paper/2511.11440","citing_paper":"/paper/2604.02812"},"observation_digest":"sha256:908ff138c595407f3ff199333cddfae3732c9ded6093622005e23933dabf9d45","observation_id":"d2dfba28-d0b1-4370-91e8-61f472f0de65","resolution":{"observed_at":"2026-06-01T02:03:29.524259Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2511.11440/citation-record","integrity":"/paper/2511.11440/integrity","json":"/paper/2511.11440/citation-record.json","paper":"/paper/2511.11440"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.149980Z","title":"Tal- lyqa: Answering complex counting questions.Proceedings of the AAAI Conference on Artificial Intelligence, 33(01): 8076–8084, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.149980Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:e22695ac73141e9776424b035d9dda87577c51b0a315031b97ec18238a63614b","observation_id":"d4ab86c6-7d9d-4d2d-ae2c-e476fbd476f0","resolution":{"observed_at":"2026-08-03T22:13:49.149980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.234976Z","title":"Lipton, and J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.234976Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:f03a5c5e1b061d2777bf51fac3ed406891542d88bc3348d75a5483b4c55a450c","observation_id":"02582e5a-e4c4-4345-8d4d-49ae9230a62f","resolution":{"observed_at":"2026-08-03T22:13:49.234976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.329477Z","title":"[De|Re] constructing VLMs’ Reasoning in Counting.arXiv preprint arXiv:2510.19555, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.329477Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:673e72601f634230030523df10c8dd7738bec318d458068df587bd2aca900b90","observation_id":"d8004afa-709a-4d7a-95a9-ef2437d2b00d","resolution":{"observed_at":"2026-08-03T22:13:49.329477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.423186Z","title":"Spatialvlm: Endow- ing vision-language models with spatial reasoning capabili- ties","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.423186Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:3be016ce289f79c5cc238a6b28d367feeaf0853a85de4820b9ed745414794ca4","observation_id":"49d98304-ba6b-42da-b096-ce0bf554b8db","resolution":{"observed_at":"2026-08-03T22:13:49.423186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.510602Z","title":"Are we on the right way for eval- uating large vision-language models? InAdvances in Neural Information Processing Systems, pages 27056–27087","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.510602Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:da04a048429719e14fe8ad768c8276f3899782c6864d5f831ff37a3ecb101dc1","observation_id":"98a921ef-9889-4a38-b3c0-64dc3ac7e5dd","resolution":{"observed_at":"2026-08-03T22:13:49.510602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.593203Z","title":"Why is spatial reasoning hard for VLMs? an attention mechanism perspective on focus ar- eas","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.593203Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:3f60c89616eeaf71804ae889c81b859cbf40c4e4bb434fa3cd5a0e4be1dc613b","observation_id":"f004d32a-cb71-43e4-a4a2-45c22632dcb3","resolution":{"observed_at":"2026-08-03T22:13:49.593203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.659507Z","title":"From the least to the most: Building a plug-and-play visual rea- soner via data synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.659507Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:ff8a3c70e76511552efce0af20c5bd7890bab31b8b33c274a677065955af2461","observation_id":"30066842-c3b4-4b25-bd38-658ca3442d4f","resolution":{"observed_at":"2026-08-03T22:13:49.659507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.740903Z","title":"Smith, Hannaneh Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.740903Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:257a8bf199a5390e1fa8f67c184b4e30b7aedc2cbe68245f3764344036b58dab","observation_id":"4a4601bb-0f81-46f6-9a32-b047c6c3691f","resolution":{"observed_at":"2026-08-03T22:13:49.740903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.836972Z","title":"If CLIP could talk: Understanding vision-language model representations through their preferred concept descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.836972Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:221709a643858632d6f1c64243c3ebedf581cc9ed87efa79a9f2db9952de31ea","observation_id":"3614751c-62b0-4bd3-a8d4-47687692475d","resolution":{"observed_at":"2026-08-03T22:13:49.836972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:49.927559Z","title":"Hidden in plain sight: VLMs overlook their visual rep- resentations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:49.927559Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:a1a719aa6d6cbcedcd35f8bf0ff6df183bd596acb4ddd9d93ab6ff70e20575f2","observation_id":"720e2419-d17d-4c04-81da-ba5ae9c6d8a4","resolution":{"observed_at":"2026-08-03T22:13:49.927559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.015009Z","title":"Generate then select: Open- ended visual question answering guided by world knowl- edge","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.015009Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:012aef33158c31cfdfc8b6777f9e6622b6a3876f8fbe5dc1563e8f197d8313e3","observation_id":"1d3aaa6a-42b4-40a8-9de3-9b207f987cde","resolution":{"observed_at":"2026-08-03T22:13:50.015009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.152594Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.152594Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:fa4772d540a399d288254c0e943ac6e654c479064560b87ab936f5381e54aafd","observation_id":"316e89e8-cee1-4927-b25c-92c6f6e17315","resolution":{"observed_at":"2026-08-03T22:13:50.152594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.252377Z","title":"G-LLaV A: Solving geometric problem with multi-modal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.252377Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:8913f6df9a83021c124f0aa3a2361d40a18f2cd7cce16418f83fb72350000c11","observation_id":"36a480b3-ba6c-4c06-a795-96bf70deea0c","resolution":{"observed_at":"2026-08-03T22:13:50.252377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.436120Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.436120Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:d37a5b20efd8c7e490cd0069bbb1f905281d1f034d4e7617ff14c43c3325cada","observation_id":"b28128d8-eb77-4543-8002-e1fe438d4e46","resolution":{"observed_at":"2026-08-03T22:13:50.436120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.555884Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.555884Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:9e191196d7673202803de95720e0349fb70b28085189cd7b5704e0b91af1fd7e","observation_id":"50907dbb-5bb4-4fe5-bb17-07054a6f47a1","resolution":{"observed_at":"2026-08-03T22:13:50.555884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.749285Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.749285Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:b1921b91f8487dfbcb7c7148dd16be87481a0a764e3bc60f08af97d5ac96f28c","observation_id":"6b00ee62-87f2-425e-bd20-bfb794e9f350","resolution":{"observed_at":"2026-08-03T22:13:50.749285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.897442Z","title":"What’s “up” with vision-language models? investigating their strug- gle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.897442Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:f60cf37bb2262a9b7e1ae9908cd761eacb22c8eab849f1b49aaea74b91ce4bf6","observation_id":"d022c669-b391-4b87-8b80-135ee6f0122f","resolution":{"observed_at":"2026-08-03T22:13:50.897442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:51.059982Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:51.059982Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:c73f244061410f64fdd58dcbde97d27ab818ed21bc7ac4fd71c298fcc370e200","observation_id":"e628b165-32cd-4c05-ad72-fb8f4a817859","resolution":{"observed_at":"2026-08-03T22:13:51.059982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:51.225520Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:51.225520Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:5ea1ba2e214a736d7f617e54c85607649f2a921ea2305c78f8b5210a2c5ed1fa","observation_id":"8020ff24-bcb4-46d0-8df2-9d2043873a1f","resolution":{"observed_at":"2026-08-03T22:13:51.225520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:51.406864Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123(1):32–73, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:51.406864Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:ecfbcf49ba9d08f6fde5c89ab9a834642c985aa21a627e40a70d4e070386d739","observation_id":"a0e4f4e4-b149-4afb-9da9-a5d6349e233e","resolution":{"observed_at":"2026-08-03T22:13:51.406864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:51.611263Z","title":"Enhancing vision-language com- positional understanding with multimodal synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:51.611263Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:f74ed9f91f93a2d1188564efcdf91a9514a64122c96bfa26c4508c2e5c792683","observation_id":"b953bb44-b564-4225-8daa-40dc5e8694a2","resolution":{"observed_at":"2026-08-03T22:13:51.611263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:51.817401Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:51.817401Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:405f03104b80fda794c459df5b494707b3b81103b5a998e3dbc46a591300d290","observation_id":"17be5194-a0bf-4c10-97c9-e21c76d84c96","resolution":{"observed_at":"2026-08-03T22:13:51.817401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:52.176932Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.176932Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:683a0243b46cd397bb04bc9924398d06fc0baaa0ad5e082905c082c8900ae195","observation_id":"e780ebc2-2924-40b3-87b8-7aec16baef4a","resolution":{"observed_at":"2026-08-03T22:13:52.176932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23120","last_updated":"2025-06-29T06:58:08Z","snapshot_observed_at":"2026-08-06T23:48:48.503046Z","submitted_at":"2025-06-29T06:58:08Z","title":"Enhancing Spatial Reasoning in Multimodal Large Language Models through Reasoning-based Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23120","snapshot_observed_at":"2026-08-03T22:13:52.383043Z","title":"Enhanc- ing spatial reasoning in multimodal large language mod- els through reasoning-based segmentation.arXiv preprint arXiv:2506.23120, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.383043Z"},"links":{"cited_paper":"/paper/2506.23120","citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:ab5e80b154415d045e37ef9f6329f55ea55c91cf0d75ad2c4ec48ceed787881b","observation_id":"ba066641-729c-4b3d-b6c6-854f6ebf7940","resolution":{"observed_at":"2026-08-03T22:13:52.383043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:52.530421Z","title":"SpaRE: Enhancing spatial reasoning in vision-language models with synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.530421Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:94cfdeec8ec8bfedfc48d499d8df85be3162e01ade82853bd323d9b42bf7c3fa","observation_id":"bef716b4-6525-473c-848e-9e9c7f6afce5","resolution":{"observed_at":"2026-08-03T22:13:52.530421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:52.658358Z","title":"Teaching clip to count to ten","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.658358Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:005f6021d799d401cab45c2fac633ac6298b1082fe3e03fe9775c30ce153db4a","observation_id":"62a8903a-3fed-4c1e-a9a8-2600dd6c57ac","resolution":{"observed_at":"2026-08-03T22:13:52.658358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:52.835484Z","title":"Synthetic visual genome","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.835484Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:6a0f4efa6e0242da8eb3d2bb057a7c81cad15578d7fa67ceb7b9dfb7703f63b4","observation_id":"609479cc-f72d-45d8-91d8-50c20945268e","resolution":{"observed_at":"2026-08-03T22:13:52.835484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:52.981256Z","title":"Synthesize diagnose and optimize: Towards fine- grained vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:52.981256Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:dd4ede31a84b6f9cd75dde7af4607d4834248cd5e555c330ea88b3495573914a","observation_id":"ddea47cf-f4be-4333-b97e-6c8581d64af2","resolution":{"observed_at":"2026-08-03T22:13:52.981256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:53.112551Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:53.112551Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:906ecc2d26ed0debfcb26dab83e1971d1c1e2c9370bfc1f531cc35145a319ab1","observation_id":"f79ce9f0-e1da-4f9b-8dd0-f6c83610665d","resolution":{"observed_at":"2026-08-03T22:13:53.112551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:53.306094Z","title":"Vision language models are blind","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:53.306094Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:2c31ef1154da74396b389133202441e43ed55fc1fcca2ea61a57ad6a3a8d69ea","observation_id":"dd9b9521-04ab-4880-bf3a-be1bf17acade","resolution":{"observed_at":"2026-08-03T22:13:53.306094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:53.436110Z","title":"CIVET: Systematic evaluation of understanding in VLMs","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:53.436110Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:7dd891ebf5b3f8b73a52975165dbfe838f01b3423f63d7509330314762bd6fa7","observation_id":"0b0c52f2-e188-4d1e-a71f-cdba2dedfb01","resolution":{"observed_at":"2026-08-03T22:13:53.436110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:53.674610Z","title":"Sophia Koepke, Oriol Vinyals, Cordelia Schmid, and Zeynep Akata","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:53.674610Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:db6a2a038772dd3dec4b38a233ad9d42edfbce1d48f91e82b0158ef027bf5986","observation_id":"6bfbbfa6-8cf2-4054-aaf3-1c3f674bef12","resolution":{"observed_at":"2026-08-03T22:13:53.674610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:53.825355Z","title":"Forgotten polygons: Multimodal large language models are shape-blind","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:53.825355Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:02ada15a5573bcd9c162596034e05188851e944d923ef817fcda88890a8be003","observation_id":"1ef3f6a8-c342-4a3c-a0c4-6caabc9abc86","resolution":{"observed_at":"2026-08-03T22:13:53.825355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:53.981048Z","title":"Laion- 400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:53.981048Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:9e814ee66b00afe495e1ebedf87cd28792080834975302e2469b983f5ce57f6a","observation_id":"11b07d57-5378-45c0-a173-ce0891d4e4f8","resolution":{"observed_at":"2026-08-03T22:13:53.981048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:54.116549Z","title":"Math- LLaV A: Bootstrapping mathematical reasoning for multi- modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.116549Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:27d8290029d65f137a7ddd21d215ad8d0f1d7057dcaa4aa5feb71f343b8d456f","observation_id":"2320c487-df7c-4cba-8142-bdcacd3e7bf0","resolution":{"observed_at":"2026-08-03T22:13:54.116549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T22:13:54.235480Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.235480Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:9e0b092e28480800cd1b7d34773f2a8fa6522b57d10035d1e13aed4ff1363056","observation_id":"fa8f5cd4-3ebe-4dc0-9ad2-8ed6915c1028","resolution":{"observed_at":"2026-08-03T22:13:54.235480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:54.405053Z","title":"Embodied scene understanding for vi- sion language models via metavqa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.405053Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:1312fdb37ced67f5f911da46533abd5a3e32d3d4e51248fb48ced96e38860046","observation_id":"dd8d48ed-3b35-4882-8a1a-5e3afcabb0ed","resolution":{"observed_at":"2026-08-03T22:13:54.405053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:54.522472Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.522472Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:e0d56f91e3cf792c0f8fdb73e67b1ecafe2196e6ef0fbbda400ed93b25b5bb19","observation_id":"adfc1cb8-958f-414f-b870-2f35faf6af75","resolution":{"observed_at":"2026-08-03T22:13:54.522472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:54.693069Z","title":"When and why vision- language models behave like bags-of-words, and what to 10 do about it? InThe Eleventh International Conference on Learning Representations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.693069Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:e0acfd9e2ac9cbe4f3801571749969f1a1a7616f2e267b9b841e85c21af6b21a","observation_id":"e9166c7c-6580-4753-9070-f4263085a136","resolution":{"observed_at":"2026-08-03T22:13:54.693069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:54.847296Z","title":"Mathverse: Does your multi-modal llm truly see the diagrams in visual math problems? InComputer Vision – ECCV 2024, pages 169–186, Cham, 2025","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.847296Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:fa511a31e26bfa35c9890855f94b94004f168bedb92f20d0b0df7cd92a129854","observation_id":"7713cc03-3acf-4d1e-8f2b-5bcdba030cfd","resolution":{"observed_at":"2026-08-03T22:13:54.847296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:54.971591Z","title":"MA VIS: Mathe- matical visual instruction tuning with an automatic data en- gine","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:54.971591Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:9aa3e6402a3ae63e3d17288f0aeba0b0c2f899f054bd51f562dc527ac2502ffc","observation_id":"a109cb86-f302-4c3b-ac49-bc49a1cf02c6","resolution":{"observed_at":"2026-08-03T22:13:54.971591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:55.098153Z","title":"Answer with as few words as possible","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:55.098153Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:5fb59e8b76a46445e4cb78fd8585ad10f5de75a3a10f56945486d3c691458c37","observation_id":"fe6a5bae-47e9-4d1d-bcec-172479e0bff2","resolution":{"observed_at":"2026-08-03T22:13:55.098153Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:51.992417Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:51.992417Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:6e9fc9799045e735b43c2d2384cd637a8f83b90e6791a8cfce238eaf860ef344","observation_id":"265d6237-4a9f-4d49-b397-06d07528c0ee","resolution":{"observed_at":"2026-08-03T22:13:51.992417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T22:13:50.082887Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T22:13:50.082887Z"},"links":{"citing_paper":"/paper/2511.11440"},"observation_digest":"sha256:4855c73de551afcb76da4f79bbb5b4f244d6221b81f1b8033c7b9d5f51440918","observation_id":"3f922e3a-e195-4d6e-baec-54f102dbca45","resolution":{"observed_at":"2026-08-03T22:13:50.082887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.11440","last_updated":"2026-05-29T13:40:10Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T22:13:48.348551Z","submitted_at":"2025-11-14T16:07:18Z","title":"Synthetic Stimuli, Real Gains: Rethinking VLM Fine-Tuning Through Fully Controlled Data Generation"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2511.11440."}