{"as_of":"2026-08-09T16:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ceaf860ee822fe99254a356d212f13e15162f64226d2d226e8561136ee305cec","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:24:57.154109Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T10:06:52.822171Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T11:46:55.443273Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"cited_work":{"arxiv_id":"2507.02859","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02859","snapshot_observed_at":"2026-07-02T11:46:55.443273Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","venue":null,"work_id":"7b5389af-b334-45c6-bf94-d199d2cbe855","year":2025},"citing_paper":{"arxiv_id":"2606.05552","last_updated":"2026-06-04T01:06:52Z","snapshot_observed_at":"2026-07-06T23:45:33.157370Z","submitted_at":"2026-06-04T01:06:52Z","title":"Balancing Image Compression and Generation with Bootstrapped Tokenization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T03:07:33.054518Z"},"links":{"cited_paper":"/paper/2507.02859","citing_paper":"/paper/2606.05552"},"observation_digest":"sha256:fcd6bad923553f8e984591aeb2c31154ed9aee091906dc40a61d7502a0438f7a","observation_id":"71c9b1fc-2c69-43b6-8b4d-c87e0865845c","resolution":{"observed_at":"2026-07-02T11:46:55.444845Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02859","snapshot_observed_at":"2026-07-14T10:06:52.822171Z","title":"Bootstrapping grounded chain- of-thought in multimodal LLMs for data-efficient model adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10666","last_updated":"2026-07-12T09:23:05Z","snapshot_observed_at":"2026-08-05T05:23:06.624614Z","submitted_at":"2026-07-12T09:23:05Z","title":"Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T10:06:52.822171Z"},"links":{"cited_paper":"/paper/2507.02859","citing_paper":"/paper/2607.10666"},"observation_digest":"sha256:778cc8ef8dfb9417998c835a86783ce4368a103057963e5ad0beb066770add6a","observation_id":"e9852caa-6d97-453e-b997-8bb10ba5d27c","resolution":{"observed_at":"2026-07-14T10:06:52.822171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02859/citation-record","integrity":"/paper/2507.02859/integrity","json":"/paper/2507.02859/citation-record.json","paper":"/paper/2507.02859"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:56.982611Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:56.982611Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:3c7887876f704cf21547f41c264b83096c0ba58c737867b19d2b69208f7f27e9","observation_id":"dcf504e3-25e2-4fb6-b3f4-b1afc63c03a0","resolution":{"observed_at":"2026-08-06T20:24:56.982611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T20:24:56.987451Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:56.987451Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:67a77f88ed8e6e657d7e939ee71ecdc0bc2704f4b910fe2590046ab56f2045fb","observation_id":"b9b49cf4-48b3-4927-bedb-62f79bc4c293","resolution":{"observed_at":"2026-08-06T20:24:56.987451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-06T20:24:56.992240Z","title":"Train- ing verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:56.992240Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:7d42c3dc877712120045b27c771a9182e41a8111ef4b2d0b54b94c46f07b3af9","observation_id":"fddf9d81-e69c-41bc-8704-d7293b380278","resolution":{"observed_at":"2026-08-06T20:24:56.992240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T20:24:56.997274Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:56.997274Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:83544259810d18ff3063c1d1fd682d1d68e4db6db92b03c4c2274720b9ffc63f","observation_id":"fde16b29-bd6f-49a1-9fc3-c35633c2d7c0","resolution":{"observed_at":"2026-08-06T20:24:56.997274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16483","last_updated":"2023-11-27T15:20:23Z","snapshot_observed_at":"2026-08-06T14:11:19.997270Z","submitted_at":"2023-11-27T15:20:23Z","title":"ChartLlama: A Multimodal LLM for Chart Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16483","snapshot_observed_at":"2026-08-06T20:24:57.001879Z","title":"Chartllama: A mul- timodal llm for chart understanding and generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.001879Z"},"links":{"cited_paper":"/paper/2311.16483","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:7a058ff732fe511ff456a4b7fb43a6718e2592059dfcc27e7e2623cbd95fc6b9","observation_id":"337842db-ae19-48bd-b2cc-4701c88c8015","resolution":{"observed_at":"2026-08-06T20:24:57.001879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.713082Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"dd7ea4ef-c4d9-44bb-a2bb-e844d4ff46b8","year":2021},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.006527Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:2044f4f4d401b681917208f9dc85d2ae8b3f1aa5e425fde58aa2eb9e2a73ae47","observation_id":"c84e23e9-1b37-4075-a4e2-ba347837b1f8","resolution":{"observed_at":"2026-08-06T20:24:57.717781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.010697Z","title":"Icdar2019 compe- tition on scanned receipt ocr and information extraction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.010697Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:7f34a2637f7c551d578e76881d1f389f4e2133924ed97da196285994c0448b6d","observation_id":"89640aa1-16c9-4a21-981c-4d7c069ee456","resolution":{"observed_at":"2026-08-06T20:24:57.010697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.014859Z","title":"Dvqa: Understanding data visualizations via ques- tion answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.014859Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:3af78cad6c602671e52a3815b70f3cfdbdc6278df9d4c97f66c2e7725b1ad478","observation_id":"41ccbb43-9ec3-4e91-bcb1-ccd0d4e2fdf1","resolution":{"observed_at":"2026-08-06T20:24:57.014859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.682650Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"77395f21-1a23-4335-930d-5a5f531bdd08","year":2022},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.019111Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:a7ff6aa33390c243eb57bd74d762b2ef760f5ddac115a385e5105de9e26aa76d","observation_id":"75e04989-60eb-42bd-990c-34ef9714ebcb","resolution":{"observed_at":"2026-08-06T20:24:57.686967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.024113Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.024113Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:34f3834c3494d3175f66e89b68145a4386869a4bc77a8808310abf55e800eb19","observation_id":"9b952664-fbd5-4b9f-b041-c23bd4d6d716","resolution":{"observed_at":"2026-08-06T20:24:57.024113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.028725Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.028725Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:08d938b2ff4257f5dc1ed9fc31a11544701c754959c796c8d100814a67b9e948","observation_id":"70ba3b26-17d3-41d2-8670-94555f69bacc","resolution":{"observed_at":"2026-08-06T20:24:57.028725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.648507Z","title":"Deductive verification of chain-of-thought reasoning","venue":null,"work_id":"23d90704-e658-4d30-baae-36eed5e99a84","year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.033101Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:7176e67af849d6f0e68dd55b76527e51c4091cdd4597150789a96f44598edcaf","observation_id":"e2f59f45-9306-4a10-ae4f-c6dca2908af5","resolution":{"observed_at":"2026-08-06T20:24:57.656097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.634735Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"67ff9baa-4cbb-4af7-8be2-62f7704ba232","year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.037955Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:004ef90fcf7f83fd51971dc8b37161b1deae6dfd7f444f6088808257f7d175d3","observation_id":"eeefdf7a-eee3-4929-9f3c-0eb9cc76fd04","resolution":{"observed_at":"2026-08-06T20:24:57.638991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.042273Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.042273Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:06ea1d4a50a40f976e8d0ac2defbc1493fc95c570eeed0e6f41259a73769516c","observation_id":"f691e5eb-9093-4fec-abe8-181e7349ec9e","resolution":{"observed_at":"2026-08-06T20:24:57.042273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.612826Z","title":"Nltk: The natural language toolkit","venue":null,"work_id":"42e56274-bac7-422e-9909-1eae466c4563","year":2002},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.046456Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:faa73a66aec2cbea43fc1bf70010012335a96cb786ff7b72556ed51726dc4f9c","observation_id":"8d73a0a5-26ab-4176-a6f0-1edefb03280d","resolution":{"observed_at":"2026-08-06T20:24:57.617121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.051035Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.051035Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:b44be9802297c7a435a68c7ee232606e35716e7bc5d3142daeaad96843fd1400","observation_id":"730f94d4-a500-453d-b600-77ff873e777c","resolution":{"observed_at":"2026-08-06T20:24:57.051035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.590560Z","title":"Dynamic prompt learning via policy gradient for semi-structured mathematical reasoning","venue":null,"work_id":"b332ffa3-5e99-4d28-9710-5426f1446199","year":2022},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.055458Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:8c1aae1a7a4fc1dd4e31431bc715f96be7975f73d796e50ec99ec2aea4c25770","observation_id":"f67e04b2-c603-40db-b79a-40384cc05c33","resolution":{"observed_at":"2026-08-06T20:24:57.594983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.576445Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"1fc16c06-3073-4ed4-811d-f81f6383b3be","year":2022},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.060651Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:cef616e10cab42b97d69bd18998c1e9a75c0ff3743122eb6675cb1c58ea941b5","observation_id":"295cb5a7-f4bc-4a59-97ab-171cb26625f2","resolution":{"observed_at":"2026-08-06T20:24:57.580807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04172","last_updated":"2024-11-04T04:59:45Z","snapshot_observed_at":"2026-08-09T02:49:11.422228Z","submitted_at":"2024-07-04T22:16:40Z","title":"ChartGemma: Visual Instruction-tuning for Chart Reasoning in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04172","snapshot_observed_at":"2026-08-06T20:24:57.064925Z","title":"Chartgemma: Vi- sual instruction-tuning for chart reasoning in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.064925Z"},"links":{"cited_paper":"/paper/2407.04172","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:0c9f90a90a6ee99d9f7610e4d417ad103cd97ed4c5216ee316e894556c786345","observation_id":"f3f7c609-a6df-4643-a018-ee3e45b957f7","resolution":{"observed_at":"2026-08-06T20:24:57.064925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02384","last_updated":"2024-02-15T15:34:51Z","snapshot_observed_at":"2026-08-05T02:56:29.376755Z","submitted_at":"2024-01-04T17:51:48Z","title":"ChartAssisstant: A Universal Chart Multimodal Language Model via Chart-to-Table Pre-training and Multitask Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02384","snapshot_observed_at":"2026-08-06T20:24:57.069320Z","title":"Chartassisstant: A universal chart multimodal language model via chart-to-table pre-training and multitask instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.069320Z"},"links":{"cited_paper":"/paper/2401.02384","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:ffaac00da3059d90c1c13242cda7b7e80e57c5e3d495571a993a1ad247ad46ff","observation_id":"196330d8-89f1-494f-bb63-b6a766836d71","resolution":{"observed_at":"2026-08-06T20:24:57.069320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.562221Z","title":"Selfcheck: Using llms to zero-shot check their own step-by-step reason- ing","venue":null,"work_id":"6e57c376-0538-4c6a-9ea4-0707ebd7896f","year":2023},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.073735Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:85f2037eb24d98fa9f89ef6c1b17744c1e8ab8ca0441f0f41ace3dff8b7ab0b4","observation_id":"5684f8a7-b8f4-4511-a2fa-e21875e76203","resolution":{"observed_at":"2026-08-06T20:24:57.567212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.547845Z","title":"Im2text: Describing images using 1 million captioned pho- tographs","venue":null,"work_id":"8dfab597-c729-4e0c-9f6c-3d792de73cb9","year":2011},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.078227Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:5436d58758e91d7f6fef4b26478c5ca38dd7269a476663ffc5ef2dee6434cc12","observation_id":"7c4cc44b-90d6-4fef-946c-a6aa0c2d07da","resolution":{"observed_at":"2026-08-06T20:24:57.552516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.082981Z","title":"Flickr30k entities: Collecting region-to-phrase corre- spondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.082981Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:a99f337c4dc08fec59c50d18ed4aad925876b453238ae0f1804972c8128bfcaf","observation_id":"865f1f13-391c-44c2-8d01-0426461d180b","resolution":{"observed_at":"2026-08-06T20:24:57.082981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.525686Z","title":"Aligning large and small language models via chain-of-thought reasoning","venue":null,"work_id":"eb3c3774-04fd-4f05-8f7b-ff38565a57bd","year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.087259Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:fc4db9648e46185fbd8d18bb1c8459e91c2d79efe4c0046901bbe419191e5bfa","observation_id":"a3bd51e3-7e11-445c-b490-77522bcb375e","resolution":{"observed_at":"2026-08-06T20:24:57.530060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.512200Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":"54552f42-1953-4929-93a6-e29b731c851a","year":2021},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.092576Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:cbead2f049cfb53994f9274415d00a269d4b760f385b8bd3fd7a60d269c2d842","observation_id":"de6b8527-f939-4f29-97c2-c8f351b2d215","resolution":{"observed_at":"2026-08-06T20:24:57.516556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.498742Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models","venue":null,"work_id":"7bf70d01-ef8e-4dd7-87a3-4fe7ca9e283f","year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.096740Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:1d957d74b3d3ccc113efb9c6e65e9ea3e6aadf8caa51463a2d39a3b6f04f9a82","observation_id":"6127810b-2b5a-498c-bfd3-905d4efbf858","resolution":{"observed_at":"2026-08-06T20:24:57.503066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.483550Z","title":"Conceptual captions: A cleaned, hypernymed, im- age alt-text dataset for automatic image captioning","venue":null,"work_id":"d1534583-f037-41f5-b458-3dc9f78494a5","year":2018},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.100783Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:737d847e8a9d08ebd430668ac5f6c646b04e9d401b134f6768db904cc4649260","observation_id":"3bcdec76-d803-4e29-ad25-d2a84edfcd44","resolution":{"observed_at":"2026-08-06T20:24:57.488546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.105148Z","title":"Mome: Mixture of multimodal experts for generalist multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.105148Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:6518128e58b79044a70d62d1509008420c84f2e09da57aad5430f3db2e1e83f6","observation_id":"181ad49c-580b-4edb-9735-fbf457ff94d6","resolution":{"observed_at":"2026-08-06T20:24:57.105148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.109588Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.109588Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:da6f8b33f3145f817e4b70131712c89b326cc44bb06850573f9038b0aad71aed","observation_id":"3e38e282-e2d4-488f-aaf8-06f6ad2db1ce","resolution":{"observed_at":"2026-08-06T20:24:57.109588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12799","last_updated":"2025-03-24T11:30:58Z","snapshot_observed_at":"2026-08-07T16:59:06.662628Z","submitted_at":"2025-03-17T04:07:47Z","title":"Grounded Chain-of-Thought for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12799","snapshot_observed_at":"2026-08-06T20:24:57.113550Z","title":"Grounded chain-of-thought for multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.113550Z"},"links":{"cited_paper":"/paper/2503.12799","citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:ca7012e5126bbecb97b5842a6bb59bd09a38dd0cc1d32f1b6649e51189314d3b","observation_id":"33aafc2c-50ed-4f2a-8985-4d80ee31dcc9","resolution":{"observed_at":"2026-08-06T20:24:57.113550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.117687Z","title":"Visionary-r1: Mitigating shortcuts in vi- sual reasoning with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.117687Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:061ffbdd676ccb509ede8e90bfb405e5bbb59e574235381f1de0816218bc16dc","observation_id":"4be37be1-5449-44a0-a5b5-3afe5f5a0f82","resolution":{"observed_at":"2026-08-06T20:24:57.117687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.451277Z","title":"Falcon: Resolv- ing visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"d254cd61-229f-4ef3-a1fd-9623c2ee6f3d","year":2025},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.121824Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:b3dc0dc71dea357635e07bba9bd55a692bdf27a32a850e512401390ee7ba7135","observation_id":"723aeddf-b3be-4a50-8615-2acb65734afc","resolution":{"observed_at":"2026-08-06T20:24:57.456072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.437529Z","title":"Tat-qa: A question answering benchmark on a hybrid of tab- ular and textual content in finance","venue":null,"work_id":"e3afcaf9-4cdd-44a9-88a4-d8e63fd89e32","year":2021},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.126531Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:7e47d88b3d2d2fbc87d10863e85828248be82189aa1c6c4e6505225d0f501579","observation_id":"8b606a23-4068-4979-ab81-d52df5b795f6","resolution":{"observed_at":"2026-08-06T20:24:57.442042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.423897Z","title":"Visual7w: Grounded question answering in images","venue":null,"work_id":"e39fba7f-b346-44c4-8711-a432ab8c603b","year":2016},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.130597Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:fd03a2d18032e8fff775c463b0145e45f9fff89207cfddcd49a1c5bb1bc401c6","observation_id":"d1ea09ca-e4d5-477a-a6c8-8c56b48f928e","resolution":{"observed_at":"2026-08-06T20:24:57.428003Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.393706Z","title":null,"venue":null,"work_id":"319831fa-9317-4d46-92be-450c42ac28c4","year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.140629Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:869626346b4398dbec61f6da814dfee6b0a967b7e78db40432877f5c328575e4","observation_id":"1be332be-6cf8-4e31-9040-ebfaa80a41a8","resolution":{"observed_at":"2026-08-06T20:24:57.398146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.378865Z","title":null,"venue":null,"work_id":"c0db19e5-490f-4e12-bd1c-5674aecd49a8","year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.145279Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:91fd5b20ae55326bc26b632434a18ddac21f912eff4fea8339514564f2850bb3","observation_id":"83a36de8-3632-41b7-93dc-e3e9ff4fc514","resolution":{"observed_at":"2026-08-06T20:24:57.383742Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.362010Z","title":"The table shows the number of fan letters for each day","venue":null,"work_id":"18d3cc15-83c5-41b5-ad75-7c4ebcb1aa7d","year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.149476Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:fbbad720adcb34032b0d1d08100b6a8024853b34ea85b04c058e05d4bfa0c8ab","observation_id":"dc3c4422-2004-4480-b7f5-4459846cb8a9","resolution":{"observed_at":"2026-08-06T20:24:57.368364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.347050Z","title":"Opening Balance.\\","venue":null,"work_id":"3ef22fa5-a4e6-43c9-90e0-a6571b39b419","year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.154109Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:1d97c642f399d9d92adda1d4c90c173e08621aba51b26fb39442ab01dd0d9b74","observation_id":"c92ee23a-db34-49bb-b932-050b9e5fa0dd","resolution":{"observed_at":"2026-08-06T20:24:57.352221Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:24:57.408947Z","title":"Thus, the total number of fan letters received on Thursday and Monday is: 204 + 271 = 475","venue":null,"work_id":"f0a66026-de63-4e7d-ac82-ebe95d54bdb5","year":null},"citing_paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation","version":1},"reference_index":204,"source":"pdf_text","source_observed_at":"2026-08-06T20:24:57.135943Z"},"links":{"citing_paper":"/paper/2507.02859"},"observation_digest":"sha256:5d41e4655d73ecec174c0f8d97ebaf55ed79d07930f8645e93f0a155b6a72e56","observation_id":"bb02a9a4-8ac3-4115-bb41-4aa687633838","resolution":{"observed_at":"2026-08-06T20:24:57.413154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02859","last_updated":"2025-07-03T17:59:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T20:16:51.742319Z","submitted_at":"2025-07-03T17:59:29Z","title":"Bootstrapping Grounded Chain-of-Thought in Multimodal LLMs for Data-Efficient Model Adaptation"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 2 inbound Pith citation observations for arXiv:2507.02859."}