{"as_of":"2026-08-05T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:695c72a584a77578f1909205674d6ba32b6e1afe1c0e22f4e844f2bf27867096","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:08:22.631516Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T06:08:19.928596Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.22013","snapshot_observed_at":"2026-08-01T06:08:19.928596Z","title":"A natural approach is to leverage multimodal large language models (MLLMs) [1, 2] to enable CoT","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:19.928596Z"},"links":{"cited_paper":"/paper/2607.22013","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:dc66009b8243d0b4132dd675ca1dd6601464b601235068995e0a11dddb351302","observation_id":"572dfe5e-3e16-494d-8acc-a9815007995b","resolution":{"observed_at":"2026-08-01T06:08:19.928596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.22013/citation-record","integrity":"/paper/2607.22013/integrity","json":"/paper/2607.22013/citation-record.json","paper":"/paper/2607.22013"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.22013","snapshot_observed_at":"2026-08-01T06:08:19.928596Z","title":"A natural approach is to leverage multimodal large language models (MLLMs) [1, 2] to enable CoT","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:19.928596Z"},"links":{"cited_paper":"/paper/2607.22013","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:dc66009b8243d0b4132dd675ca1dd6601464b601235068995e0a11dddb351302","observation_id":"572dfe5e-3e16-494d-8acc-a9815007995b","resolution":{"observed_at":"2026-08-01T06:08:19.928596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.198809Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.198809Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:33ba78b0e92ea1b23449a4b449d8de67f57d60045705450e3f2ec6698aae9d5c","observation_id":"bf720631-acfe-444d-87f2-30a7480b2c1b","resolution":{"observed_at":"2026-08-01T06:08:20.198809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.311163Z","title":"Experiments Settings Dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.311163Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:79f4969966930bfaf42e8aab7444957a372557c36f29fce818df4eee2d8af918","observation_id":"af4ddf06-7860-4887-9d81-91297cb5a3a7","resolution":{"observed_at":"2026-08-01T06:08:20.311163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.727904Z","title":"Existing methods often blur tiny cross-modal cues","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.727904Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:55495add375aff134e7da442548b0621e3ac61d8c38d66d16f3834471ac104a0","observation_id":"a3f7c85f-0fd3-48f5-a645-97c253b8a848","resolution":{"observed_at":"2026-08-01T06:08:20.727904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.487322Z","title":"Hyperparametersαandβwere 0.1 and 0.2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.487322Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:1f710f1d9b0b36aec2030d31b96eebc02cfa31be03fcdf6e597ad155d826ac63","observation_id":"7aafa06f-d25c-4d6d-b9ed-4123f11dfd77","resolution":{"observed_at":"2026-08-01T06:08:20.487322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.478404Z","title":"Joint multimodal entity-relation extraction based on edge- enhanced graph alignment network and word-pair rela- tion tagging,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.478404Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:79003f8efc58d0d33ca790d081a997c75cecfdb1fc2c0463b1d440d3f00505a0","observation_id":"26f5203e-888a-40b7-8469-4ed0cbe47298","resolution":{"observed_at":"2026-08-01T06:08:21.478404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.891583Z","title":"61966038 and 62266051, and the Postgraduate Research and Innovation Foundation of Yunnan University under Grant No.KC-252513133","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.891583Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:7999755e1f17e7e2373724160d5900d17d351cd4726fbfaa2ee8f48a022ccf42","observation_id":"6cec807d-f14e-4ae5-b327-0d8017c0d173","resolution":{"observed_at":"2026-08-01T06:08:20.891583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-01T06:08:21.020971Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.020971Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:721875e6bf81b07fb9d67d40beb8fd5e53802d6c5108008946cbc5419619c907","observation_id":"05c685ae-b72b-4f81-a279-915143eb7f4d","resolution":{"observed_at":"2026-08-01T06:08:21.020971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.179902Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.179902Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:7dc406452af126edb1c2953073eb67d4b9c136a690ed20071b80915b09989f15","observation_id":"4473e0c0-249e-4700-9d3d-2a9c925875b7","resolution":{"observed_at":"2026-08-01T06:08:21.179902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:20.063892Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:20.063892Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:bd3b31a74dd38c438798ae17c0e6565b0ad80c6f294c3af3a5c9310b548feaa7","observation_id":"ce604d35-73c2-4938-8a38-085c05f2c630","resolution":{"observed_at":"2026-08-01T06:08:20.063892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-07-06T14:47:34.480641Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-01T06:08:21.271702Z","title":"Multimodal chain- of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.271702Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:b9599f4722ae3c50d1bfae4f5351a67feda8815271fe6a86e58d95b85f9dd84b","observation_id":"5780e02f-3a99-4197-8e69-19c607a59e3c","resolution":{"observed_at":"2026-08-01T06:08:21.271702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.355410Z","title":"Boosting the power of small multimodal reason- ing models to match larger models with self-consistency training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.355410Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:b01ac22c4e5407d9d4f9efdb25b99fdb7c8ebd47257996b6b0efd0481dc42a4e","observation_id":"2a635ebe-4c11-456f-8467-c5d86fc0f527","resolution":{"observed_at":"2026-08-01T06:08:21.355410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.408899Z","title":"Vision-aware Multimodal Prompt Tuning for Uploadable Multi-source Few-shot Domain Adaptation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.408899Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:af818d4dd5b110ca47d8de66801edfbe1866b02d7cee6f8c234c916e54ebedc8","observation_id":"e07f9f1d-e045-476a-bfe1-e1187881bd0c","resolution":{"observed_at":"2026-08-01T06:08:21.408899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.567687Z","title":"Enhancing semantics in multimodal chain of thought via soft negative sampling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.567687Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:243ce2002863d40424ab357a506a47c0247bb91914b81c5b2558b394269408c9","observation_id":"80c5a806-f999-40e2-880f-2d9a7e8617d5","resolution":{"observed_at":"2026-08-01T06:08:21.567687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.638785Z","title":"Enhancing human-like multimodal reasoning: a new challenging dataset and comprehensive frame- work,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.638785Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:228b1aed57552ca94c08aa71ba823c7c529580a763081f0ecf8ed3a9cf11a272","observation_id":"9604640a-1b92-4aad-8055-c052569babd8","resolution":{"observed_at":"2026-08-01T06:08:21.638785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.733047Z","title":"Learn to explain: Multimodal rea- soning via thought chains for science question answer- ing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.733047Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:43fc986b4558fcaff3cab4605e27613adaf2a7dc6ebd4f5f0cd296e0558f497f","observation_id":"2243f7c4-c996-46b4-9ddc-09930bbadad1","resolution":{"observed_at":"2026-08-01T06:08:21.733047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.795830Z","title":"M 3cot: A novel bench- mark for multi-domain multi-step multi-modal chain-of- thought,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.795830Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:6153f7dd5e5521b62ab7c5443e5c736392dc1e67bb62695fa44e19cdf298922f","observation_id":"ea741cca-4a97-44d7-9790-beda0cfcf815","resolution":{"observed_at":"2026-08-01T06:08:21.795830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00700","last_updated":"2020-10-07T03:12:45Z","snapshot_observed_at":"2026-08-04T00:04:27.463644Z","submitted_at":"2020-05-02T04:42:14Z","title":"UnifiedQA: Crossing Format Boundaries With a Single QA System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00700","snapshot_observed_at":"2026-08-01T06:08:21.860620Z","title":"Unifiedqa: Crossing format boundaries with a single qa system,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.860620Z"},"links":{"cited_paper":"/paper/2005.00700","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:6abced714d1577a93d355e9c7787691e81f2eccc42d1130d525d1bd766ab36bd","observation_id":"244eeeca-a03c-4d74-9700-f779a3922c41","resolution":{"observed_at":"2026-08-01T06:08:21.860620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:21.993735Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:21.993735Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:53704b75f971845051238176feedadac85f6ab0ebd0709da635dbbff582b1396","observation_id":"c45c1e88-c51d-40a4-a3ee-fc9f0ac27808","resolution":{"observed_at":"2026-08-01T06:08:21.993735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04671","last_updated":"2023-03-08T15:50:02Z","snapshot_observed_at":"2026-07-06T15:00:13.368355Z","submitted_at":"2023-03-08T15:50:02Z","title":"Visual ChatGPT: Talking, Drawing and Editing with Visual Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04671","snapshot_observed_at":"2026-08-01T06:08:22.141248Z","title":"Visual chat- gpt: Talking, drawing and editing with visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.141248Z"},"links":{"cited_paper":"/paper/2303.04671","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:da0a670ec642db6125f0d1d9f8b8a4308b9010f9994a6781de2cebf8043a5f6c","observation_id":"bd4a26c1-2b41-499d-88cb-640293d72da2","resolution":{"observed_at":"2026-08-01T06:08:22.141248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14985","last_updated":"2026-06-18T04:46:43Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:19:57Z","title":"IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14985","snapshot_observed_at":"2026-08-01T06:08:22.246100Z","title":"Idealgpt: Iteratively decomposing vision and language reasoning via large language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.246100Z"},"links":{"cited_paper":"/paper/2305.14985","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:49764ffafac39e31ca26168cedf8e4274a0f0b09aaf9635eee0a73a79383a474","observation_id":"3a77c7c5-ada7-437b-91a1-9d8aa1a48739","resolution":{"observed_at":"2026-08-01T06:08:22.246100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16199","snapshot_observed_at":"2026-08-01T06:08:22.347900Z","title":"Llama-adapter: Efficient fine-tuning of language models with zero-init attention,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.347900Z"},"links":{"cited_paper":"/paper/2303.16199","citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:697ed75e9b055801d33f5666696c2796d6c2c9d578c52de5c11dd7a2718af8bd","observation_id":"959dd084-546c-4c63-8354-82e9659ea67d","resolution":{"observed_at":"2026-08-01T06:08:22.347900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:22.497615Z","title":"Cheap and quick: Ef- ficient vision-language instruction tuning for large lan- guage models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.497615Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:ebac2dc9e11e052160174f00f0d64ba86967fdc77eb13167f0764b1c58d49600","observation_id":"d06f4b06-904b-40ba-835e-e0e2ea92bff7","resolution":{"observed_at":"2026-08-01T06:08:22.497615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T06:08:22.631516Z","title":"Ddcot: Duty-distinct chain-of-thought prompting for multimodal reasoning in language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T06:08:22.631516Z"},"links":{"citing_paper":"/paper/2607.22013"},"observation_digest":"sha256:05c88017d130b4d415a9d7ad3e9f502b8b208fad378ef79425516409f7945648","observation_id":"23698837-a64a-4597-b497-e49a11a5adb9","resolution":{"observed_at":"2026-08-01T06:08:22.631516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22013","last_updated":"2026-07-24T06:22:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T21:37:11.623961Z","submitted_at":"2026-07-24T06:22:40Z","title":"Visual Saliency Steering Distillation for Multimodal Chain-of-Thought Reasoning"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 1 inbound Pith citation observation for arXiv:2607.22013."}