{"as_of":"2026-08-11T03:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:65c0b41225cf30623b5523537530cc6967cac741ddaea3cc37098aa211366c7b","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T07:12:16.623769Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2604.16943/citation-record","integrity":"/paper/2604.16943/integrity","json":"/paper/2604.16943/citation-record.json","paper":"/paper/2604.16943"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"df46da19-2ae5-42ca-ad53-ad39423a1ec2","year":2023},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:7dd9c6e8f79ddedddecd67d8cdb6c4c3974f0afcc90b809a028398336a174b11","observation_id":"eaa92d63-5fb4-48e9-b6ff-2cb55a721c12","resolution":{"observed_at":"2026-05-21T14:20:14.945477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal large language models: A survey","venue":null,"work_id":"7b8052a7-9b33-4147-9458-a451f6e51ce3","year":2023},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:81a8b5a3e9b1355b2d19f64aee16b81034471aec25eaf7ead04a7f76715f970a","observation_id":"573b71ee-ea35-48bb-b188-0c73dde5c942","resolution":{"observed_at":"2026-05-21T14:20:14.937021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.13601","last_updated":"2024-05-28T05:36:23Z","snapshot_observed_at":"2026-08-10T21:32:36.140961Z","submitted_at":"2024-01-24T17:10:45Z","title":"MM-LLMs: Recent Advances in MultiModal Large Language Models","version":5},"cited_work":{"arxiv_id":"2401.13601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.13601","snapshot_observed_at":"2026-07-04T15:09:55.103963Z","title":"Mm-llms: Recent ad- vances in multimodal large language models","venue":null,"work_id":"4c35990c-f0e6-4be5-bdd6-e77e3eaddf23","year":2024},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2401.13601","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:afc05f0b7ed0655510d2aa9e412f2da5f68bb174d9356dbb5668e0bc9d16fa7e","observation_id":"b6e6431c-2e2f-4f34-96c3-f18df788a4f5","resolution":{"observed_at":"2026-05-10T09:23:37.427461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17415","last_updated":"2023-06-02T12:38:37Z","snapshot_observed_at":"2026-07-06T15:34:16.800916Z","submitted_at":"2023-05-27T08:41:18Z","title":"Exploring Better Text Image Translation with Multimodal Codebook","version":2},"cited_work":{"arxiv_id":"2305.17415","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.17415","snapshot_observed_at":"2026-07-04T16:09:57.591468Z","title":"Exploring better text image translation with multimodal codebook","venue":null,"work_id":"6ac16f21-2154-4138-9d93-39c2343bae46","year":2023},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2305.17415","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:23b3d03acc870e21c2b547974f9c5439630b222252cb8342ab3c37690ca6c67b","observation_id":"661aa85c-4f25-4c2d-99f3-15deae39d0c1","resolution":{"observed_at":"2026-05-10T09:23:37.446018Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic detection and translation of text from natural scenes","venue":null,"work_id":"1437460c-4a9a-4d5d-8d3e-53bd5b704634","year":2002},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:b6190ee12d0e7cb9635c64c11a457489ca10e9df998ae9d1e751e631d79c4bbb","observation_id":"1b734d92-fc0f-44c2-8006-7c00ed20208e","resolution":{"observed_at":"2026-05-21T14:20:14.940192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Translatotron-V(ison): An end-to-end model for in-image machine translation","venue":null,"work_id":"1819e26b-00ca-40a1-b278-9f905444ef49","year":2024},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:f0551d2b00b22d7dd56abe7ce3e01fea732f9463b6ebec825c561f89d0a71511","observation_id":"34170d40-a9b7-4438-9860-d6099cb9d404","resolution":{"observed_at":"2026-05-21T14:20:14.948906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.10648","last_updated":"2020-10-20T22:20:04Z","snapshot_observed_at":"2026-08-07T10:29:57.965261Z","submitted_at":"2020-10-20T22:20:04Z","title":"Towards End-to-End In-Image Neural Machine Translation","version":1},"cited_work":{"arxiv_id":"2010.10648","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.10648","snapshot_observed_at":"2026-06-30T13:34:40.286016Z","title":"Towards end-to-end in-image neural machine translation","venue":null,"work_id":"5d8bbb85-6eb6-4c2c-a022-22cc5a3fcd89","year":2020},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2010.10648","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:fe819cd002e8167684f6b27f9cb9628c865b00fed646cd26d5331ee314274357","observation_id":"055d1fbc-3956-47dd-b87c-4c24aef14ad0","resolution":{"observed_at":"2026-05-10T09:23:37.436049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Image translation network","venue":null,"work_id":"8c718a7c-3023-4c22-9154-30345003e233","year":2021},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:c91e509d84f4f378d887b4c0d62f684f02be7fa3a4eb26205936d6e84e1fdbe0","observation_id":"df6614d4-c203-44fe-81d3-ebd20c87eef5","resolution":{"observed_at":"2026-05-21T14:20:14.952037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:52a6f4252ed6ccd4da667e3fdac08daed6b1a4f7806675e14008c6e206ec4b7f","observation_id":"0907ac0e-8eed-457c-8f03-42856b00a036","resolution":{"observed_at":"2026-05-10T12:48:40.999279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:fe9cf117b18035d24a5bffcfa17527cd47537661a9c0ba7fec8919f54bfcec0b","observation_id":"f13d4557-bb29-4696-8f52-8c33e522407a","resolution":{"observed_at":"2026-05-10T21:07:32.698795Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:2a8758c48860478af67e8a131b8a50765cabcf659dabc5c7c60595bc45b7bef9","observation_id":"64cdb28d-b052-4988-9eeb-bff080f4ade8","resolution":{"observed_at":"2026-05-10T09:23:37.439386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-10T07:52:08.606999Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:cfa90c6ed4cbfc1af132911fa4d9a95c4ae8059d6935afde03013b5fc28aa889","observation_id":"de19b0ad-7ace-4d58-9469-e0103037757e","resolution":{"observed_at":"2026-05-10T21:14:13.786069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-08-10T01:52:30.559515Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":"2308.08747","doi":"10.48550/arxiv.2308.08747","metadata_source":"pith","pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","venue":"cs.CL","work_id":"3e52a549-8994-4fc0-921b-ae16d32f1acc","year":2023},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:89deae5f442c6f2dcaf492aae18c06b0e991a1c45ced7d2a63cfd5c51b261cf0","observation_id":"0cea1666-a462-4ebe-81ca-c49d979914e4","resolution":{"observed_at":"2026-05-18T08:26:42.058060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13770","last_updated":"2023-07-25T19:03:21Z","snapshot_observed_at":"2026-07-06T15:58:31.756298Z","submitted_at":"2023-07-25T19:03:21Z","title":"E^2VPT: An Effective and Efficient Approach for Visual Prompt Tuning","version":1},"cited_work":{"arxiv_id":"2307.13770","doi":"10.48550/arxiv.2307.13770","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.13770","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Eˆ 2vpt: An ef- fective and efficient approach for visual prompt tuning","venue":"arXiv (Cornell University)","work_id":"e1b24874-863a-4eab-ac6b-50902b009f6b","year":2023},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2307.13770","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:7eedf2b657ec1adb3f9d74ff0661049a7340b575ac96d38856c17b92901e65c3","observation_id":"2bc504f4-aa6b-49e2-bb2d-e946d3ca3ad4","resolution":{"observed_at":"2026-05-10T09:23:37.452774Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M 2PT: Multimodal prompt tuning for zero-shot instruction learning","venue":null,"work_id":"df0d1084-cd15-48a0-ae59-5cb93955d1cd","year":2024},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:83652dc1ddf2b21a57abbd0cf3d9b0edabe5a808645ed6a52b986197c4760cdd","observation_id":"7e350dba-13cc-41db-8583-2748973f4443","resolution":{"observed_at":"2026-05-21T14:20:14.925339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.06440","last_updated":"2017-06-08T19:53:26Z","snapshot_observed_at":"2026-08-07T07:29:29.524604Z","submitted_at":"2016-11-19T22:48:30Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","version":2},"cited_work":{"arxiv_id":"1611.06440","doi":"10.48550/arxiv.1611.06440","metadata_source":"pith","pith_arxiv_id":"1611.06440","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Pruning Convolutional Neural Networks for Resource Efficient Inference","venue":"cs.LG","work_id":"0da622ef-0141-4ece-b202-eab31556f979","year":2016},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/1611.06440","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:58ced03d42a17c01bab22976b21ae148fd1a029a8c9894eda12cab8e18651946","observation_id":"047ce859-858b-4f24-978f-92140fa43540","resolution":{"observed_at":"2026-05-10T09:23:37.449194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Overview of the iwslt 2017 evaluation campaign","venue":null,"work_id":"b29db897-a9ec-4f5b-aac9-c4d671e8ddf6","year":2017},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:1b77d31ff26d37b73dbf0361b35cd50f4001e46408ffdab4bd89d541a5e69ddc","observation_id":"7d5e5d7c-8527-48b9-8da0-983cebe4a5ca","resolution":{"observed_at":"2026-05-21T14:20:14.933623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-07-06T13:18:06.376608Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":"2206.03001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-07-03T13:48:21.604443Z","title":"PP-OCRv3: More attempts for the improvement of ultra lightweight OCR system","venue":null,"work_id":"92ed45ef-6f7c-415f-bf2e-2be01e2ed6c4","year":2022},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:412e5338d2c569243e83c5ae76375191d97447a14b6318d9a3398c80097da9fa","observation_id":"da7f256d-2039-4d4f-90b2-48f46148ff10","resolution":{"observed_at":"2026-05-10T09:23:37.456021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UMTIT: Unifying recognition, translation, and generation for multimodal text image translation","venue":null,"work_id":"360463d2-a323-4119-bec6-bca4d9c381c5","year":2024},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:0174859abca3723ad4009add00ba4c05e880876b73939e5f1d470a6cbeb8a75e","observation_id":"6f52da4d-e593-4746-85ed-9dec2de6af48","resolution":{"observed_at":"2026-05-21T14:20:14.921984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Document image machine translation with dynamic multi-pre-trained models assembling","venue":null,"work_id":"283efc8d-bbfb-4ad5-bc80-3bf83d3c699e","year":2024},"citing_paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T07:12:16.623769Z"},"links":{"citing_paper":"/paper/2604.16943"},"observation_digest":"sha256:1fba460c08e2334126e9a2a3186c4fc4d9346b78e81013cda751af022e62a9aa","observation_id":"835c528e-93a7-4ed8-bfb1-14f51ae5d7ed","resolution":{"observed_at":"2026-05-21T14:20:14.928521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.16943","last_updated":"2026-04-18T09:54:20Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T18:41:03.111034Z","submitted_at":"2026-04-18T09:54:20Z","title":"MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":10,"verified_fuzzy":9},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2604.16943."}