{"as_of":"2026-08-04T12:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd814bdf6d236370f0bb969a4e89502564314aa570050d5b414fc6e5459a4b32","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T01:34:38.597959Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:29:56.632867Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T20:54:07.572136Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2205.14100"},"observation_digest":"sha256:3224d81454e6fdcaee0482da6496e84e07f3700ce88a1ea1e838a32f4323df47","observation_id":"fe4fe666-abea-4baf-a398-efc8c3d7cea8","resolution":{"observed_at":"2026-05-16T20:54:07.669979Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T01:52:01.163900Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2308.01390"},"observation_digest":"sha256:291cfdc8564850b359ae5393421e4f0f595ddbd7cd2a7a58da4c74f948eee7dd","observation_id":"cbc7e6ea-4b69-49b7-9690-b57795862f74","resolution":{"observed_at":"2026-05-14T01:52:01.283540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2403.05135","last_updated":"2024-03-08T08:08:10Z","snapshot_observed_at":"2026-08-02T05:01:21.775493Z","submitted_at":"2024-03-08T08:08:10Z","title":"ELLA: Equip Diffusion Models with LLM for Enhanced Semantic Alignment","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-11T19:43:03.310237Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2403.05135"},"observation_digest":"sha256:5bc759d579bb515aaafa92dff9cc60d8698165b7a03b8eb8c74543fc9fd24558","observation_id":"0547117b-2545-43d3-8918-a74655c7f44c","resolution":{"observed_at":"2026-05-11T19:43:03.449820Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2412.08110","last_updated":"2026-05-07T17:14:28Z","snapshot_observed_at":"2026-08-02T20:28:50.583436Z","submitted_at":"2024-12-11T05:36:18Z","title":"The ART of Composition: Attention-Regularized Training for Compositional Visual Grounding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T07:24:01.527093Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2412.08110"},"observation_digest":"sha256:d278c3b1b542f50726be38d62ab6bc294996acc3f1d2dadacd076f2f00919f47","observation_id":"a22d27b4-0d92-4ae2-a3e9-4c5822de9a63","resolution":{"observed_at":"2026-05-23T07:25:28.425941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2505.12217","last_updated":"2026-05-19T11:31:17Z","snapshot_observed_at":"2026-08-02T21:48:00.406423Z","submitted_at":"2025-05-18T03:32:24Z","title":"HyperCap: Hyperspectral Land Cover Captioning Dataset for Vision Language Models","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-22T15:15:19.523035Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2505.12217"},"observation_digest":"sha256:7ff8608bd4c2fbea5143267d67b0ec033607083c0b3cf52508bffcbbe869ec1b","observation_id":"23b3c1fa-12d1-4479-8187-630a5c314b33","resolution":{"observed_at":"2026-05-22T15:16:43.715851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2510.20093","last_updated":"2026-04-14T09:32:02Z","snapshot_observed_at":"2026-07-06T22:33:53.834577Z","submitted_at":"2025-10-23T00:27:32Z","title":"StableSketcher: Enhancing Diffusion Model for Pixel-based Sketch Generation via Visual Question Answering Feedback","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T05:26:42.034972Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2510.20093"},"observation_digest":"sha256:4effa8aac953f39adc9c950cdec45707d2ab3d5d18776dc4716ad8076bcfbfd1","observation_id":"c7014bc0-822a-4cee-8cad-1eca19200620","resolution":{"observed_at":"2026-05-18T05:30:55.380981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2604.17889","last_updated":"2026-07-12T12:31:32Z","snapshot_observed_at":"2026-08-01T09:01:54.624801Z","submitted_at":"2026-04-20T07:02:10Z","title":"AeroRAG: Structured Multimodal Retrieval-Augmented LLM for Fine-Grained Aerial Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T04:46:22.891034Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2604.17889"},"observation_digest":"sha256:0aa0e93f50e622eea0eb7f20d0906f870753c49cf9af07a839c8f44d385df148","observation_id":"eeb09fb3-51ba-4736-a08f-288dded6a40d","resolution":{"observed_at":"2026-05-10T11:40:19.818843Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections","version":2},"cited_work":{"arxiv_id":"2205.12005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.12005","snapshot_observed_at":"2026-07-04T15:29:56.632867Z","title":"mplug: Effective and effi- cient vision-language learning by cross-modal skip- connections","venue":null,"work_id":"f403c450-0e41-4f17-8374-90ddfce8682a","year":2022},"citing_paper":{"arxiv_id":"2606.24058","last_updated":"2026-06-23T02:05:36Z","snapshot_observed_at":"2026-08-04T05:50:53.317829Z","submitted_at":"2026-06-23T02:05:36Z","title":"VisChronos: Revolutionizing Image Captioning Through Real-Life Events","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T01:34:38.597959Z"},"links":{"cited_paper":"/paper/2205.12005","citing_paper":"/paper/2606.24058"},"observation_digest":"sha256:2212e5332f137a017e7209387b4ce95b374b35bfbc4eb0827ab7f738aa297380","observation_id":"55733916-8a99-4c15-871f-0e32c9a9a304","resolution":{"observed_at":"2026-07-04T15:29:56.634915Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2205.12005/citation-record","integrity":"/paper/2205.12005/integrity","json":"/paper/2205.12005/citation-record.json","paper":"/paper/2205.12005"},"outbound":[],"paper":{"arxiv_id":"2205.12005","last_updated":"2022-05-25T05:49:30Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T13:13:22.359120Z","submitted_at":"2022-05-24T11:52:06Z","title":"mPLUG: Effective and Efficient Vision-Language Learning by Cross-modal Skip-connections"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2205.12005."}