{"as_of":"2026-08-09T22:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd22f18095c067598c0bad5454384694c81f2a91278e9b57be8996b4a084dee7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:51:23.736320Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T20:47:23.022501Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":"1909.02950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-07-02T20:47:23.022501Z","title":"digital","venue":null,"work_id":"f1465369-c0c9-4f98-ace0-efadd9d87805","year":1909},"citing_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-11T14:53:58.963468Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/1910.03771"},"observation_digest":"sha256:8cf8ee4dfbebfc2169713b79c749e2d5b9255d2bc9c34749f7bc5b8661376e62","observation_id":"1cc77344-5872-4a58-9678-858a067c67ee","resolution":{"observed_at":"2026-05-11T14:53:59.723692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-07T14:51:23.736320Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17433","last_updated":"2025-06-04T08:55:43Z","snapshot_observed_at":"2026-08-08T01:24:25.553354Z","submitted_at":"2025-05-23T03:27:23Z","title":"MemeReaCon: Probing Contextual Meme Understanding in Large Vision-Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:51:23.736320Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2505.17433"},"observation_digest":"sha256:dc145a1a058b2fdec76c689aae9bc94900cae58b61cfd634dff88baf320b28f1","observation_id":"7328b916-8264-4ecb-aaf9-3e64ec6d9e21","resolution":{"observed_at":"2026-08-07T14:51:23.736320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-07T14:25:39.720399Z","title":"Super- vised multimodal bitransformers for classifying images and text,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.19010","last_updated":"2025-07-30T10:40:17Z","snapshot_observed_at":"2026-08-09T06:34:49.992490Z","submitted_at":"2025-05-25T07:26:00Z","title":"Co-AttenDWG: Co-Attentive Dimension-Wise Gating and Expert Fusion for Multi-Modal Offensive Content Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:39.720399Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2505.19010"},"observation_digest":"sha256:64317b1dd82403a8f8e818cca9575b140ddb1856a12782d1869334cfb89c8ced","observation_id":"4c4ec39b-7d84-4557-a1c6-48705d2ba659","resolution":{"observed_at":"2026-08-07T14:25:39.720399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-07T04:47:37.092412Z","title":"Supervised multimodal bitransformers for classifying images and text","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.09745","last_updated":"2025-06-11T13:49:22Z","snapshot_observed_at":"2026-08-09T00:32:31.859185Z","submitted_at":"2025-06-11T13:49:22Z","title":"Class Similarity-Based Multimodal Classification under Heterogeneous Category Sets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:47:37.092412Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2506.09745"},"observation_digest":"sha256:e7d4772a6de4cf9f0c9c1c65c098fa1c97d5390f5882e89d3f038895b7a19f20","observation_id":"50d67615-4a2c-486c-819d-73303de1f321","resolution":{"observed_at":"2026-08-07T04:47:37.092412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-06T20:51:25.874734Z","title":"InThe Twelfth Interna- tional Conference on Learning Representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01702","last_updated":"2025-07-02T13:32:30Z","snapshot_observed_at":"2026-08-07T11:13:24.826610Z","submitted_at":"2025-07-02T13:32:30Z","title":"AdamMeme: Adaptively Probe the Reasoning Capacity of Multimodal Large Language Models on Harmfulness","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:51:25.874734Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2507.01702"},"observation_digest":"sha256:f2e1ea65dab18f579d9f49fa647a0179ce25722c09972152b27d1e7301682aef","observation_id":"f2a86042-1463-404e-b5c5-2bf226c29f71","resolution":{"observed_at":"2026-08-06T20:51:25.874734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-06T18:56:56.821826Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.06908","last_updated":"2025-07-09T14:46:32Z","snapshot_observed_at":"2026-08-09T00:41:57.627030Z","submitted_at":"2025-07-09T14:46:32Z","title":"MIND: A Multi-agent Framework for Zero-shot Harmful Meme Detection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T18:56:56.821826Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2507.06908"},"observation_digest":"sha256:58b58896aba4a2b34bb4f6570f695be7339a26367b6fba7504647a959f5e2ca1","observation_id":"96192f9b-b103-4de4-b12e-f9fbaba69c15","resolution":{"observed_at":"2026-08-06T18:56:56.821826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-06T18:46:00.157567Z","title":"Supervised multimodal bitransformers for classifying images and text,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.157567Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:a97b1b89499f46143c130ec2561ed446a3d24f78da2eb4cd272ff4c7ef2f8e0b","observation_id":"ac88227b-92e0-408c-b950-fae682fc0372","resolution":{"observed_at":"2026-08-06T18:46:00.157567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-06T15:23:47.353424Z","title":"2020, Supervised Multimodal Bitransformers for Classifying Images and Text","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.16088","last_updated":"2025-07-24T14:46:14Z","snapshot_observed_at":"2026-08-09T15:39:57.447125Z","submitted_at":"2025-07-21T21:55:14Z","title":"Applying multimodal learning to Classify transient Detections Early (AppleCiDEr) I: Data set, methods, and infrastructure","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T15:23:47.353424Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2507.16088"},"observation_digest":"sha256:67adb62cace90d5ce1d3cbcc736424b8ee61fd40b16cba1d176d586e41d39138","observation_id":"bb18bc7e-5361-47a0-84f3-51049671c499","resolution":{"observed_at":"2026-08-06T15:23:47.353424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":"1909.02950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-07-02T20:47:23.022501Z","title":"digital","venue":null,"work_id":"f1465369-c0c9-4f98-ace0-efadd9d87805","year":1909},"citing_paper":{"arxiv_id":"2510.15946","last_updated":"2026-04-16T03:01:25Z","snapshot_observed_at":"2026-08-05T21:56:56.130024Z","submitted_at":"2025-10-10T03:08:30Z","title":"Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T08:41:27.958069Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2510.15946"},"observation_digest":"sha256:d0590c55d49bbebfd222f45ca31675760dc4478b352193dce67172c367149c1e","observation_id":"b05b5ef7-ff1f-4302-9482-2c9f69152483","resolution":{"observed_at":"2026-05-18T08:42:30.135543Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":"1909.02950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-07-02T20:47:23.022501Z","title":"digital","venue":null,"work_id":"f1465369-c0c9-4f98-ace0-efadd9d87805","year":1909},"citing_paper":{"arxiv_id":"2605.04080","last_updated":"2026-04-14T19:34:13Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-14T19:34:13Z","title":"Connecting online criminal behavior with machine learning: Using authorship attribution to analyze and link potential online traffickers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:28:55.932756Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2605.04080"},"observation_digest":"sha256:582e55f5207536a06e535a43bbaef30a34a62de11deb326986743253f850b303","observation_id":"7c352034-5ba7-422f-bc86-ab6d2e51163d","resolution":{"observed_at":"2026-05-11T10:31:00.451910Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":"1909.02950","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-07-02T20:47:23.022501Z","title":"digital","venue":null,"work_id":"f1465369-c0c9-4f98-ace0-efadd9d87805","year":1909},"citing_paper":{"arxiv_id":"2606.09907","last_updated":"2026-06-06T07:50:41Z","snapshot_observed_at":"2026-07-06T23:49:12.754871Z","submitted_at":"2026-06-06T07:50:41Z","title":"LongMoE: Longitudinal Multimodal Learning via Trajectory-Aware Mixture-of-Experts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T20:09:00.056162Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2606.09907"},"observation_digest":"sha256:ccc89923bedc88ab162147474c83fd388ebe78c91f091b32acba37162729d586","observation_id":"73cbfa37-0a9a-4f64-9e0d-89a60603d956","resolution":{"observed_at":"2026-07-02T20:47:23.025038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-01T06:07:51.123846Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22016","last_updated":"2026-07-24T06:28:57Z","snapshot_observed_at":"2026-08-05T08:00:04.839613Z","submitted_at":"2026-07-24T06:28:57Z","title":"EVL-MCoT: Enhanced Vision-Language Multi-CoT for Harmful Meme Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T06:07:51.123846Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2607.22016"},"observation_digest":"sha256:af6a153ea863660e0a17292ace503974dfdf2a1b6b605d4a9da4667892c3d500","observation_id":"b4ebeed2-5d38-403f-a6ef-35b55c6bcb1c","resolution":{"observed_at":"2026-08-01T06:07:51.123846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1909.02950/citation-record","integrity":"/paper/1909.02950/integrity","json":"/paper/1909.02950/citation-record.json","paper":"/paper/1909.02950"},"outbound":[],"paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:1909.02950."}