{"as_of":"2026-08-07T16:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:798164417b4a9e3b2d0ca613774ae821e2d650ad084d89f7c6063d961718c0c9","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:46:00.186219Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.07415/citation-record","integrity":"/paper/2507.07415/integrity","json":"/paper/2507.07415/citation-record.json","paper":"/paper/2507.07415"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.352019Z","title":"Cma-clip: Cross- modality attention clip for text-image classification,","venue":null,"work_id":"e0688bd4-cb88-4904-8082-368343e1b411","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.137419Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:0b7e4e5c4edbe92d36065afff392b00348d3fdfc00e0b2deeacb6cd0f2ffe6c8","observation_id":"e14bf6c4-7ead-4b3e-97fe-5da5a5c3fc0c","resolution":{"observed_at":"2026-08-06T18:46:00.354240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.345635Z","title":"Future-aware diverse trends framework for recommendation,","venue":null,"work_id":"65c559cb-495d-4820-ad3a-e66272779b94","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.140117Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:ab1ad1901b0023b2b6951e3a017d70725b2ce17a506e7c79fb6d92ee90dab0f4","observation_id":"33fe7a97-2abf-4ce2-99e4-f5d01c59564e","resolution":{"observed_at":"2026-08-06T18:46:00.348130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.339658Z","title":"Dense fusion network with multimodal residual for sentiment classification,","venue":null,"work_id":"cdb2ff6c-4d36-4809-8947-65ccd48e0759","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.142283Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:67b33563cc404a85ed4e76f1a38c5abdaf4047bdac68dd71329390f38da0f947","observation_id":"089606f7-3044-4917-b0a3-f1146e4545a7","resolution":{"observed_at":"2026-08-06T18:46:00.341633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-07-06T05:52:17.418793Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-06T18:46:00.144295Z","title":"Tensor fusion network for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.144295Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:4bea22d92b5c75521a3b19dbc1bd3c516066eabf253d442417c1f31dc2be26da","observation_id":"34939d49-d3ad-44b8-923c-2fc5cf032d3a","resolution":{"observed_at":"2026-08-06T18:46:00.144295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.333889Z","title":"Memory fusion network for multi-view sequential learning,","venue":null,"work_id":"3ec39495-cd86-446e-9882-ab854e35c42d","year":2018},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.146948Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:cadcbf7d2d339a5aaabf7e1a943c6973c5caacc122574bf87d919a784a2b8fc7","observation_id":"56960134-b3a1-4bc5-b46a-bfe3b619497b","resolution":{"observed_at":"2026-08-06T18:46:00.335901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.327921Z","title":"Misa: Modality-invariant and-specific representations for multimodal sentiment analysis,","venue":null,"work_id":"4faa6398-87e3-4646-bf27-e744380bd943","year":2020},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.149114Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:0b879784bb546b585a300c2eb004f1b3ac9b0d2e693e618b9974614b67533a7d","observation_id":"2e0162a0-262e-4d25-897c-33e4adf5e804","resolution":{"observed_at":"2026-08-06T18:46:00.330209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.321734Z","title":"Centralnet: a multilayer approach for multimodal fusion,","venue":null,"work_id":"e914fcc9-4d50-46e3-bfc9-36ce5cc11a75","year":2018},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.151389Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:80d3fbf826419eac758640182707b29cf5668133ab75f6fd59bda29d13f7f8a0","observation_id":"c7805295-3929-48e2-84b1-a43373a9f34d","resolution":{"observed_at":"2026-08-06T18:46:00.324314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.08055","last_updated":"2022-03-15T16:50:15Z","snapshot_observed_at":"2026-08-07T03:36:56.379025Z","submitted_at":"2022-03-15T16:50:15Z","title":"Modular and Parameter-Efficient Multimodal Fusion with Prompting","version":1},"cited_work":{"arxiv_id":"2203.08055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.08055","snapshot_observed_at":"2026-08-06T18:46:00.245075Z","title":"Modular and Parameter-Efficient Multimodal Fusion with Prompting","venue":"cs.CL","work_id":"81107fa2-ddf8-4f3a-9ea8-5207f7731e45","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.153348Z"},"links":{"cited_paper":"/paper/2203.08055","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:bc7c11b298feb7f8ba95d7a85bfee1dd2299db565327c89ca1c8223ac5c3c05a","observation_id":"2830e517-deba-4ae4-b7cf-f4017f2b3250","resolution":{"observed_at":"2026-08-06T18:46:00.247864Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.315740Z","title":"Efficient multimodal fusion via interactive prompting,","venue":null,"work_id":"613e09a4-c978-4786-bc36-b0c4925abf54","year":2023},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.155562Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:1e7f35558d4a3eda6971a645a0d0951965f2a1657a5f89945b4c8ddf58b2036b","observation_id":"eeb99690-bec2-4b27-98f8-cf993201bc0d","resolution":{"observed_at":"2026-08-06T18:46:00.317889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.02950","last_updated":"2020-11-12T03:08:28Z","snapshot_observed_at":"2026-07-06T08:19:42.994042Z","submitted_at":"2019-09-06T14:59:18Z","title":"Supervised Multimodal Bitransformers for Classifying Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.02950","snapshot_observed_at":"2026-08-06T18:46:00.157567Z","title":"Supervised multimodal bitransformers for classifying images and text,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.157567Z"},"links":{"cited_paper":"/paper/1909.02950","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:a97b1b89499f46143c130ec2561ed446a3d24f78da2eb4cd272ff4c7ef2f8e0b","observation_id":"ac88227b-92e0-408c-b950-fae682fc0372","resolution":{"observed_at":"2026-08-06T18:46:00.157567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.309388Z","title":"Visual prompt tuning,","venue":null,"work_id":"dc66e89b-b460-449f-a8b6-479ad1434efe","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.159794Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:b28e1a8f19001619d2c4d14db0b4767c02745f993ec2fee706b118c4f59de247","observation_id":"227179d9-8fa5-4808-8fd0-2c14be0f48ce","resolution":{"observed_at":"2026-08-06T18:46:00.311547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.302894Z","title":"Learning to prompt for vision-language models,","venue":null,"work_id":"1976291f-0bf8-4293-be23-9d95d01bd9cd","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.162217Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:934b694035ba7de7373ac020907b6c8eb2ca8f18efeceec464e93812794e769a","observation_id":"98149875-ad99-444a-ade8-d39581cb2e4f","resolution":{"observed_at":"2026-08-06T18:46:00.305386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.296753Z","title":"Con- ditional prompt learning for vision-language models,","venue":null,"work_id":"109f87cf-b5da-4711-ac89-283469cd9d10","year":2022},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.164134Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:b7045bb815069693ce7ec7a6a218c7ee6dda0a6df517ef732665c3ddfc95d765","observation_id":"14a89053-f6d6-4a61-b20a-b8f1654001b3","resolution":{"observed_at":"2026-08-06T18:46:00.298928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.290018Z","title":"Maple: Multi-modal prompt learning,","venue":null,"work_id":"31465b0f-6702-4f87-8732-97ef3e4e4f32","year":2023},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.166005Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:916e5d786c9df1c6f34e619b2e711f8f208c4273e0574cdacbba0cc476b0175b","observation_id":"ccb5fc53-3815-46af-a945-cf2dcb5f7c32","resolution":{"observed_at":"2026-08-06T18:46:00.292220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05978","last_updated":"2019-11-14T07:45:32Z","snapshot_observed_at":"2026-08-02T13:35:36.386550Z","submitted_at":"2019-11-14T07:45:32Z","title":"HUSE: Hierarchical Universal Semantic Embeddings","version":1},"cited_work":{"arxiv_id":"1911.05978","doi":null,"metadata_source":"pith","pith_arxiv_id":"1911.05978","snapshot_observed_at":"2026-08-06T18:46:00.228240Z","title":"HUSE: Hierarchical Universal Semantic Embeddings","venue":"cs.CV","work_id":"3e75a5da-ebad-4bad-aaea-d0dc9dbdb796","year":2019},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.167906Z"},"links":{"cited_paper":"/paper/1911.05978","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:d96e2d122b0e5e3bce338f443cd7557014a21260212b40f04431f3f726114957","observation_id":"50a382c6-55d6-4255-94f5-63a344d52c98","resolution":{"observed_at":"2026-08-06T18:46:00.232501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07502","last_updated":"2021-11-10T07:31:56Z","snapshot_observed_at":"2026-08-07T14:38:13.014875Z","submitted_at":"2021-07-15T17:54:36Z","title":"MultiBench: Multiscale Benchmarks for Multimodal Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07502","snapshot_observed_at":"2026-08-06T18:46:00.169992Z","title":"Multibench: Multiscale benchmarks for multimodal representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.169992Z"},"links":{"cited_paper":"/paper/2107.07502","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:084c8a8f371bb01274bfd69d46d5b1f169eea9d5d6976cd5c754e60382fdecdc","observation_id":"431cd7f3-ef63-4d69-895f-ff67452f0759","resolution":{"observed_at":"2026-08-06T18:46:00.169992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.283882Z","title":"Dynamic multimodal fusion,","venue":null,"work_id":"648047d5-e9a1-4b19-b473-c77d65b22a51","year":2023},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.172055Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:475b8bb5143b0641456ed21abcd63c8d67ec463f61c1204c094746fe72267a5d","observation_id":"38b259c1-d15f-4dd8-94bc-3bc43a8cf9d4","resolution":{"observed_at":"2026-08-06T18:46:00.285857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.277456Z","title":"Unit: Multimodal multitask learning with a unified transformer,","venue":null,"work_id":"813c659e-cbab-473b-93c9-49474ad012bc","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.173800Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:b3c6f5cc70c61196ac1cf0c17fab65c39c39437cefeb9b551cd8f78edf1180c0","observation_id":"dd0298d8-4358-4f2b-a285-0749ee0c0956","resolution":{"observed_at":"2026-08-06T18:46:00.280004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.271417Z","title":"Vilt: Vision-and-language transformer without convolution or region supervision,","venue":null,"work_id":"66e744e3-6178-4605-b9e8-d9973b9ae4d5","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.175634Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:75a5edbc401157993269d3d023a8e23f6cffa022ec86f7f4169d8ed2ee1e20cc","observation_id":"52dfd6b7-6988-475a-9321-9a35ca8260a2","resolution":{"observed_at":"2026-08-06T18:46:00.273527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.264892Z","title":"Recipe recognition with large multimodal food dataset,","venue":null,"work_id":"e676eb8e-2279-4e2b-a053-5d91049131c4","year":2015},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.177617Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:404d9c6091546cbca2e05cc9a27bc18d3b24ac84f51f5af4d1fc24e6ecc855a1","observation_id":"f0d32a1e-ec7f-44e2-9a7f-2c7b5cf7eef9","resolution":{"observed_at":"2026-08-06T18:46:00.267354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.01992","last_updated":"2017-02-07T13:05:19Z","snapshot_observed_at":"2026-08-05T13:29:33.669402Z","submitted_at":"2017-02-07T13:05:19Z","title":"Gated Multimodal Units for Information Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.01992","snapshot_observed_at":"2026-08-06T18:46:00.179567Z","title":"Gated multimodal units for information fusion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.179567Z"},"links":{"cited_paper":"/paper/1702.01992","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:5c720b72e15449b90bc1a4bbc1faba033646a6465a1f4b76db7b01a0ca1fb9a1","observation_id":"3b6e58a0-f577-4bed-b1c0-e0d3316eaeaf","resolution":{"observed_at":"2026-08-06T18:46:00.179567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10582","last_updated":"2019-01-21T03:07:54Z","snapshot_observed_at":"2026-07-06T07:17:07.332183Z","submitted_at":"2018-11-26T18:37:25Z","title":"Visual Entailment Task for Visually-Grounded Language Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10582","snapshot_observed_at":"2026-08-06T18:46:00.181739Z","title":"Visual en- tailment task for visually-grounded language learning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.181739Z"},"links":{"cited_paper":"/paper/1811.10582","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:7ed7062f8edd06efccc8514a64b8e34b42e3c456a67cd9bb5d85e88eb0611ec6","observation_id":"e6d8ccb1-0998-40c7-befa-b26073a20ddd","resolution":{"observed_at":"2026-08-06T18:46:00.181739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:46:00.258110Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"7b492452-34ff-4188-a9d0-8b679976b3d0","year":2021},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.183804Z"},"links":{"citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:27d8fa47cf532ffbc2ffaaa5de99415b7fb1bbd9ae573f6123b7c0a07a9dacb6","observation_id":"4d0e251c-11f0-4d21-9a81-699fac385c14","resolution":{"observed_at":"2026-08-06T18:46:00.260276Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-06T18:46:00.186219Z","title":"Visualbert: A simple and performant baseline for vision and language. arxiv 2019,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:46:00.186219Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2507.07415"},"observation_digest":"sha256:e53776a69bec9a6e3f27bfba67c5dcbcedc81c6592791f1e59b4341d5e311e5d","observation_id":"fe1d239f-81dd-4190-a66d-455ec0b9a538","resolution":{"observed_at":"2026-08-06T18:46:00.186219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.07415","last_updated":"2025-07-10T04:15:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:44:55.808422Z","submitted_at":"2025-07-10T04:15:44Z","title":"EPIC: Efficient Prompt Interaction for Text-Image Classification"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2507.07415."}