{"as_of":"2026-08-08T14:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e23fd597ec2a69d6b20dff3b92444d9295e8866a495cbff6414c90f63bd35b1a","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:52:32.281803Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17248/citation-record","integrity":"/paper/2506.17248/integrity","json":"/paper/2506.17248/citation-record.json","paper":"/paper/2506.17248"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:32.405536Z","title":"Baseline We adopt three primary types of multimodal learning paradigms: Feature-level fusion: Integration of multiple modalities at the feature level","venue":null,"work_id":"09819c48-80cd-4008-a5f9-5c3f265e563a","year":2018},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.278424Z"},"links":{"citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:4d4d490220a7dfe3221adf082bacf970e401c5203eb93e9b9891584a35c06308","observation_id":"6e8a7eaa-f421-42c4-8d4e-9feb6071be88","resolution":{"observed_at":"2026-08-07T05:52:32.409939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07502","last_updated":"2021-11-10T07:31:56Z","snapshot_observed_at":"2026-08-07T14:38:13.014875Z","submitted_at":"2021-07-15T17:54:36Z","title":"MultiBench: Multiscale Benchmarks for Multimodal Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07502","snapshot_observed_at":"2026-08-07T05:52:32.252230Z","title":"P., Lyu, Y ., Fan, X., Wu, Z., Cheng, Y ., Wu, J., Chen, L., Wu, P., Lee, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.252230Z"},"links":{"cited_paper":"/paper/2107.07502","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:88519798d3dd825288bfb28a337c2ea190a127840f27e11a3460d684d8dfd913","observation_id":"06b52f1a-5fa7-44e0-a9eb-3f9877db56c4","resolution":{"observed_at":"2026-08-07T05:52:32.252230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-07T05:52:32.260373Z","title":"R., and Shah, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.260373Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:df055e924ccd2b73050add07a6d0181c265a263ea406f0f80ea6565d3f7bc3b2","observation_id":"d08a618e-4352-4159-a23b-d7c550e86355","resolution":{"observed_at":"2026-08-07T05:52:32.260373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00935","last_updated":"2024-06-02T01:51:26Z","snapshot_observed_at":"2026-08-04T03:16:06.182770Z","submitted_at":"2023-12-01T21:29:54Z","title":"Understanding Unimodal Bias in Multimodal Deep Linear Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00935","snapshot_observed_at":"2026-08-07T05:52:32.274858Z","title":"T., and Peng, X","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.274858Z"},"links":{"cited_paper":"/paper/2312.00935","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:cdb8c14ac1bb6cdc202e5583fd7d0d167090f264d66fd7d0177227ea668809d3","observation_id":"97c00d96-9983-42c8-8246-12d007582e89","resolution":{"observed_at":"2026-08-07T05:52:32.274858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:32.392841Z","title":"The specific model variant employed in our experiments features unimodal branches, each consisting of four Transformer layers","venue":null,"work_id":"2004fb9c-7dc2-4d4c-aec9-e2ede28bd366","year":2023},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.281803Z"},"links":{"citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:36eaeb4b39060c85a7ab9a2921ecfaec3c59da1b9233cf9062dbf96190fbbda4","observation_id":"c61b8c16-0215-4891-bcc4-63fa9c6a188b","resolution":{"observed_at":"2026-08-07T05:52:32.397280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06176","last_updated":"2019-05-14T14:16:40Z","snapshot_observed_at":"2026-07-06T06:45:08.082087Z","submitted_at":"2018-06-16T03:48:50Z","title":"Learning Factorized Multimodal Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06176","snapshot_observed_at":"2026-08-07T05:52:32.264142Z","title":"H., Liang, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.264142Z"},"links":{"cited_paper":"/paper/1806.06176","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:73686986bc067027640431e56b4c2212cc273ba529a868ade3b468e2ed2d0736","observation_id":"c7b47a57-c7c6-4ebb-8f22-277125aad31b","resolution":{"observed_at":"2026-08-07T05:52:32.264142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:32.429377Z","title":"Food-101– mining discriminative components with random forests","venue":null,"work_id":"15065969-cb03-4b5a-aab5-eb203c9fbb2c","year":2014},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.235428Z"},"links":{"citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:520e23c38c1d1afb398bd22eeef723046528c488bab1c41fb8ad061c79a5b79d","observation_id":"a73c0a1f-38a5-47c7-a49b-2c28abca96b8","resolution":{"observed_at":"2026-08-07T05:52:32.433225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1004.2515","last_updated":"2010-04-14T22:12:52Z","snapshot_observed_at":"2026-08-03T20:33:54.082561Z","submitted_at":"2010-04-14T22:12:52Z","title":"Nonnegative Decomposition of Multivariate Information","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1004.2515","snapshot_observed_at":"2026-08-07T05:52:32.270929Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.270929Z"},"links":{"cited_paper":"/paper/1004.2515","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:1fd6bafc861a1781e56cf512f98435957e699892c16146e325f5e0d91f059e83","observation_id":"b134af1a-5520-438f-af05-d5e204067563","resolution":{"observed_at":"2026-08-07T05:52:32.270929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.10966","last_updated":"2020-06-19T05:14:34Z","snapshot_observed_at":"2026-07-06T09:30:38.493338Z","submitted_at":"2020-06-19T05:14:34Z","title":"Feature Interaction Interpretability: A Case for Explaining Ad-Recommendation Systems via Neural Interaction Detection","version":1},"cited_work":{"arxiv_id":"2006.10966","doi":null,"metadata_source":"pith","pith_arxiv_id":"2006.10966","snapshot_observed_at":"2026-08-07T05:52:32.324823Z","title":"Feature Interaction Interpretability: A Case for Explaining Ad-Recommendation Systems via Neural Interaction Detection","venue":"stat.ML","work_id":"1145457b-ac5d-41af-9d20-2107fdc803b4","year":2020},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.267621Z"},"links":{"cited_paper":"/paper/2006.10966","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:f10a3e9b927a026662d71045b3f3617e05f05c44c23c07cf019ff803ffac9625","observation_id":"f76dcdcc-cd3a-4c6d-b06b-7760570f1c0f","resolution":{"observed_at":"2026-08-07T05:52:32.330835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:52:32.417934Z","title":"Modality dropout for improved performance-driven talking faces","venue":null,"work_id":"a3f5e240-9fcf-4719-b166-a57146b0e1dc","year":2020},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.248738Z"},"links":{"citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:769b429b741babd0cb41943dc839613d1b042678ad8751416c7c3320802db0fd","observation_id":"5f5153b9-6e44-4bdb-ae19-890ad324f59d","resolution":{"observed_at":"2026-08-07T05:52:32.421813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04539","last_updated":"2024-06-13T17:05:54Z","snapshot_observed_at":"2026-08-01T22:01:35.002949Z","submitted_at":"2023-06-07T15:44:53Z","title":"Multimodal Learning Without Labeled Multimodal Data: Guarantees and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04539","snapshot_observed_at":"2026-08-07T05:52:32.256147Z","title":"P., Ling, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.256147Z"},"links":{"cited_paper":"/paper/2306.04539","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:4a2e7d98756af0f17bb83d072576ff978d00941622e916879ec359aeada487ee","observation_id":"76fc0a54-36e4-440e-bddf-b6fdb68f5579","resolution":{"observed_at":"2026-08-07T05:52:32.256147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06618","last_updated":"2019-04-14T03:15:38Z","snapshot_observed_at":"2026-08-08T11:29:17.512292Z","submitted_at":"2019-04-14T03:15:38Z","title":"UR-FUNNY: A Multimodal Language Dataset for Understanding Humor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06618","snapshot_observed_at":"2026-08-07T05:52:32.244311Z","title":"K., Rahman, W., Zadeh, A., Zhong, J., Tanveer, M","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.244311Z"},"links":{"cited_paper":"/paper/1904.06618","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:003dbd361e04e02f61b0ff794f994f1d8105579af3f14945b218d12123250501","observation_id":"c7ac0c3c-ab6a-4d69-8447-200c95f06dec","resolution":{"observed_at":"2026-08-07T05:52:32.244311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-07-06T04:58:59.748799Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-07T05:52:32.240171Z","title":"and Lizier, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:52:32.240171Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/2506.17248"},"observation_digest":"sha256:8261abacc456ac24292e356a72c39b5998f17902711a51bb5ab4c85899725157","observation_id":"20d53c37-4dac-4566-8139-7ece982f0470","resolution":{"observed_at":"2026-08-07T05:52:32.240171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.17248","last_updated":"2025-06-08T02:39:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:42:43.224005Z","submitted_at":"2025-06-08T02:39:25Z","title":"Efficient Quantification of Multimodal Interaction at Sample Level"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":4},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2506.17248."}