{"as_of":"2026-08-11T19:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1139c018936b1eb0878a9f3692e6d26f5cfac6edeb5cee0142104d76602a143a","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:57:41.937067Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.03332/citation-record","integrity":"/paper/2501.03332/integrity","json":"/paper/2501.03332/citation-record.json","paper":"/paper/2501.03332"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.740849Z","title":"Multimodal personality recognition using cross-attention transformer and behaviour encoding","venue":null,"work_id":"90168ea9-6c38-4490-944b-b64709adeb42","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.747478Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:15a6f28af58ce75d90598c3dee46b04c3945d50d38e76e310a10ffede31912ba","observation_id":"cefb8f7e-1b1c-4885-895d-066ea60b3fd7","resolution":{"observed_at":"2026-08-10T21:57:42.746006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.726119Z","title":"Multimodal vision transformers with forced attention for behavior analysis","venue":null,"work_id":"4bb0011e-51ee-4ee8-bfc7-af27e1be2691","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.752893Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:7a210fb939c0dfcb6339008f5fe13759f1042d9d369fec81aa076806cf504cd0","observation_id":"9a3d884a-bb0a-4e77-989b-edcb82da6259","resolution":{"observed_at":"2026-08-10T21:57:42.730891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.11178","last_updated":"2021-12-07T04:01:25Z","snapshot_observed_at":"2026-07-06T11:02:49.722095Z","submitted_at":"2021-04-22T17:07:41Z","title":"VATT: Transformers for Multimodal Self-Supervised Learning from Raw Video, Audio and Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.11178","snapshot_observed_at":"2026-08-10T21:57:41.757556Z","title":"V ATT: transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.757556Z"},"links":{"cited_paper":"/paper/2104.11178","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:6d7c702c4a81e9a202677e2796ae9146c5b59d4c87ab3b8158148377a97856f2","observation_id":"1eaf3175-b942-4fb1-8eb4-6ab022416907","resolution":{"observed_at":"2026-08-10T21:57:41.757556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.710733Z","title":"Vivit: A video vi- sion transformer","venue":null,"work_id":"1742ec51-7750-424e-847e-cb9f8c15cd9a","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.762729Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:780bbcdb6e1eb1bcc4449d8c275b6e0ed73dddce166640f665fc2d62cc5039be","observation_id":"1c420e10-9362-479c-a3a8-236326b87c4a","resolution":{"observed_at":"2026-08-10T21:57:42.716215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.695478Z","title":"Bodily be- haviors in social interaction: Novel annotations and state-of- the-art evaluation","venue":null,"work_id":"e1dff8f6-79dd-4f3f-ab5a-b875e3815bfc","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.767362Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:d75ba7c040d9f0fb2abba12088f97cf4c986d3b3ee72cda0c5c1f538823cd5d1","observation_id":"3e79fad3-0e5a-4983-a89b-43454524ad2d","resolution":{"observed_at":"2026-08-10T21:57:42.700369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.13535","last_updated":"2022-10-15T01:31:42Z","snapshot_observed_at":"2026-08-07T21:46:09.780655Z","submitted_at":"2022-05-26T17:56:15Z","title":"AdaptFormer: Adapting Vision Transformers for Scalable Visual Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.13535","snapshot_observed_at":"2026-08-10T21:57:41.772310Z","title":"Adaptformer: Adapt- ing vision transformers for scalable visual recognition.arXiv preprint arXiv:2205.13535, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.772310Z"},"links":{"cited_paper":"/paper/2205.13535","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:32c09180fdc63b831703ebebd343c7d772ed81dcae56c267b16ea01182368aca","observation_id":"be8de12e-1c86-499f-b53b-51028f9afdec","resolution":{"observed_at":"2026-08-10T21:57:41.772310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.13256","last_updated":"2021-09-17T17:17:48Z","snapshot_observed_at":"2026-08-11T15:36:05.728594Z","submitted_at":"2020-06-23T18:28:04Z","title":"Rescaling Egocentric Vision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.13256","snapshot_observed_at":"2026-08-10T21:57:41.777674Z","title":"Rescaling egocentric vision","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.777674Z"},"links":{"cited_paper":"/paper/2006.13256","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:c28cb79cf97dd6c18e81e18597fc06ac1de8a1c9cb3223965681f2a65e9ee048","observation_id":"29b47da0-5ead-46ef-98c8-e46eb20e0c02","resolution":{"observed_at":"2026-08-10T21:57:41.777674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.680274Z","title":"A transformer-based joint-encoding for emotion recognition and sentiment analysis","venue":null,"work_id":"5bf848a5-5e71-4c38-83aa-ed231b182894","year":2020},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.782611Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:f84dc7da2ecdfaca8f27c889e569cf31a7721a67091304891ec91a1523dec8c0","observation_id":"2d7d4960-2027-4a56-9d79-a5fc39f7bf2c","resolution":{"observed_at":"2026-08-10T21:57:42.685448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04332","last_updated":"2022-03-14T02:05:06Z","snapshot_observed_at":"2026-08-09T18:32:47.872424Z","submitted_at":"2021-09-09T15:11:04Z","title":"PPT: Pre-trained Prompt Tuning for Few-shot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04332","snapshot_observed_at":"2026-08-10T21:57:41.786939Z","title":"Ppt: Pre-trained prompt tuning for few-shot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.786939Z"},"links":{"cited_paper":"/paper/2109.04332","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:cc24df0539fe0a6e08eebc7428661f22ab472b5247cbb5a28d098ee9d4e8615e","observation_id":"517d6aa6-979a-4842-a0e5-e3e409206b80","resolution":{"observed_at":"2026-08-10T21:57:41.786939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-09T04:45:04.547249Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-10T21:57:41.791474Z","title":"Towards a unified view of parameter-efficient transfer learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.791474Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:d73feaaf9348d5921bd83312cde1432ec4145bf9dd47d07b5703c66ad91b0210","observation_id":"57d12086-2d8c-486e-96e5-af7792988656","resolution":{"observed_at":"2026-08-10T21:57:41.791474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.663132Z","title":"Parameter-efficient trans- fer learning for NLP","venue":null,"work_id":"90447202-d88e-49d0-a3aa-6f55169806e8","year":2019},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.796366Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:7b5a4ca9db214218fc198a9fb2fe2b5b5643202c7f3a5b15bc0f0d474a86a36b","observation_id":"17187cc0-9144-4617-b319-154d44b933fc","resolution":{"observed_at":"2026-08-10T21:57:42.669455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.647176Z","title":"Lora: Low-rank adaptation of large language models, 2021","venue":null,"work_id":"438cfeef-0716-439c-85ff-b4667460c5fe","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.801052Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:04a648cfb1d27189e43b4e5dd13055813dd954b0e0e862426353d22753d64cff","observation_id":"d50bb71c-9b26-4cca-9ca9-3d8dff2a5375","resolution":{"observed_at":"2026-08-10T21:57:42.652332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T21:57:41.805566Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.805566Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:172d5e11562d89374b5c29d73805a95a939d6d2df9884caf3ef2e00288e27b8d","observation_id":"5f3ad6b7-82a6-4838-98de-3a7c28a17858","resolution":{"observed_at":"2026-08-10T21:57:41.805566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.632330Z","title":"Mumu: Cooperative mul- titask learning-based guided multimodal fusion","venue":null,"work_id":"3a70c35c-23c0-45b3-ba0c-c45b07597f3d","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.810254Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:7452aae8196b8b00749f023e86433f1e77776085e77906313693fa06dc5fc57f","observation_id":"47638112-c3bb-4db1-b42e-0a4f6c7fee1f","resolution":{"observed_at":"2026-08-10T21:57:42.637267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.617449Z","title":"Vi- sual prompt tuning","venue":null,"work_id":"2c0d98d8-3330-4bd2-a775-7cb308978fa7","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.814539Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:9ebcb99102865e35e129e915790b66a5ccc913d3c3c1278fa9d84faeffc082d5","observation_id":"1e937211-8683-4eed-a255-fd36306eb630","resolution":{"observed_at":"2026-08-10T21:57:42.622072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.601905Z","title":"Compacter: Efficient low-rank hypercomplex adapter layers","venue":null,"work_id":"ccf03f73-e535-44c6-88c6-15783be812bb","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.819154Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:bd00a748a918abf8f909b3970af35cd1c4ee90924eceffe7c75db35944349371","observation_id":"062b865c-3421-4328-b567-87405a285e13","resolution":{"observed_at":"2026-08-10T21:57:42.607216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.586400Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks","venue":null,"work_id":"8ffabc3e-f79d-4588-9987-4c843ae3d0a7","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.823645Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:423543bd2745bec222bc3866acfd5bc7f25322aecb05b61e2402daf92668e620","observation_id":"37329977-4498-4e23-aac8-b181ca94c9e5","resolution":{"observed_at":"2026-08-10T21:57:42.591462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:41.828211Z","title":"Transformers in vision: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.828211Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:b84547088c441f45da6b63ac37c768076f91b8780b12c0375106bd7074d36564","observation_id":"039df51b-eee5-410e-b860-2f411990162c","resolution":{"observed_at":"2026-08-10T21:57:41.828211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.01043","last_updated":"2020-02-21T06:58:03Z","snapshot_observed_at":"2026-08-02T19:12:36.777089Z","submitted_at":"2020-02-21T06:58:03Z","title":"Gated Mechanism for Attention Based Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":"2003.01043","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.01043","snapshot_observed_at":"2026-08-10T21:57:42.248923Z","title":"Gated Mechanism for Attention Based Multimodal Sentiment Analysis","venue":"cs.CL","work_id":"c88cf28a-d8a4-42aa-95a7-c6dccdf88051","year":2020},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.832911Z"},"links":{"cited_paper":"/paper/2003.01043","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:c7d1e492e0d5ceaeeeb62b475e1d10aab174e8e7b501895ac3a06f05b1a434c6","observation_id":"ecc15948-d0c0-46eb-b0a4-d2f7e61e1c0c","resolution":{"observed_at":"2026-08-10T21:57:42.254175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.561871Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"4fe7c1fe-9c12-4511-b577-fa962b0433f8","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.837764Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:749ae05112ad978081ee0073e2986f3da5194c9c10fce9f3836d8896b3407bb4","observation_id":"f7680172-9a00-48f8-b83c-08944022ab9a","resolution":{"observed_at":"2026-08-10T21:57:42.566531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-10T21:57:41.842107Z","title":"Prefix-tuning: Optimiz- ing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.842107Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:aad01dcf54aff5f30220e7d3b352b6210bd7dd159cbb785cc36c2eec37221a71","observation_id":"a2452fab-058f-49ef-a192-af15732c1147","resolution":{"observed_at":"2026-08-10T21:57:41.842107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.546716Z","title":"Video swin transformer","venue":null,"work_id":"5fed47dc-cc8b-4910-b902-8cbb135b0d4a","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.847102Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:561dfd5c0afa309d65251d00337fb3cdab7c0e27e497d7ddd6db921f7761393f","observation_id":"0ec927f3-ed76-41bd-aca2-7d3101e3d2f0","resolution":{"observed_at":"2026-08-10T21:57:42.551485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04489","last_updated":"2021-06-08T16:16:40Z","snapshot_observed_at":"2026-08-03T19:17:21.128233Z","submitted_at":"2021-06-08T16:16:40Z","title":"Parameter-efficient Multi-task Fine-tuning for Transformers via Shared Hypernetworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04489","snapshot_observed_at":"2026-08-10T21:57:41.851696Z","title":"Parameter-efficient multi-task fine-tuning for transformers via shared hypernetworks.arXiv preprint arXiv:2106.04489, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.851696Z"},"links":{"cited_paper":"/paper/2106.04489","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:0850e0479d3ca481d0c1a8617fa39111b13d04fc1ad86511108107a9d455d725","observation_id":"c4eee4e8-5c4c-4682-9226-73692234e2f5","resolution":{"observed_at":"2026-08-10T21:57:41.851696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07577","last_updated":"2022-09-04T23:31:05Z","snapshot_observed_at":"2026-08-01T19:07:06.818808Z","submitted_at":"2021-10-14T17:40:08Z","title":"UniPELT: A Unified Framework for Parameter-Efficient Language Model Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07577","snapshot_observed_at":"2026-08-10T21:57:41.856385Z","title":"Unipelt: A unified framework for parameter-efficient lan- guage model tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.856385Z"},"links":{"cited_paper":"/paper/2110.07577","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e644f1600da52841f6843aa980c87ba97ec888726beba606dd03bf985e63421a","observation_id":"f125b378-f6e3-48ad-9f6f-80238fe6635f","resolution":{"observed_at":"2026-08-10T21:57:41.856385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.531902Z","title":"Tiny adapters for vision transformers, 2023","venue":null,"work_id":"f8c8b1ef-1dfa-4d89-b19a-d95e63f85c86","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.861544Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:c797517a54a43cd8dcb4db73935145500b9d0f4f81a9dba655bce8f4fcf51116","observation_id":"791ab3e0-3809-4a6c-a617-1c3875df456e","resolution":{"observed_at":"2026-08-10T21:57:42.536574Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.516211Z","title":"Context- aware personality inference in dyadic scenarios: Introducing the udiva dataset","venue":null,"work_id":"33b2ac6d-626a-4d66-ae48-5b0d102acfb9","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.865979Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:caece2b6f3434c5ffab63a50b40d0ced9b45e520398e9da0f5df34ae9851f852","observation_id":"3ab3513c-5b1e-444a-84ab-a79ca64d5114","resolution":{"observed_at":"2026-08-10T21:57:42.521422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.13559","last_updated":"2022-10-13T06:34:19Z","snapshot_observed_at":"2026-08-02T02:14:22.911676Z","submitted_at":"2022-06-27T18:02:29Z","title":"ST-Adapter: Parameter-Efficient Image-to-Video Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.13559","snapshot_observed_at":"2026-08-10T21:57:41.870525Z","title":"St-adapter: Parameter-efficient image-to-video transfer learning for action recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.870525Z"},"links":{"cited_paper":"/paper/2206.13559","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:9bebf4ba294b99ba1b4f7e771a0808f4ab64a9719e66c74786c37c5ceb1518b7","observation_id":"f5f113a2-2ebc-4f1c-9de3-62d70bf10728","resolution":{"observed_at":"2026-08-10T21:57:41.870525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.500445Z","title":"Dual-path adaptation from image to video transformers","venue":null,"work_id":"e498c21b-d2f1-42f8-a712-c6c829acfc8c","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.875584Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:7a1f0d68466649ec1cacbf212c591d89d6ebafb995a9336d860e38f3e86be37e","observation_id":"70d7c14b-1d06-43ed-a5ee-6204b3fdae4c","resolution":{"observed_at":"2026-08-10T21:57:42.505307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.485630Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"bf3212fd-eb72-44c9-94d3-dc641313dbea","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.880284Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:537aaf0cc1e50ac82c05cdeb60293cd20cef4604ac5c86090ff517919f90eeb1","observation_id":"c53a2f50-64df-4e3c-9c6f-09538f2edcfb","resolution":{"observed_at":"2026-08-10T21:57:42.490340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.469605Z","title":"Learning multiple visual domains with residual adapters.Ad- vances in neural information processing systems , 30, 2017","venue":null,"work_id":"a2128649-e102-40cc-9401-02b1e8a344e8","year":2017},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.884972Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:fc518e1609248448663941dab34d454e9e87db043431bbd287a9857e5ffd3db0","observation_id":"7dcef711-74ce-4ef1-a1d0-c7859b704e57","resolution":{"observed_at":"2026-08-10T21:57:42.475392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.453418Z","title":"Efficient parametrization of multi-domain deep neural net- works","venue":null,"work_id":"5155782c-5722-435c-85dd-7499d904b3c3","year":2018},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.889613Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:9de000a0d3a8cd1f717263355636c8ea27b37d8b2f47e6066b018f56b30f0d09","observation_id":"b3cddac2-21f3-4624-99d5-391385aecde6","resolution":{"observed_at":"2026-08-10T21:57:42.459033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.05494","last_updated":"2023-01-13T11:50:08Z","snapshot_observed_at":"2026-08-03T05:34:26.570506Z","submitted_at":"2023-01-13T11:50:08Z","title":"Multilingual Detection of Check-Worthy Claims using World Languages and Adapter Fusion","version":1},"cited_work":{"arxiv_id":"2301.05494","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.05494","snapshot_observed_at":"2026-08-10T21:57:42.160487Z","title":"Multilingual Detection of Check-Worthy Claims using World Languages and Adapter Fusion","venue":"cs.CL","work_id":"58759064-1184-4d3b-a7d0-a3da466fc4e9","year":2023},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.894087Z"},"links":{"cited_paper":"/paper/2301.05494","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:505c440e292059e8a153363680caaae7de495da9548049dbe008ebb36aa152dd","observation_id":"05eb2b85-d972-4d7e-bba8-745c2bd5e3f7","resolution":{"observed_at":"2026-08-10T21:57:42.167868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.437350Z","title":null,"venue":null,"work_id":"44cacb30-f6b9-4edf-a3f8-dd5ebdff4063","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.899007Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:ca351da7c520cb56af3f718771d335054d9b30132fc35490d8b5f4e2af6c72b7","observation_id":"332d9f91-1186-490b-a9da-593c90a511ec","resolution":{"observed_at":"2026-08-10T21:57:42.442110Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.420420Z","title":"Vl-adapter: Parameter-efficient transfer learning for vision-and-language tasks","venue":null,"work_id":"2bf2f0ba-4198-442e-bc4d-d0e145cec935","year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.903694Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:b4c7016c99fbdaaaf6091bc23a287dafb27049c286d48c99be785ab717166f58","observation_id":"811a7111-1a81-440f-b2b4-57d8cfb7adc8","resolution":{"observed_at":"2026-08-10T21:57:42.425548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.403546Z","title":"Training neu- ral networks with fixed sparse masks","venue":null,"work_id":"02b93639-6d37-434f-afa6-c752fb187551","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.909217Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:0132fa75b84418c29d4eae0436cb11db4d8aaee651083a4230ee1ef293775bde","observation_id":"df61c7e2-bb0c-4dfa-929a-4697adc19e80","resolution":{"observed_at":"2026-08-10T21:57:42.408691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.387600Z","title":"VideoMAE: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":"61b127b2-b2b5-4024-aa45-82f4da7bf368","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.913810Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:e0187ae5a8ffe781d0028cd606256993a5c35cf2ff4d9487ff43f3425bc2a556","observation_id":"1051fd7a-9059-410d-b500-fc5f29f641da","resolution":{"observed_at":"2026-08-10T21:57:42.393480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12602","last_updated":"2022-10-18T09:15:42Z","snapshot_observed_at":"2026-08-09T12:27:33.352994Z","submitted_at":"2022-03-23T17:55:10Z","title":"VideoMAE: Masked Autoencoders are Data-Efficient Learners for Self-Supervised Video Pre-Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12602","snapshot_observed_at":"2026-08-10T21:57:41.918538Z","title":"Videomae: Masked autoencoders are data-efficient learn- ers for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.918538Z"},"links":{"cited_paper":"/paper/2203.12602","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:8e0443d7a8cf70abb88d695917396faf9879378fcbd8ea0645bc7052879f946f","observation_id":"3e61394d-7238-44fd-9e1c-9f45e904f98e","resolution":{"observed_at":"2026-08-10T21:57:41.918538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09852","last_updated":"2022-06-20T15:31:13Z","snapshot_observed_at":"2026-08-07T22:31:22.587774Z","submitted_at":"2022-06-20T15:31:13Z","title":"M&M Mix: A Multimodal Multiview Transformer Ensemble","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09852","snapshot_observed_at":"2026-08-10T21:57:41.923255Z","title":"M&m mix: A multimodal multiview transformer ensemble","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.923255Z"},"links":{"cited_paper":"/paper/2206.09852","citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:2bead749ab3da21f992b61d3eb6398f5c07fedd8711599d19c854baec8f2299f","observation_id":"a9217669-4064-436c-9976-7f7f8fe6acda","resolution":{"observed_at":"2026-08-10T21:57:41.923255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.371802Z","title":"Multiview transformers for video recognition","venue":null,"work_id":"9cd90132-a9f3-4a0d-bb63-70b12f9af703","year":2022},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.928345Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:f0cfda45e0b4a4b3a853da54f564b708e1e418d91bee0a468f8ee8168aa178e1","observation_id":"31ca9c65-cca4-4d16-a0fd-a23491cd5239","resolution":{"observed_at":"2026-08-10T21:57:42.376564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:41.932616Z","title":"Bitfit: Simple parameter-efficient fine-tuning for transformer-based masked language-models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.932616Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:443821df1d99ef26e9c603a0f4f69b38a38c5e82797e32872ffbd489a5fee8a6","observation_id":"80143f1f-e6e2-45f7-9206-914917274a3d","resolution":{"observed_at":"2026-08-10T21:57:41.932616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T21:57:42.355991Z","title":null,"venue":null,"work_id":"718b772c-9544-42f4-8f0f-0ca95f4c6eb7","year":2021},"citing_paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T21:57:41.937067Z"},"links":{"citing_paper":"/paper/2501.03332"},"observation_digest":"sha256:db6d1cf8b786021bccbd1f98769c4a1aee145602f62bd1c2512520eea3b214fd","observation_id":"fab0796f-1759-49e8-a8e4-9bd83f972ab1","resolution":{"observed_at":"2026-08-10T21:57:42.361307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.03332","last_updated":"2025-01-06T19:01:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T17:29:00.698137Z","submitted_at":"2025-01-06T19:01:10Z","title":"CM3T: Framework for Efficient Multimodal Learning for Inhomogeneous Interaction Datasets"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2501.03332."}