{"as_of":"2026-08-08T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0728f00b97e76f34584e12b0018ff7ddfea8c0934964fafcadd1ae4d738a891e","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T02:22:03.908592Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.06249/citation-record","integrity":"/paper/2606.06249/integrity","json":"/paper/2606.06249/citation-record.json","paper":"/paper/2606.06249"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:56bb9b3263faf1eefdded9e63756b978e97279877b85cf11433fc9c88d8505dc","observation_id":"1b9a41a9-0836-4205-b67f-dc54e8dbb939","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:e663454571c17d4e91fa5d7692cb455fe5f44b5c30c0fa3b36cce1ad80db1460","observation_id":"03688220-1d4b-454f-be79-71d144cc6f30","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:537e52eb27ec6f220400eb75b696d58919ce869ea166acf657b963b5c8a7f1f9","observation_id":"cae0a385-ff23-4dcd-8674-276b0e2170f2","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"mPLUG-Owl3: Towards long image-sequence understanding in multi-modal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:e9ae80a2651e445350366c1ab934e53385dae2da776d6ca37cf4b8319402c08e","observation_id":"ef9746f6-d3bc-4e35-95bb-9400911d1ddd","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:ad6cebda9b6a76064669bdfb174e872a84231ee8bc6c8346b7cbf627fef12c23","observation_id":"dd8144cc-360c-493f-82f3-ab2414b5bd6f","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Multimodal transformer for unaligned multimodal language sequences,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:e94f22baeec7699a23512383479edb9b160d3b253aef9aefbef53f3575444108","observation_id":"73f13c84-d371-4f92-b3c5-c08213adbe79","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Scaling rectified flow transformers for high-resolution image synthesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:97a1451907ece163bff34fe22a54da3072d24dcfe4cfa416b8d574fc5363f1fa","observation_id":"2390d52d-04ee-4ef0-8654-15683e390acb","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"TACA: Rethinking cross-modal interaction in multimodal diffusion transformers,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:939fbeffb16ed46f61888e6a40029fe4c2f1cf52d154b5c6441e68b46ea726f2","observation_id":"83cb7406-5622-4893-817b-f2fb0bc2730f","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Videobert: A joint model for video and language representation learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:987ed616880fc3785566d5857db72ebcdb6140ecdf6597b24875d4c3d9e9dc47","observation_id":"1d74a2d7-d699-44d9-8a59-d325be4c69cd","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Unveiling the power of audio-visual early fusion transformers with dense interactions through masked modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:6f62bed7b98f4dee9f21756123b3bae6b27a3f91991c90ecfcccec724929d483","observation_id":"f6614d7f-bf8e-4446-aeb1-00290c02c046","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Language is not all you need: Aligning perception with language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:c3277413be7570c7ac0520cf5f2e09f15af35c4e272dd0fe772bd62201b9ccbc","observation_id":"580c99a0-9cec-4b12-98ee-b0200493e02b","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Video-LLaMA: An instruction-tuned audio-visual language model for video understanding,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:5fcce1b748bda240b0ea258967f9025279c99fc56485084a8ff3a1b28cd1d6d2","observation_id":"04c8752d-ea5c-43b3-82cd-390b4a45e3fc","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"BLIP-2: bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:0af02c749dfdb2172f56c905ff31b4b2ef297be84dde344bd5ad46d51ae0ec04","observation_id":"e5fea75d-0e50-4926-b31d-33b9fd434dd7","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Cross-modal gated feature enhancement for multimodal emotion recognition in conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:f835226f496d4e3306f8a680ac7540f4bdc16256f1ac4e8562845ba70ee7ceab","observation_id":"c4deb054-34da-4569-83b5-4b7ab83153df","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Triplet attention: Rethinking the similarity in transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:65d4c1d0fae88fc29d9ba457c399a936c6e8de424b72239de2b1d724a479c724","observation_id":"910210a4-58ef-47b1-8794-4a6c063d0ac4","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"MMT: Multi-way multi-modal transformer for multimodal learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:1c497dc6fdb1fc4ce055dcce2ccf83cb43958e881b95eda1267d2503cd9b2d31","observation_id":"063a8e05-95f8-403a-a9e6-8178634ac98b","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Triplet attention transformer for spatiotemporal predictive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:4690fb043f7d0c70b9553e88f658ed85496a271ce03d33ca3cc07ed6ce54c223","observation_id":"638a7d16-465c-4543-8acf-f9745b22c83c","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Gramian multimodal representation learning and alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:a78e0bf482b6c081158732d5866a3fdc8df5145a60b9595a576c2932095f1057","observation_id":"8cb5f894-953e-48b7-8a97-c41b3b9971c3","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:55dbb304a002c0e46d7fe0f834c46ea7ea652ae73c9f4f080c182dd2f12a1dce","observation_id":"a9bcb709-4416-4fd0-ba6d-fea1b758b80e","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"CLAP: learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:75ccc1e2e5754a0e43c550d227980be3891dd49ef28e79bbd608b180f447e03a","observation_id":"7f45dfb5-4203-447d-9706-46dc4938c6f1","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"CLIP4Clip: An empirical study of clip for end to end video clip retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:c13612643faf671e48ea73ad279d0343dc01095161c12347715273a9e246d502","observation_id":"c1ebe48f-4b03-4f94-b42b-b70c7557fb33","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"ImageBind one embedding space to bind them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:86e5ed3d5a898e9261be234e115c28b85fdd217e6301b744ec15100fe5a11dd5","observation_id":"2918a388-03ab-462a-bd6d-660b9a1ed674","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15377","last_updated":"2024-08-14T14:31:50Z","snapshot_observed_at":"2026-08-01T19:17:08.239976Z","submitted_at":"2024-03-22T17:57:42Z","title":"InternVideo2: Scaling Foundation Models for Multimodal Video Understanding","version":4},"cited_work":{"arxiv_id":"2403.15377","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15377","snapshot_observed_at":"2026-07-04T06:39:37.518508Z","title":"Internvideo2: Scaling video foundation mod- els for multimodal video understanding","venue":null,"work_id":"1f0f626c-f5dc-428e-9eb7-3e99516c1cc5","year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"cited_paper":"/paper/2403.15377","citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:9ecb8da08a52ecf1acca2b2294d61b06e7b94093d0ee49ece578394eb4380749","observation_id":"d76c4a66-6383-49dc-b854-8df5bd1deb6e","resolution":{"observed_at":"2026-07-02T12:06:56.379175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Flowing from words to pixels: A noise-free framework for cross-modality evolution,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:d7568a18bc2ad8c0b7406b3ad4021e04b8bd7a418f27a16039daeba879897be0","observation_id":"0ccdc2c4-e73d-4cc0-818e-a976da149cd0","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"A triangle enables multimodal alignment beyond cosine similarity,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:c1e0e7bcbb0ec9ff654caee403c5b8ccedf36120ef331211d549da60814213c4","observation_id":"edb9787c-3a08-4d06-997f-9f17fdf66d5b","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Contrasting with symile: Simple model-agnostic representation learning for unlimited modalities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:992401a044133e15fc8d572e4f6b5ee0f1922879fd2c81a0f0f1ce83af25c9fd","observation_id":"fa27101e-a849-4530-b102-b047e14380c1","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.17343","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T12:06:56.378848Z","title":"Principled multimodal representation learning","venue":null,"work_id":"1292c750-49e1-4137-a4f8-34b94cb512aa","year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:54f1b080bfd20aec7e0f89dd14bcfc200108a8ede49f5ecc3300451821fdde7d","observation_id":"7701ea74-9db6-4215-9f74-17232d2291a5","resolution":{"observed_at":"2026-07-02T12:06:56.380593Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Quadruple attention in many-body systems for accurate molecular property predictions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:60b7af91e331dcd1baa446c00174d83982bb3d8611b43979b9be09d851814d69","observation_id":"d1bb5936-1a6f-41d2-8381-898fe2dbdf85","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Matrix theory,","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:f9ddd6a1950331e08e1da8e3718f548029cade1b49f8aef7d49bc5c8f7af3aa2","observation_id":"36711569-1dd1-4d0b-a6af-cbc6ecb06317","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"M-SENA: An integrated platform for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:67258f82192c92105e40e059c5f346257373d787f234d67642d96178b109532c","observation_id":"4b184902-bcf0-48c5-980f-f924bdf5803b","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:1baa5352f9311c0a67cfa4978856a4d3b72355fba8be872d512ddc3473dd7e07","observation_id":"37a79ce9-3580-4980-92f8-2a720fa67469","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"LanguageBind: Extending video-language pretraining to n-modality by language-based semantic alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:671abb703c35d98956a0a8f4a0d5c304c3737b0c731d23de71910dbc62ac7045","observation_id":"3c355997-5adf-4ee1-b462-0d8b52d58547","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"What to align in multimodal contrastive learning?,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:23f7181e985f49fc782a5c7d2f9b11c0f7ea93d7d971fe6f4e522a873b165d51","observation_id":"58d5e2cf-fbd0-4ced-833d-e00ca698ed4c","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Multimodal phased transformer for sentiment analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:e4974cf17c01427c4e16452de27db5a2f9f9c316fb192a6b940a0b5df040abe9","observation_id":"90e39488-69d7-4225-9858-9dd613b5a8c9","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Joint fine-grained disentanglement and modal-agnostic fusion multi-task framework for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:2fb9d788a70117d80961611e158452c2c08a134540032fb38336aa028c9aaa05","observation_id":"09ca85b9-217f-4e36-924a-c89dc7e750f0","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"MultiBench: Multiscale benchmarks for multimodal representation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:f2354b6540ef7fc869cb7d6d97fc78b7861656d6e6902f58694f28cde3b37c3a","observation_id":"22878b57-d92f-46ae-9a44-137ddc62e175","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Tensor fusion network for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:bf490aa1d009b0db8ef3625284219ed4913fd28e2cdb68de7bd5f97af1250964","observation_id":"200fc8ee-eef4-4e2d-bdd3-b050a8985449","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Efficient low-rank multimodal fusion with modality-specific factors,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:8c6c885f4f02e6a212cee542fb4fb03c78c4de5b7dee8ad17d0110cdd1de6d12","observation_id":"e296aa89-b7a0-457d-92ef-15e04b6b0182","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"MISA: Modality-invariant and -specific representations for multi- modal sentiment analysis,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:7ceae9d5a5666902b6f6ed5410cef92eb8441a99bb10e3d2ecb43bae7ebfc8b6","observation_id":"82a988a3-8f6d-4230-871e-fa7ef9e28b1e","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Learning modality-specific representations with self-supervised multi-task learning for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:afdcab5634825eb0d52f3eb288447503df4dfa06aadfe6cf0d9bc233b0738a13","observation_id":"4916ba40-bf98-4a59-bc91-7fbe239cc37a","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Integrating multimodal information in large pretrained transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:b582e8f752902f9c95b47cdf5dbbb147cef0938e0e61c700909cadf9d48248a0","observation_id":"a105655c-2091-40cc-8050-337c953bca97","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Multimodal multi-loss fusion network for sentiment analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:1c6dc3f3d1b0e31fa84368984fa79912920994ba64a648035e943e32e433ee12","observation_id":"5a9deffe-7ea9-44c1-9fdc-467333b4cf0c","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T02:22:03.908592Z","title":"Enriching multimodal sentiment analysis through textual emotional descriptions of visual-audio content,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T02:22:03.908592Z"},"links":{"citing_paper":"/paper/2606.06249"},"observation_digest":"sha256:d5f64543759210dcde20fd605ef511dce423f6ec996656c7d5a3664f713c0331","observation_id":"31b21a35-39f2-4f90-8438-3dcafe1ef15f","resolution":{"observed_at":"2026-06-28T02:22:03.908592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.06249","last_updated":"2026-06-04T14:52:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:46:05.829177Z","submitted_at":"2026-06-04T14:52:12Z","title":"GRAMformer: Any-Order Modality Interactions via Volumetric Multimodal Cross-Attention"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2606.06249."}