{"as_of":"2026-08-07T06:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba3f721eca6ee0a4aca9da320d942d3175c736a0d29ebb740cf52ffd76bc697d","coverage":[{"denominator":105,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:50:24.303188Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.13364/citation-record","integrity":"/paper/2507.13364/integrity","json":"/paper/2507.13364/citation-record.json","paper":"/paper/2507.13364"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.223191Z","title":"Vatt: Transformers for multimodal self-supervised learning from raw video, audio and text","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.223191Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:5a2d32fe5c31e9bf7afec7ea9488038cd4f6aac512da9c6f9193331f176b9966","observation_id":"d59a1872-489d-4553-9de4-41191b6890f5","resolution":{"observed_at":"2026-08-06T19:50:14.223191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.301171Z","title":"Objects that sound","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.301171Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:0321091310b03c15188710f52bdc67ca054f538af05a7cceb1edd16504051fa3","observation_id":"58c6bae3-fdc2-4237-8b13-d67425b5116f","resolution":{"observed_at":"2026-08-06T19:50:14.301171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.441879Z","title":"3d seman- tic parsing of large-scale indoor spaces","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.441879Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:20baaf9efab89b02e207707a43c97c3bff7570ffa892203d181a8c29cd00f77b","observation_id":"af1c03c2-eed2-4c63-8061-3e9de9304f1e","resolution":{"observed_at":"2026-08-06T19:50:14.441879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16691","last_updated":"2022-03-30T22:06:13Z","snapshot_observed_at":"2026-07-06T12:55:01.603047Z","submitted_at":"2022-03-30T22:06:13Z","title":"MAE-AST: Masked Autoencoding Audio Spectrogram Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16691","snapshot_observed_at":"2026-08-06T19:50:14.572549Z","title":"Mae- ast: Masked autoencoding audio spectrogram transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.572549Z"},"links":{"cited_paper":"/paper/2203.16691","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:30c9cc668407de9c9b8f5afffa848356b9c82bba934ee4c60284782c2fa8cf97","observation_id":"39d3b6b5-846b-49fd-87e5-30dc0c0f116b","resolution":{"observed_at":"2026-08-06T19:50:14.572549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.702418Z","title":"Data2vec: A general frame- work for self-supervised learning in speech, vision and lan- guage","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.702418Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b9aac1ad943060cda994ca35ead7b126e284e716c0fe8a60463b8c67356761f4","observation_id":"a21ca1f0-fa77-4a38-b1f9-6cd59471f3d0","resolution":{"observed_at":"2026-08-06T19:50:14.702418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:14.854860Z","title":"Generative adversarial networks based on transformer encoder and convolution block for hyperspectral image classification","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.854860Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:96d75a8374d1d8536ec8efb2848667467add599471b00ce74ef30209aa4d66e9","observation_id":"2bea425a-ac9b-44e4-8ad7-d70b29a3bf8d","resolution":{"observed_at":"2026-08-06T19:50:14.854860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10890","last_updated":"2022-11-03T18:34:02Z","snapshot_observed_at":"2026-07-06T12:40:23.619725Z","submitted_at":"2022-02-22T13:39:14Z","title":"HiP: Hierarchical Perceiver","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10890","snapshot_observed_at":"2026-08-06T19:50:14.988580Z","title":"Hierarchical perceiver","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:14.988580Z"},"links":{"cited_paper":"/paper/2202.10890","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:32c38305a8bd8120984ab635f3f8c0dbc492c35994a3f495c4d6f868c6dd14ba","observation_id":"3c461085-a472-455b-901b-a4c5fd5b9a5b","resolution":{"observed_at":"2026-08-06T19:50:14.988580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:15.091237Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.091237Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:29c988b2ba696b3ff538199de7502799520427e8fdf8fc0cce8a1b944de86878","observation_id":"56e36f43-8424-40ea-a6a1-99d718592339","resolution":{"observed_at":"2026-08-06T19:50:15.091237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.06762","last_updated":"2021-06-16T06:34:42Z","snapshot_observed_at":"2026-08-03T18:29:07.982544Z","submitted_at":"2021-05-14T11:12:40Z","title":"DialogSum: A Real-Life Scenario Dialogue Summarization Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.06762","snapshot_observed_at":"2026-08-06T19:50:15.207070Z","title":"Dialogsum: A real-life scenario dialogue summarization dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.207070Z"},"links":{"cited_paper":"/paper/2105.06762","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9a5447f496920518fb95c710a710a4a71ef964fae0665a036672cd3a19a7ff6c","observation_id":"54ea8e34-ffa0-4245-9962-ef434d3f3ae7","resolution":{"observed_at":"2026-08-06T19:50:15.207070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09796","last_updated":"2020-09-10T19:31:04Z","snapshot_observed_at":"2026-07-06T09:57:23.086479Z","submitted_at":"2020-09-10T19:31:04Z","title":"Multi-Task Learning with Deep Neural Networks: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.09796","snapshot_observed_at":"2026-08-06T19:50:15.356316Z","title":"Multi-task learning with deep neu- ral networks: A survey","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.356316Z"},"links":{"cited_paper":"/paper/2009.09796","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:5979a203b632b514123d79ac381d75be66a1759958db1c9276802ebb1596f571","observation_id":"c5a18620-9c84-4893-8dc8-db6d1adb2641","resolution":{"observed_at":"2026-08-06T19:50:15.356316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06126","last_updated":"2022-05-12T14:39:21Z","snapshot_observed_at":"2026-07-06T13:09:18.182976Z","submitted_at":"2022-05-12T14:39:21Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","version":1},"cited_work":{"arxiv_id":"2205.06126","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.06126","snapshot_observed_at":"2026-08-06T19:50:26.429204Z","title":"One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code","venue":"cs.CL","work_id":"a6ffbe8f-5c9e-4dcd-afc2-7f45cf4e9789","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.468308Z"},"links":{"cited_paper":"/paper/2205.06126","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:790d76cc05ac5b2986fea9af388485849a95ebc457fd888f3387d96288e2292c","observation_id":"56770bc8-7652-4291-a236-385ac86ae989","resolution":{"observed_at":"2026-08-06T19:50:26.526503Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:15.576775Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.576775Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f0541f9656f1b42684ad2e6d2732dba437d1f9a9cd3f49d7d0e634e19c469f71","observation_id":"9f3f72e0-b581-414b-8320-fc49d0f25b45","resolution":{"observed_at":"2026-08-06T19:50:15.576775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:15.745612Z","title":"BERT: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.745612Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2f7cc4a7c2d0d72a18937a35c2c9770c83636071e2090eabcd8ba44e5249ab53","observation_id":"fd8e2161-2dab-474d-aafc-305379b80e06","resolution":{"observed_at":"2026-08-06T19:50:15.745612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T19:50:15.911782Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:15.911782Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:a23235ae15f1097e6bc42492ab8fbc211168f0e77b7a28e3d9dfd7c0af8b54f1","observation_id":"37f95f8a-075d-45ee-b344-173b91ad14b3","resolution":{"observed_at":"2026-08-06T19:50:15.911782Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.035240Z","title":"A generaliza- tion of transformer networks to graphs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.035240Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:45bdbe95eeef185278fb8fd4414b1301d937288e66e26774d6c9f480e4140322","observation_id":"55f8eeca-e4a0-4882-b8a4-0aead2363c93","resolution":{"observed_at":"2026-08-06T19:50:16.035240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.197878Z","title":"Efficiently identifying task group- ings for multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.197878Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b23cafb13cc08819a477300b131855339108c4b694dccbe1d00cd7f9ecaac295","observation_id":"dc85f918-01e8-42ac-9e37-65f9d313ef58","resolution":{"observed_at":"2026-08-06T19:50:16.197878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.11479","last_updated":"2022-07-05T06:30:51Z","snapshot_observed_at":"2026-07-06T13:03:22.436518Z","submitted_at":"2022-04-25T07:50:45Z","title":"End-to-End Audio Strikes Back: Boosting Augmentations Towards An Efficient Audio Classification Network","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.11479","snapshot_observed_at":"2026-08-06T19:50:16.324991Z","title":"End-to-end audio strikes back: Boosting augmentations towards an efficient audio classification net- work","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.324991Z"},"links":{"cited_paper":"/paper/2204.11479","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:df3356210253144244f22e833a347c3ef4411fee9a215ee9423ed6a1bd7b32d5","observation_id":"dae79af5-b80a-4199-8116-20bd3ce75789","resolution":{"observed_at":"2026-08-06T19:50:16.324991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.490217Z","title":"Audio set: An ontology and human- labeled dataset for audio events","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.490217Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8fbfe7f6e141cc3c3c0dadae3a743383faf8db82a83309aac5a646a3a7c6f343","observation_id":"d9b07949-7982-4622-b307-34c03a5d24c0","resolution":{"observed_at":"2026-08-06T19:50:16.490217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08356","last_updated":"2023-05-31T04:53:11Z","snapshot_observed_at":"2026-07-06T13:21:42.630863Z","submitted_at":"2022-06-16T17:57:01Z","title":"OmniMAE: Single Model Masked Pretraining on Images and Videos","version":2},"cited_work":{"arxiv_id":"2206.08356","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08356","snapshot_observed_at":"2026-08-06T19:50:26.208474Z","title":"OmniMAE: Single Model Masked Pretraining on Images and Videos","venue":"cs.CV","work_id":"b40ace85-c248-4a2c-9cb0-0297eae31e31","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.598120Z"},"links":{"cited_paper":"/paper/2206.08356","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b929a644dca2b2545a5910a8d22638abeeb555fbcbf790756f9990bf61203e06","observation_id":"932aad78-8e47-4db1-aeef-9cf77236476d","resolution":{"observed_at":"2026-08-06T19:50:26.285243Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:16.711982Z","title":"Omni- vore: A single model for many visual modalities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.711982Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9e789a6000582193f2dbc82f7ca875b60f31b08567e234e84e241bb424fd254e","observation_id":"f09ffe82-9b83-4d02-aef9-ae2198364411","resolution":{"observed_at":"2026-08-06T19:50:16.711982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.12237","last_updated":"2019-11-29T09:55:22Z","snapshot_observed_at":"2026-08-06T13:50:27.106878Z","submitted_at":"2019-11-27T15:54:55Z","title":"SAMSum Corpus: A Human-annotated Dialogue Dataset for Abstractive Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.12237","snapshot_observed_at":"2026-08-06T19:50:16.915486Z","title":"Samsum corpus: A human-annotated dia- logue dataset for abstractive summarization","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:16.915486Z"},"links":{"cited_paper":"/paper/1911.12237","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:5452eabac3f0d352a0fa9ad7c74d653140dc8913a82a5f1a5a686dc07ca43c55","observation_id":"475ea48a-1140-4d20-9ed5-3805e5e0fc1e","resolution":{"observed_at":"2026-08-06T19:50:16.915486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-03T23:00:35.904734Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-06T19:50:17.039560Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.039560Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:cd9c0f4499e7654b5b712445cb1b15df67794f15debcaf7c5b9fbf343eca63de","observation_id":"c5ee46f4-7d1b-482f-8cad-1e106d61c0a3","resolution":{"observed_at":"2026-08-06T19:50:17.039560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.202842Z","title":"Uavm: Towards unifying audio and visual models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.202842Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:3ff2d9be6bb518e751b4ff1dca708ac428386e16da00c98468584fbd5c354ac1","observation_id":"e59a712b-21b1-4fb7-81b0-22fb95d4f43f","resolution":{"observed_at":"2026-08-06T19:50:17.202842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.322899Z","title":"The” something something” video database for learning and evaluating visual common sense","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.322899Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:baa733edc25cad3712d0fca83e91b2d5f35d0b87694aefd2b8ede44490f9a80f","observation_id":"1ef8eb6e-cdb5-41bb-9fbe-0567c56ac70e","resolution":{"observed_at":"2026-08-06T19:50:17.322899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.420096Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.420096Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f3bb5f4e29a821e7e791cf79847e043612e90212b320ca218c6f9ae21c49b78d","observation_id":"4684aabb-05a1-438c-b075-9b2859961c47","resolution":{"observed_at":"2026-08-06T19:50:17.420096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.507498Z","title":"Dynamic task prioritization for multitask learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.507498Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:55443a91df9d931da0d391b21a6ed1c390819a25e1c42cf6ac1b5f9f9bee200d","observation_id":"718fe2f5-fe32-4d5c-84fc-5ac5709e6bdf","resolution":{"observed_at":"2026-08-06T19:50:17.507498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-06T15:17:09.454528Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-06T19:50:17.617134Z","title":"Maskvit: Masked vi- sual pre-training for video prediction","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.617134Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:32bbe925888fd7cf9b6b5a3723e9e9ded9dd4f1da38d7ee77067476ca6c33204","observation_id":"87e16809-6d0e-4eda-b546-ff98c30ed626","resolution":{"observed_at":"2026-08-06T19:50:17.617134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.712917Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.712917Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:7aaf7c19bf8ace8c0bc6d4ca0fa152f4cc12ae5417025c5d285f80aca646909e","observation_id":"e0b9e3d5-d3ef-4db0-92b5-c89935dbf407","resolution":{"observed_at":"2026-08-06T19:50:17.712917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-06T19:50:17.826839Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.826839Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:567488fa73aa88ab0bb1a25c93a6b4314819ea30336546afd9756a7d2eb5b864","observation_id":"0a79934a-741c-4e41-b197-0f059c137274","resolution":{"observed_at":"2026-08-06T19:50:17.826839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:17.932549Z","title":"Spectral- former: Rethinking hyperspectral image classification with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:17.932549Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:70030b611f7cfaa62e55a7549372d0df3c0afab989fa371834c4ee5cd3c56784","observation_id":"1f89a59d-b2a3-4f03-bbb4-dad5dfd4add6","resolution":{"observed_at":"2026-08-06T19:50:17.932549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.021377Z","title":"Unit: Multimodal multitask learning with a unified transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.021377Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b1e733637b4f9dd27158be4d1ad39351aa8510adeb5a8213b4006c2c147dc828","observation_id":"621186a5-ba8c-416d-8ff9-bd93cdde9a52","resolution":{"observed_at":"2026-08-06T19:50:18.021377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.09430","last_updated":"2021-10-20T22:40:40Z","snapshot_observed_at":"2026-08-06T03:47:37.849087Z","submitted_at":"2021-03-17T04:08:03Z","title":"OGB-LSC: A Large-Scale Challenge for Machine Learning on Graphs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.09430","snapshot_observed_at":"2026-08-06T19:50:18.119583Z","title":"Ogb-lsc: A large-scale challenge for machine learning on graphs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.119583Z"},"links":{"cited_paper":"/paper/2103.09430","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e09210b91aa591e8956523bdac34bfde14a7b9a0952b992ca12e27309cec6a78","observation_id":"84660675-7b4b-4f5c-82f4-da2d19e23c2c","resolution":{"observed_at":"2026-08-06T19:50:18.119583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14795","last_updated":"2022-03-15T22:37:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-30T17:53:34Z","title":"Perceiver IO: A General Architecture for Structured Inputs & Outputs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14795","snapshot_observed_at":"2026-08-06T19:50:18.251387Z","title":"Perceiver io: A general architec- ture for structured inputs & outputs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.251387Z"},"links":{"cited_paper":"/paper/2107.14795","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:02108de05bf86b243aa4aecc6a56c33422643c3f0700e7d86f4b5af6708e9260","observation_id":"342a32dc-600d-4380-a433-3c3e8138eded","resolution":{"observed_at":"2026-08-06T19:50:18.251387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.379108Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.379108Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8899cd8942ecd1e0c784297b4c33eaf57794e1d752878c2151a1c10e7e470ae2","observation_id":"a5d0eb73-3086-4f59-aead-67f1a0556924","resolution":{"observed_at":"2026-08-06T19:50:18.379108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.514139Z","title":"A review of multimodal image matching: Methods and applications","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.514139Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f00c3e5d870eb245fc4c1cf0b1c9ba5209eee4a658424ef29cc1a8724a350bbf","observation_id":"9d9f546e-fc24-4b2c-89fc-3a190f2f92bb","resolution":{"observed_at":"2026-08-06T19:50:18.514139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05137","last_updated":"2017-06-16T03:10:03Z","snapshot_observed_at":"2026-08-04T13:02:46.926323Z","submitted_at":"2017-06-16T03:10:03Z","title":"One Model To Learn Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.05137","snapshot_observed_at":"2026-08-06T19:50:18.598502Z","title":"One model to learn them all","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.598502Z"},"links":{"cited_paper":"/paper/1706.05137","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8c774440cc89a59ea16b6c427be93766945af947f0ed9fe0009985fe8af671d2","observation_id":"9cd1fe4c-4482-434f-b3e5-f327b37fc8f1","resolution":{"observed_at":"2026-08-06T19:50:18.598502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-07-06T05:43:22.028213Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-08-06T19:50:18.711195Z","title":"The kinetics human action video dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.711195Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:c0e3c3c7163baf6c36996bd5f5337dff5fa51b4173a9a2b72be748e46af554eb","observation_id":"2c9ea7e5-0131-4774-9b13-11500b736714","resolution":{"observed_at":"2026-08-06T19:50:18.711195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00930","last_updated":"2022-09-02T10:08:28Z","snapshot_observed_at":"2026-07-30T22:24:39.228425Z","submitted_at":"2022-09-02T10:08:28Z","title":"Mind the Gap! Injecting Commonsense Knowledge for Abstractive Dialogue Summarization","version":1},"cited_work":{"arxiv_id":"2209.00930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.00930","snapshot_observed_at":"2026-08-06T19:50:25.884969Z","title":"Mind the Gap! Injecting Commonsense Knowledge for Abstractive Dialogue Summarization","venue":"cs.CL","work_id":"7ab7cb15-1f15-4ccc-a69e-307a4bd0d738","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.839182Z"},"links":{"cited_paper":"/paper/2209.00930","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d8db56a12f85f54db87013265981a2e8e4239c7331e7cc73fb1c643452a6e5fd","observation_id":"30d3f7e6-cc88-430e-8730-dc40862b5df6","resolution":{"observed_at":"2026-08-06T19:50:25.963938Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:18.937345Z","title":"Re- former: The efficient transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:18.937345Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9618df1cf0f4e78cb364e385a446414a5b4887e5f3b31600951aecae16e22712","observation_id":"0b31472a-8eda-49b8-9476-252fb415548f","resolution":{"observed_at":"2026-08-06T19:50:18.937345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:19.051884Z","title":"Hmdb: a large video database for human motion recognition","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.051884Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:0517862d01b801e2fc1433987bd9440e5d028ba440e0200668840a1c8c710790","observation_id":"e7b145c0-c1a0-4ea9-b71c-f24d22135333","resolution":{"observed_at":"2026-08-06T19:50:19.051884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:19.166703Z","title":"Modeling long-and short-term temporal patterns with deep neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.166703Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:53502b38a7c27410eadb7ed61b1e92583c7066241457afd2fd43d1caaad4f50e","observation_id":"1345fdee-e667-447e-8af6-ab88c4dd7d26","resolution":{"observed_at":"2026-08-06T19:50:19.166703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:19.290419Z","title":"Stratified trans- former for 3d point cloud segmentation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.290419Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d4fb006b055f7cc0760ab9281e95005b4d43b38552f376845f19e062ebf9737e","observation_id":"2b5de6d7-497d-47c5-9c91-c72f11041bf1","resolution":{"observed_at":"2026-08-06T19:50:19.290419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:32.232989Z","title":"Regu- larization strategy for point cloud via rigidly mixed sample","venue":null,"work_id":"8bf5f4fe-f34c-4a1a-bafd-5492f9fea05f","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.428323Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ac7b1cf554ae3884c57f3c724868ef269985b47c21fa6338098f511b5ad5ff9f","observation_id":"6230888b-edf8-4947-8121-8823afc854e5","resolution":{"observed_at":"2026-08-06T19:50:32.311366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:32.216266Z","title":"Uni-perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":"a6f65758-6e4d-4945-94f3-64c00ac3e98e","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.541910Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9309560a56b453ab44ca3114ee07d07328f6cdcb7e447eb06ebeae2f9d335ee1","observation_id":"1d5913ce-11ba-4c0d-8c9e-28202a97a75c","resolution":{"observed_at":"2026-08-06T19:50:32.222632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09552","last_updated":"2022-11-17T14:17:40Z","snapshot_observed_at":"2026-08-07T04:39:25.258902Z","submitted_at":"2022-11-17T14:17:40Z","title":"UniFormerV2: Spatiotemporal Learning by Arming Image ViTs with Video UniFormer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09552","snapshot_observed_at":"2026-08-06T19:50:19.646948Z","title":"Uniformerv2: Spatiotemporal learning by arming image vits with video uniformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.646948Z"},"links":{"cited_paper":"/paper/2211.09552","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:daa81614e46edf46727e3a65dd3d3b8a6bc332a696cbd4dabf63ba21b78de573","observation_id":"f1a474c0-6c44-45d3-9420-44286c7b83b3","resolution":{"observed_at":"2026-08-06T19:50:19.646948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.996835Z","title":"Enhancing the locality and breaking the memory bottleneck of transformer on time series forecasting","venue":null,"work_id":"caf738a1-98b7-4c9d-95ac-42d31f9d8117","year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.768028Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:238e6b7c65c711f90198b7e1ff4a986629e42ba10e0cff44746ecd5c85c311c7","observation_id":"941ae255-0a70-4627-8651-0196319e1ce4","resolution":{"observed_at":"2026-08-06T19:50:32.074110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02053","last_updated":"2022-10-19T20:39:13Z","snapshot_observed_at":"2026-08-04T04:38:21.674548Z","submitted_at":"2022-03-03T22:53:54Z","title":"Mind the Gap: Understanding the Modality Gap in Multi-modal Contrastive Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02053","snapshot_observed_at":"2026-08-06T19:50:19.855755Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.855755Z"},"links":{"cited_paper":"/paper/2203.02053","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2c09d8dcb2a90617475ab232a9e3fbd604f6aaba7182b507d925866f297ba6a3","observation_id":"9a8f0407-498c-4677-afa6-5800b0e5c46b","resolution":{"observed_at":"2026-08-06T19:50:19.855755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.779084Z","title":"Belongie, James Hays, Pietro Perona, Deva Ramanan, Piotr Doll ´ar, and C","venue":null,"work_id":"53906636-999d-4b2f-b96e-e6d938046bc0","year":2014},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:19.953525Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:cd37340334359db400c8cc0d0db0aed1abe34bf4469fc3115feb247446be8910","observation_id":"df00d131-ea42-45f1-bd8c-76ec203b2e1c","resolution":{"observed_at":"2026-08-06T19:50:31.892880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.00249","last_updated":"2021-07-06T03:18:27Z","snapshot_observed_at":"2026-08-04T02:46:51.272119Z","submitted_at":"2021-07-01T06:59:44Z","title":"OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2107.00249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.00249","snapshot_observed_at":"2026-08-06T19:50:25.696245Z","title":"OPT: Omni-Perception Pre-Trainer for Cross-Modal Understanding and Generation","venue":"cs.CV","work_id":"15529c78-9434-4436-99cf-48b3ecea8821","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.051811Z"},"links":{"cited_paper":"/paper/2107.00249","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:255b25bd8ec101b075e87d5bbf1993664d491192bcaf8e5935a7e9812b51a594","observation_id":"56008d9f-43a8-4667-b043-2ab6eeb4e977","resolution":{"observed_at":"2026-08-06T19:50:25.761552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.591767Z","title":"Pyraformer: Low- complexity pyramidal attention for long-range time series modeling and forecasting","venue":null,"work_id":"945f16cb-8309-4ee8-aa5e-2c78c5f8e175","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.168295Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:de7911f482a08ca598b5b8f24b0ad973989b775ea1292e15e22d325baedf2426","observation_id":"8f652af2-877d-4b29-90cc-df16bbcac204","resolution":{"observed_at":"2026-08-06T19:50:31.679062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T19:50:20.304795Z","title":"Roberta: A ro- bustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.304795Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:e938d292b4468a4aa7e60cd706ebbfebc7eea9083816785d189b31a177a28b65","observation_id":"08f78ae6-58ba-42ce-b471-ac7950235867","resolution":{"observed_at":"2026-08-06T19:50:20.304795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.492038Z","title":"Moments in time dataset: one million videos for event understanding","venue":null,"work_id":"4ba07b5a-1fc4-4f11-b362-78cd76f01b54","year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.398454Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:01051ef09fe30c7939383b9aad0c1811169f4611ae03ead98494b0fb6561b424","observation_id":"194acbc9-711a-48bb-9adc-f519ce36393a","resolution":{"observed_at":"2026-08-06T19:50:31.539943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.387622Z","title":"Person recognition system based on a combination of body images from visible light and thermal cameras","venue":null,"work_id":"a7f1057c-1596-49b0-93a5-83c638d4bf16","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.525721Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:67b997818e27cf24fa055322aa2f745e7a3f82fc2dc70bf379ed949f5c2d964f","observation_id":"43b4d318-5029-4061-b742-6bc3205a9dad","resolution":{"observed_at":"2026-08-06T19:50:31.423488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10437","last_updated":"2020-02-20T21:08:57Z","snapshot_observed_at":"2026-08-06T09:33:52.442294Z","submitted_at":"2019-05-24T20:28:57Z","title":"N-BEATS: Neural basis expansion analysis for interpretable time series forecasting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10437","snapshot_observed_at":"2026-08-06T19:50:20.661670Z","title":"N-beats: Neural basis expansion analy- sis for interpretable time series forecasting","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.661670Z"},"links":{"cited_paper":"/paper/1905.10437","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:13ecee2c4c2fdc92fcc2beea37aa81800efb4e6ec08fc1c061ac172a4182b8d3","observation_id":"43fa27db-de94-4685-827b-56ae6cb30588","resolution":{"observed_at":"2026-08-06T19:50:20.661670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:20.767129Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.767129Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9fea98d46cf5705fffea35de06d9fd58a419661398a9683f582e2a3360b95d9b","observation_id":"60e8e3d8-5162-4883-a951-b6a1b9b0e488","resolution":{"observed_at":"2026-08-06T19:50:20.767129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.257080Z","title":"Esc: Dataset for environmental sound clas- sification","venue":null,"work_id":"550b5408-b140-4575-a637-e339f76699fc","year":2015},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.883668Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:889edef4a20791ca647232e58ae009e146bdd0aec8cd0e6337de89b8f6d3464a","observation_id":"ed785505-9347-4868-91d0-3a3ae50cc0af","resolution":{"observed_at":"2026-08-06T19:50:31.311763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.123699Z","title":"Re- thinking video vits: Sparse video tubes for joint image and video learning","venue":null,"work_id":"59334ea8-616d-443c-b6d7-39e525085116","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:20.990939Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:859e87cf07dc565c745a0ad13d40c157546b6f4fc344688af189afb0ce4567ce","observation_id":"6b0d0f90-f56e-4ab7-8257-a0b3f156ec28","resolution":{"observed_at":"2026-08-06T19:50:31.184763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07804","last_updated":"2020-07-03T09:59:06Z","snapshot_observed_at":"2026-08-02T14:05:53.425649Z","submitted_at":"2019-07-17T22:59:56Z","title":"OmniNet: A unified architecture for multi-modal multi-task learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.07804","snapshot_observed_at":"2026-08-06T19:50:21.121011Z","title":"Omninet: A unified architecture for multi-modal multi-task learning","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.121011Z"},"links":{"cited_paper":"/paper/1907.07804","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9de5fd209c5410b92f0c67c715d4a83b2b402084c7ba81dd340e7eef05252a08","observation_id":"8a5f51c5-9667-473c-9240-5e22df4fd717","resolution":{"observed_at":"2026-08-06T19:50:21.121011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:31.009598Z","title":"Point- net++: Deep hierarchical feature learning on point sets in a metric space","venue":null,"work_id":"b7d24905-a001-4d1d-8e08-1df5256c2278","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.235366Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ef2e05871382aa3082876c8ee71da2a985d670cface60822e1296b3b3de26764","observation_id":"960b3122-f46a-4655-8e8c-c6780eec6014","resolution":{"observed_at":"2026-08-06T19:50:31.040826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:21.380262Z","title":"Improving language understanding by gen- erative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.380262Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f6411b8219d4fb58c077e21be36d124303fcbe6ffa96133af1af126173983941","observation_id":"85a502b9-ace2-44b5-b02a-a1445bda232b","resolution":{"observed_at":"2026-08-06T19:50:21.380262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.904897Z","title":"Reliable tuberculosis de- tection using chest x-ray with deep learning, segmentation and visualization","venue":null,"work_id":"68b6e51a-63e2-4a1b-908b-822d718b9db5","year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.519423Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:a8ca2b1735267489314f93db57f9d6444c8027238495087251df45feddbb4ac0","observation_id":"cebe27b6-d809-402e-aa63-1b51e2012ace","resolution":{"observed_at":"2026-08-06T19:50:30.946155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.09595","last_updated":"2023-02-22T18:58:10Z","snapshot_observed_at":"2026-08-04T16:23:13.264745Z","submitted_at":"2023-01-23T17:51:39Z","title":"Zorro: the masked multimodal transformer","version":2},"cited_work":{"arxiv_id":"2301.09595","doi":null,"metadata_source":"pith","pith_arxiv_id":"2301.09595","snapshot_observed_at":"2026-08-06T19:50:25.489215Z","title":"Zorro: the masked multimodal transformer","venue":"cs.CV","work_id":"9bd4d807-f1c0-4108-a9b9-01250a2f893d","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.672452Z"},"links":{"cited_paper":"/paper/2301.09595","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ab0837cf8c6797c3c13fdbccb863bc00b1cdec9d79d37f7c41eb3fa04a17205f","observation_id":"5f88d135-92c1-4203-823c-dee0e0d6a492","resolution":{"observed_at":"2026-08-06T19:50:25.551900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.767705Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"86892b2f-600a-41b0-a29a-03510e6db373","year":2012},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.776607Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:079fb23096ff0a430374e1aa3665f6f7fbca7a1d145d3e8cbc2bfb4a34f11ab3","observation_id":"3f24eccf-3cc9-461e-a080-e9ab0c57190f","resolution":{"observed_at":"2026-08-06T19:50:30.817984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.646771Z","title":"Mpnet: Masked and permuted pre-training for lan- guage understanding","venue":null,"work_id":"cce18883-4dd0-44bb-aeba-441a91dea6ce","year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.861378Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:691417e6727b53e85a9dc3aa3c2ecb7f868491e4203be9387be3ab3e5ae76615","observation_id":"21993166-f068-41a5-84ad-b57e3fca20bc","resolution":{"observed_at":"2026-08-06T19:50:30.698263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.524609Z","title":"Sun rgb-d: A rgb-d scene understanding benchmark suite","venue":null,"work_id":"05a4c9b8-8eb2-441d-a615-cf6561c72ccc","year":2015},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:21.997522Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:91d97790df3091da2500e399b13fd1975130ff307fafa2b411cbbd6d510ed62a","observation_id":"9a540032-3568-429f-af77-4e6fe5f3d6a0","resolution":{"observed_at":"2026-08-06T19:50:30.580490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-06T19:50:22.073655Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.073655Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:a3204e46418d72738916d34fc1f790a40023352651e529a5b3f3c06be4e276e8","observation_id":"f8a1fc2e-e727-48e9-b9d7-b1eae07b61c2","resolution":{"observed_at":"2026-08-06T19:50:22.073655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05709","last_updated":"2023-11-07T14:00:09Z","snapshot_observed_at":"2026-08-02T23:54:45.966009Z","submitted_at":"2023-11-07T14:00:09Z","title":"OmniVec: Learning robust representations with cross modal sharing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05709","snapshot_observed_at":"2026-08-06T19:50:22.147490Z","title":"Omnivec: Learn- ing robust representations with cross modal sharing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.147490Z"},"links":{"cited_paper":"/paper/2311.05709","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:fc4a2e4d5bb042bb4ea3afd5c14db5ee11f613654aeb8082bf578f487210c808","observation_id":"3fed73df-e32b-4259-aa76-b7be8cddd991","resolution":{"observed_at":"2026-08-06T19:50:22.147490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.414961Z","title":"Hierarchical multi-task learning via task affin- ity groupings","venue":null,"work_id":"ca04e506-afdb-4ee2-8a8b-530b25522693","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.210014Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:34675e531abc2448756abfc85f7811681b5cc6009651d302d713c6be68e762d4","observation_id":"8049192c-b68b-414c-a96b-c586b6cd28ba","resolution":{"observed_at":"2026-08-06T19:50:30.455919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12296","last_updated":"2022-01-28T18:01:42Z","snapshot_observed_at":"2026-07-06T12:32:20.389256Z","submitted_at":"2022-01-28T18:01:42Z","title":"Benchmarking Robustness of 3D Point Cloud Recognition Against Common Corruptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12296","snapshot_observed_at":"2026-08-06T19:50:22.270903Z","title":"Benchmarking ro- bustness of 3d point cloud recognition against common cor- ruptions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.270903Z"},"links":{"cited_paper":"/paper/2201.12296","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ffedfaa8b41899b8e06754fe401f8e8f3cb78c418d6437eb9b85b347d5d29d04","observation_id":"f3edae28-32b7-4164-8523-4d5b73918175","resolution":{"observed_at":"2026-08-06T19:50:22.270903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:22.333424Z","title":"Efficientnet: Rethinking model scaling for convolutional neural networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.333424Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:dbff9e0b17d97f2d335dd0b0e80d68aab07163e759a1e82545ad8f592d573956","observation_id":"edf6e8df-359f-4bad-8d02-a2c8f3fbc02c","resolution":{"observed_at":"2026-08-06T19:50:22.333424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.229608Z","title":"Contrastive boundary learning for point cloud segmentation","venue":null,"work_id":"fcab4911-e0d4-4766-8592-4d7e0041acdb","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.389608Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2b12e1bb161db247ef6b2d4298e16211f8d23516e3fe39ad31bc325abe2bfd79","observation_id":"c367eb61-daef-4882-96a4-71cc92cb0c7f","resolution":{"observed_at":"2026-08-06T19:50:30.308893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:30.064292Z","title":"Small sample hyper- spectral image classification based on the random patches network and recursive filtering","venue":null,"work_id":"b3a81333-bf40-4f6e-abc0-2ddee36408b9","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.462428Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:94b3869b15ec592b45cc3ca02af36dad5f16c462788e69a6a06be9e1b4beb81f","observation_id":"3271b91b-af12-4545-bb64-f5f2e23434bb","resolution":{"observed_at":"2026-08-06T19:50:30.150417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.873033Z","title":"Revisiting point cloud classification: A new benchmark dataset and classification model on real-world data","venue":null,"work_id":"8c8e1463-f303-4f51-b7de-c06bc21a2d22","year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.537912Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:367a6ee3e2dc03d59bd01ccb21eb50709485c1feec0b7e33799d57d75c64f7c1","observation_id":"f1b25de1-73cf-4f19-b089-6357805ff965","resolution":{"observed_at":"2026-08-06T19:50:29.959279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.710987Z","title":"The inaturalist species classification and detection dataset","venue":null,"work_id":"c2eb5e31-9bbb-4c01-af37-0139d68b23af","year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.632705Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8004c1618a3aa15943b813c8c84326f16397d38d679942d23fdccd4024fedb52","observation_id":"327fdeff-ef5c-489b-9c7f-53dee17d507c","resolution":{"observed_at":"2026-08-06T19:50:29.779706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.576026Z","title":"Attention is all you need","venue":null,"work_id":"ad6dbc20-8360-40bc-8b9c-e0d529b750dc","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.716235Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:6823021f8e21ca0ed163479551879dbfcd6ee8ce20825b039647f2ae8a8dd85e","observation_id":"b6988d14-15b5-46a2-98e9-f821a035c5a3","resolution":{"observed_at":"2026-08-06T19:50:29.627959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.367786Z","title":"Internimage: Exploring large-scale vi- sion foundation models with deformable convolutions","venue":null,"work_id":"0733524c-5e33-4767-beb2-05d05dfb060b","year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.775789Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d9c0e3a1dfd9c6381ebe518c412aa12d6aeebc3c9b3a5f30e945879644b73d8b","observation_id":"11b94fd8-c192-4958-8fbc-4900b5be83e0","resolution":{"observed_at":"2026-08-06T19:50:29.467629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-06T19:50:22.840001Z","title":"Internvideo: General video foundation models via generative and discriminative learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.840001Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:08595a391aa89a976040a6d1b91aea55567911bf49ad3f1978859f2d9d383c9c","observation_id":"90af2435-5042-4201-ad4c-2e1abd6c5506","resolution":{"observed_at":"2026-08-06T19:50:22.840001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.170157Z","title":"Masked feature pre- diction for self-supervised visual pre-training","venue":null,"work_id":"8b2879eb-b997-41bc-9b6b-b8a79d487ffa","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.894679Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d7f12ad71b78212b4958bc0815cea14c08fc7b2daaad7c4a8ba1e507c9d6f0bc","observation_id":"f9b85ae5-edfd-4db3-9b20-6bd5903666be","resolution":{"observed_at":"2026-08-06T19:50:29.260075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:29.022844Z","title":"Syn- cretic modality collaborative learning for visible infrared person re-identification","venue":null,"work_id":"3ae56cda-3d02-47e1-97db-4a86c50ee3c0","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.941403Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b659399d267cddfe71df1d66bd23bb64024643bd03fc13ebe037f52136f5cd9a","observation_id":"349ba8bd-f659-4ebf-8a76-276997f08069","resolution":{"observed_at":"2026-08-06T19:50:29.084751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.14064","last_updated":"2021-06-03T05:16:05Z","snapshot_observed_at":"2026-07-06T11:13:48.672772Z","submitted_at":"2021-05-28T19:05:36Z","title":"Controllable Abstractive Dialogue Summarization with Sketch Supervision","version":2},"cited_work":{"arxiv_id":"2105.14064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2105.14064","snapshot_observed_at":"2026-08-06T19:50:25.267028Z","title":"Controllable Abstractive Dialogue Summarization with Sketch Supervision","venue":"cs.CL","work_id":"da08dfc9-35ff-4913-8f38-e232778e6eae","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:22.994077Z"},"links":{"cited_paper":"/paper/2105.14064","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:2b5fa1b1b1706048d49b7375511a07ce275be2060c70703b73a27322d34ef049","observation_id":"0d42cd48-9c56-4dc2-846e-3514925e8c9a","resolution":{"observed_at":"2026-08-06T19:50:25.321727Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.881491Z","title":"Tinyvit: Fast pretraining distillation for small vision transformers","venue":null,"work_id":"f23aab64-32dc-40c5-9b83-fffdd8804382","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.044939Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:aecdc82fa31bf446b1edc7667d35de1afa5d67dc41b4596e9be00fb1332a85c7","observation_id":"cecf0c2d-d737-4047-a8ac-88955a12dafb","resolution":{"observed_at":"2026-08-06T19:50:28.942665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.727123Z","title":"Point transformer v2: Grouped vector at- tention and partition-based pooling","venue":null,"work_id":"c2272ca4-39e4-48ed-bddb-f38aec5ccf4d","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.101262Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:4c55fafdcffbdb2554c5c6b46cf2ae5a4a0d5a5c9b58fba400a59007cd36c321","observation_id":"825288bf-78c8-4094-8cf0-1eaa9b17c048","resolution":{"observed_at":"2026-08-06T19:50:28.793382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.544354Z","title":"3d shapenets: A deep representation for volumetric shapes","venue":null,"work_id":"c4839d20-283a-45de-a341-eb747f1c190c","year":1912},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.180431Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:0de5285e9900738014a9f6ff2f8fcb438685b7268c7bf2241dde0f92510642b6","observation_id":"4c15fc0b-37a7-42c0-a0ca-8f888624e3ab","resolution":{"observed_at":"2026-08-06T19:50:28.654139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08740","last_updated":"2020-03-09T00:50:19Z","snapshot_observed_at":"2026-07-06T08:52:26.716343Z","submitted_at":"2020-01-23T18:59:46Z","title":"Audiovisual SlowFast Networks for Video Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08740","snapshot_observed_at":"2026-08-06T19:50:23.240129Z","title":"Audiovisual slow- fast networks for video recognition","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.240129Z"},"links":{"cited_paper":"/paper/2001.08740","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:f56428c462ad2231832de512cb0225f3631fc867718a2314cafb3813233d7d47","observation_id":"d4f48735-2087-4877-8af9-04073b46d0bd","resolution":{"observed_at":"2026-08-06T19:50:23.240129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.408612Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"01d02f46-361c-449d-931e-228ef64b4d31","year":2016},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.286212Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b23d29a00d2ae43dffec6cc87ae2f2fa2eb919caae49e382e91ecacf626a6036","observation_id":"bfb374f0-7601-4427-96df-5ee5faf71b0e","resolution":{"observed_at":"2026-08-06T19:50:28.456028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.06488","last_updated":"2023-05-10T02:11:30Z","snapshot_observed_at":"2026-07-06T13:20:25.108583Z","submitted_at":"2022-06-13T21:36:09Z","title":"Multimodal Learning with Transformers: A Survey","version":2},"cited_work":{"arxiv_id":"2206.06488","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.06488","snapshot_observed_at":"2026-08-06T19:50:25.087857Z","title":"Multimodal Learning with Transformers: A Survey","venue":"cs.CV","work_id":"a1ffde19-7e46-4110-ba53-2267b43f8aae","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.399732Z"},"links":{"cited_paper":"/paper/2206.06488","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:72abe1da89f604fb99d572fd84140d2a9f955beddf759ac81f11125843c96719","observation_id":"e0c2cd51-f150-447c-a73f-a643a7c81994","resolution":{"observed_at":"2026-08-06T19:50:25.148397Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.265471Z","title":"Multi-modal masked pre-training for monocular panoramic depth completion","venue":null,"work_id":"79202fe3-7057-4123-9a3a-ca728ff6ab77","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.499703Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:8154734f550c626c62ab9509f834b8bc33cf298d4be739379b72556fa45189d8","observation_id":"cfa2cd38-10c1-42a4-8f1e-7a24a37a3490","resolution":{"observed_at":"2026-08-06T19:50:28.330526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06906","last_updated":"2023-08-16T01:53:02Z","snapshot_observed_at":"2026-07-06T15:15:34.051890Z","submitted_at":"2023-04-14T02:49:08Z","title":"Swin3D: A Pretrained Transformer Backbone for 3D Indoor Scene Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06906","snapshot_observed_at":"2026-08-06T19:50:23.580652Z","title":"Swin3d: A pretrained transformer backbone for 3d indoor scene understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.580652Z"},"links":{"cited_paper":"/paper/2304.06906","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:22c7b520f2d0d5f85f822a97847f36aad3b53d4e7ce0d03766b36c6ec99ca4d3","observation_id":"f955fc72-ae65-4e44-bf53-cb3a6af81b53","resolution":{"observed_at":"2026-08-06T19:50:23.580652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-06T19:50:23.682264Z","title":"generalized autoregressive pretraining for language understanding; 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.682264Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b024594cd49fad25be9e66edbcbf09b24d9bb86999864c1b487bbb8e6e6ac77c","observation_id":"b008ece1-7827-4814-802a-93820de787d8","resolution":{"observed_at":"2026-08-06T19:50:23.682264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04193","last_updated":"2021-01-06T03:17:49Z","snapshot_observed_at":"2026-07-06T08:50:04.247396Z","submitted_at":"2020-01-13T12:49:22Z","title":"Deep Learning for Person Re-identification: A Survey and Outlook","version":2},"cited_work":{"arxiv_id":"2001.04193","doi":null,"metadata_source":"pith","pith_arxiv_id":"2001.04193","snapshot_observed_at":"2026-08-06T19:50:24.889369Z","title":"Deep Learning for Person Re-identification: A Survey and Outlook","venue":"cs.CV","work_id":"e5255a80-dfba-4e2a-9a7e-cb2deefdc9e0","year":2020},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.740334Z"},"links":{"cited_paper":"/paper/2001.04193","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:5b4665c061776eb32507385866955489d6d043cbbdbe3ee961f8020d92ac67c1","observation_id":"25e42e8f-0a25-4e26-a6fa-ea9b67d18dbd","resolution":{"observed_at":"2026-08-06T19:50:24.969127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:28.121162Z","title":"Do transformers really perform badly for graph representation? In Thirty-Fifth Conference on Neural Information Process- ing Systems, 2021","venue":null,"work_id":"d8f55edc-25cd-4070-b4cf-be3949249ae7","year":2021},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.790277Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:b25be5c0e86d953d9077f629de8c0fb20a8ebc0540822a37a578df5e25286d40","observation_id":"240ad846-4d80-4e93-a896-f29ed0221efb","resolution":{"observed_at":"2026-08-06T19:50:28.189988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T19:50:23.861350Z","title":"Coca: Con- trastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.861350Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:9ed18218f45e345c4f1647a9ab24cbe0fca9fd733d848babf5920a26d6191038","observation_id":"7aceffcd-fbf6-4549-99b2-da442e37cdde","resolution":{"observed_at":"2026-08-06T19:50:23.861350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.976854Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":"a20a2c35-2a29-42fa-93be-a84ac2597d7a","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.921175Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:d8c5560e7eaa36d45b895ecbd025a93dfa928a90be30951f184d9f2734ea3859","observation_id":"e1e514a6-2fda-4a17-8cac-dda7c93bbe04","resolution":{"observed_at":"2026-08-06T19:50:28.047216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.848705Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling","venue":null,"work_id":"796f9dcf-2e4c-46e6-9772-f1c08275af87","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:23.991722Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:0f56fdd95079e6829471d9ca8cb0bd6d765fcf9cb7e937b5d6aefcb128984b57","observation_id":"b4baed03-004d-4915-9ad5-4c3216d2b102","resolution":{"observed_at":"2026-08-06T19:50:27.928246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00598","last_updated":"2022-05-27T17:52:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-01T17:43:13Z","title":"Socratic Models: Composing Zero-Shot Multimodal Reasoning with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00598","snapshot_observed_at":"2026-08-06T19:50:24.066566Z","title":"So- cratic models: Composing zero-shot multimodal reasoning with language","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.066566Z"},"links":{"cited_paper":"/paper/2204.00598","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ed6a85bf98c69491195a988d0f6845654dba87f324f4b45efea8d34410d35840","observation_id":"4ffff764-3d5f-4d5f-8564-951c54b457e6","resolution":{"observed_at":"2026-08-06T19:50:24.066566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.644670Z","title":"Point- cutmix: Regularization strategy for point cloud classifica- tion","venue":null,"work_id":"c1523be8-5592-4f9b-9f6b-04b59e4af985","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.114385Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:bfbf2dce541bad89229ddf9c222b4a266c98e1d01dbc67ba658b355ba0695d85","observation_id":"b2ebe9a9-9854-4749-93c2-f4b57288dbc8","resolution":{"observed_at":"2026-08-06T19:50:27.750612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.570095Z","title":"An overview of multi-task learning","venue":null,"work_id":"6b282e03-ec4c-4ba1-a914-77d738de7fac","year":2018},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.164336Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:771e0f2e005459c620dd33f3599ed5a729ec81b47eb190d805843ba1cc6114ca","observation_id":"521fa700-e1e6-4b00-8163-3c2a9f01e95c","resolution":{"observed_at":"2026-08-06T19:50:27.594862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.468124Z","title":"Modality synergy complement learning with cascaded aggregation for visible-infrared person re- identification","venue":null,"work_id":"cfe87bc0-dbdd-4938-ab83-26e9d4cb991a","year":2022},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.215744Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:ebc244a9b47ce7ec200aa21db355ed8860e31ab45ab46e57fd68343b111dd625","observation_id":"3953969f-63e7-4d49-91f8-48982b077969","resolution":{"observed_at":"2026-08-06T19:50:27.512561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-07-06T15:56:25.975005Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-06T19:50:24.267156Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.267156Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:42a25a0835c622532b5cb3562d9956e2209286f810072abdc1899756a35004fb","observation_id":"af7aa99d-b892-47ac-a506-e0154c640fe8","resolution":{"observed_at":"2026-08-06T19:50:24.267156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:27.299998Z","title":"Places: A 10 million image database for scene recognition","venue":null,"work_id":"b9862a46-e66a-4934-b7ea-e0c2aa3fc4a4","year":2017},"citing_paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:24.303188Z"},"links":{"citing_paper":"/paper/2507.13364"},"observation_digest":"sha256:c3a3defab75368e95a341cd19c2d1c8412ea44dc55c6735b426c7a2e94075deb","observation_id":"a316fe08-b859-461a-853f-a88b28f6f36c","resolution":{"observed_at":"2026-08-06T19:50:27.367186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.13364","last_updated":"2025-07-06T18:51:22Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:43:47.990764Z","submitted_at":"2025-07-06T18:51:22Z","title":"OmniVec2 -- A Novel Transformer based Network for Large Scale Multimodal and Multitask Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":8,"verified_fuzzy":35},"total_outbound_references":105},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 100 of 105 outbound references and 0 inbound Pith citation observations for arXiv:2507.13364."}