{"as_of":"2026-08-08T03:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ba836403c2b73b9dc82636fe2e9c2e045592ddd22ae0b72b240e0ad76ac1059f","coverage":[{"denominator":76,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":76,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:43:54.223613Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04870/citation-record","integrity":"/paper/2506.04870/integrity","json":"/paper/2506.04870/citation-record.json","paper":"/paper/2506.04870"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.621870Z","title":"and Soatto, S","venue":null,"work_id":"f0b1de58-b66a-42f9-88e8-49b860b6124c","year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.335384Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:ed5f37b7d45232fe5ea2f9ee45315b6e57acf10a2b5c43f1926d670995c1fd36","observation_id":"1514e70a-e1c3-474b-a00f-f1f02bad1684","resolution":{"observed_at":"2026-08-07T10:44:02.676436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.491426Z","title":"and Soatto, S","venue":null,"work_id":"ff9f4467-7eb0-4d4d-b35a-b92388207aad","year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.395127Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:78295e1e803acb038535b2bda67465d3271f22b8405a25aa847c1850bcf958b6","observation_id":"10dd87b3-f69c-43d8-a95c-a42e47136f6f","resolution":{"observed_at":"2026-08-07T10:44:02.552925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1612.00410","last_updated":"2019-10-23T22:47:44Z","snapshot_observed_at":"2026-07-06T05:21:01.935928Z","submitted_at":"2016-12-01T20:12:40Z","title":"Deep Variational Information Bottleneck","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.00410","snapshot_observed_at":"2026-08-07T10:43:46.492104Z","title":"A., Fischer, I., Dillon, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.492104Z"},"links":{"cited_paper":"/paper/1612.00410","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:24530cda5cdea1abc0f8243ca8a51edb258eb1c6b4e0ce2070d14b08feeafbe9","observation_id":"963e994a-9add-48c4-9d79-0b1bdd805b0f","resolution":{"observed_at":"2026-08-07T10:43:46.492104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.332519Z","title":"D., and Buchwalter, W","venue":null,"work_id":"c8094ad2-aa12-423d-8e63-b386a4659d8d","year":2019},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.566251Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:abd6cf18673cef162f02b054056f4f605e810dfde4837a85e99eba983ed34f91","observation_id":"151d5ac6-d09b-4eee-947a-c5f0056abd8a","resolution":{"observed_at":"2026-08-07T10:44:02.392838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:46.675735Z","title":"Revisiting model stitching to compare neural representations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.675735Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:14ebd1c0ff111982ac0d03d249d9009cf75e7983f3acb0df7d95f54f3638996e","observation_id":"316388a8-a272-4742-983a-62cb8c1be184","resolution":{"observed_at":"2026-08-07T10:43:46.675735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:46.752484Z","title":"Representation learning: A review and new perspectives","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.752484Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:2ff747c2b3704037f745fcee655507977c82431e4b76cc143aec97135f2b2705","observation_id":"c7011b2f-689e-4e4f-aaa8-7abbdf3d55d3","resolution":{"observed_at":"2026-08-07T10:43:46.752484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:02.102311Z","title":"and Kim, H","venue":null,"work_id":"1d7922ff-bbf6-4cdd-840b-7818331138e7","year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.841481Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c6be119919718ac8eb98098d2cb5f3b394caf88ec2c7dbc1a16349bb6afb8fe5","observation_id":"d12ccdbb-57a1-48b4-b19e-7ee3b6432280","resolution":{"observed_at":"2026-08-07T10:44:02.231084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.967757Z","title":"F., Hong, H., Yamins, D","venue":null,"work_id":"ba68224e-ae22-40c6-92b5-f6067206e0b1","year":2014},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.918192Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:fb7056df4c470a65d665206a614029b66c98262228cb24aaa930e4a8be9a69dd","observation_id":"65ca187c-4e08-4e55-98bf-275816b8eed1","resolution":{"observed_at":"2026-08-07T10:44:02.030824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.837718Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"7ff151a4-6508-4213-8fff-8ba753115f90","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:46.980846Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:e87c1267d59bad1aaf7d69b99b4c50b09385f5f6356567e7bca4a76bb535bb37","observation_id":"4cfc32e9-6b0b-4096-b34f-ddb985be20f6","resolution":{"observed_at":"2026-08-07T10:44:01.903333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.708104Z","title":"Uniter: Universal image-text representation learning","venue":null,"work_id":"84b4f317-c741-48c3-8dec-d026229dc575","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.032668Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:7c83112c67d30bda91dbf0958b7a016a2c1ff2804ead0f6a011113c4e6196ab5","observation_id":"4ea87a0b-5e68-4d2b-a44c-b3ec4e9dd690","resolution":{"observed_at":"2026-08-07T10:44:01.751830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06743","last_updated":"2017-04-17T18:36:08Z","snapshot_observed_at":"2026-07-06T04:57:08.358661Z","submitted_at":"2016-05-22T06:15:31Z","title":"Inductive Bias of Deep Convolutional Networks through Pooling Geometry","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.06743","snapshot_observed_at":"2026-08-07T10:43:47.125611Z","title":"and Shashua, A","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.125611Z"},"links":{"cited_paper":"/paper/1605.06743","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c37247f53555377491548a7b38eb81b1b32aedb7d74f60257d8af788c2ab0b8a","observation_id":"ff32dee0-2856-41de-91db-93137fc609bc","resolution":{"observed_at":"2026-08-07T10:43:47.125611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.589132Z","title":"Algorithms for learning kernels based on centered alignment","venue":null,"work_id":"81f76b61-0c9f-4a8d-b0e7-5930e7aa4a0c","year":2012},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.223980Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:396c56a53334dbd336b27bf7baf89444655f7767e93b4e5ccd5eb23b9a3ed590","observation_id":"3ad2dcf7-1378-4248-9cf9-e778dcfd265c","resolution":{"observed_at":"2026-08-07T10:44:01.645464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.480088Z","title":"On kernel-target alignment","venue":null,"work_id":"64d2c8e2-8136-4d9c-ac09-b47deec138ef","year":2001},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.305990Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:caf9cb7e2d5d90ea93eec270cada13ff5187973020b1370ccecb70a2010aab1c","observation_id":"7ed8345b-95e5-4ee6-a8d9-7edea89f4416","resolution":{"observed_at":"2026-08-07T10:44:01.528041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00685","last_updated":"2024-04-16T06:46:18Z","snapshot_observed_at":"2026-08-05T20:19:51.577573Z","submitted_at":"2024-03-31T13:30:12Z","title":"Scaling Properties of Speech Language Models","version":2},"cited_work":{"arxiv_id":"2404.00685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00685","snapshot_observed_at":"2026-08-07T10:43:54.622864Z","title":"Scaling Properties of Speech Language Models","venue":"eess.AS","work_id":"b6516efb-39b7-40b3-b534-898eb0119b0b","year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.376974Z"},"links":{"cited_paper":"/paper/2404.00685","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:fbed3c080e33afc883210483783efa5c40140aadb74c11fee1201b8911b3f60f","observation_id":"c509a773-e901-4800-9ad9-c05f759a16d3","resolution":{"observed_at":"2026-08-07T10:43:54.710108Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.327737Z","title":null,"venue":null,"work_id":"24fbe725-a0b8-4e6a-b0eb-2f7966adfd8c","year":2011},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.464929Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:39dd4460c971bf9cb4013a292799b7448afcd19e6ab7bcb41f4eb3ff1bb5fa52","observation_id":"20f67dc9-5281-4867-acb0-9c2d22d7d845","resolution":{"observed_at":"2026-08-07T10:44:01.400066Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-07T10:43:47.552783Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.552783Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:e1344f71c713da1fe9af23cc0f7e203eab97d5aa7825e138a243014ba48130a6","observation_id":"698f00eb-8b4c-4cc9-aeb7-81cf1ef258a1","resolution":{"observed_at":"2026-08-07T10:43:47.552783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:01.048829Z","title":null,"venue":null,"work_id":"e4a336b7-a45e-4e74-9e51-e5b0d8d62929","year":1999},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.633790Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:7002947f557f9ba73756d5d207efbd3b2d1cc03dae11c6db4bf3cd340bbf0ec0","observation_id":"a05921e1-5bfe-4bba-85e7-29c0ef1fc3ec","resolution":{"observed_at":"2026-08-07T10:44:01.201441Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T10:43:47.714903Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.714903Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:459cb6db723f9c3a776f3d48955be8f6c8f5d5f0e7a953a9054d0078828985ed","observation_id":"160bde05-0e7c-4a30-a9c5-a1ca0e81c76e","resolution":{"observed_at":"2026-08-07T10:43:47.714903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-07-06T18:21:35.476139Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-07T10:43:47.806429Z","title":"Its not a modality gap: Characterizing and addressing the contrastive gap","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.806429Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:eaaa2079192b7c69711401176b89ff7af23e15454d6aa8c6162479a1d6b93d5d","observation_id":"df1243f6-3ad5-4bbe-b0d0-0b9a180d604c","resolution":{"observed_at":"2026-08-07T10:43:47.806429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.662986Z","title":"Eva: Exploring the limits of masked visual representation learning at scale","venue":null,"work_id":"f6277cc2-15e5-4fe6-8461-0bacee9933ae","year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:47.981890Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:dbe6e5bfdd3952fe6f93f84db2d6b1a9d307b526f182f7041ee40ef0523367be","observation_id":"c7d62e14-2f05-4927-a3ea-14ba64886caa","resolution":{"observed_at":"2026-08-07T10:44:00.880988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.07017","last_updated":"2020-02-18T09:47:50Z","snapshot_observed_at":"2026-08-08T02:55:09.960609Z","submitted_at":"2020-02-17T16:01:52Z","title":"Learning Robust Representations via Multi-View Information Bottleneck","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.07017","snapshot_observed_at":"2026-08-07T10:43:48.098099Z","title":"Learning robust representations via multi-view information bottleneck","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.098099Z"},"links":{"cited_paper":"/paper/2002.07017","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:3e376d7fc39b01330a11a4a665d342c77c03f68e0e03b23d7b77cad65c1d08da","observation_id":"eabf118d-8a0b-4e23-bae2-ba3d8541afaa","resolution":{"observed_at":"2026-08-07T10:43:48.098099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:48.191042Z","title":"Towards artificial general intelligence via a multimodal foundation model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.191042Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:98ee4e856539a19cf7b80c13966bc43e1e64f3dc3f63ef965a3a8909089c4deb","observation_id":"270f7a22-ecd3-4e7c-bece-911581f96f2e","resolution":{"observed_at":"2026-08-07T10:43:48.191042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.466851Z","title":"S., Shlens, J., Bengio, S., Dean, J., Ranzato, M., and Mikolov, T","venue":null,"work_id":"c283b33f-95ec-4e3b-9f62-dffa54bd6890","year":2013},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.336776Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0339a563d829b634f3c655c9db87c17d7661ed170e415eebf216c393a471512b","observation_id":"2b68b1c9-4a3e-44a6-8736-dada4e0cfdff","resolution":{"observed_at":"2026-08-07T10:44:00.533407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:44:00.212594Z","title":"V., Joulin, A., and Misra, I","venue":null,"work_id":"578d2ea2-9d68-4d47-928c-76590bf52215","year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.475556Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:120f574c6e1694254b0cd1ab135f6f718690d7f493dba253dff3244f00984b0b","observation_id":"4548f864-a8e6-4121-8de4-4dccf28ccb31","resolution":{"observed_at":"2026-08-07T10:44:00.302658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:48.616471Z","title":"W., Wuthrich, M., Miladinovic, D., Locatello, F., Breidt, M., Volchkov, V., Akpo, J., Bachem, O., Sch \\\"o lkopf, B., and Bauer, S","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.616471Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c8a61d97adecf90c995cbdda90b4df9aa6e0e1b3990d243754c91c552ed12a26","observation_id":"d7707c1f-9cc5-491b-9f06-4cfec0c4212b","resolution":{"observed_at":"2026-08-07T10:43:48.616471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:48.792916Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.792916Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:206875c0ea032a7082ca4b2b28b3ef52e3a1d34b02d16eca8c9b07070725a88d","observation_id":"874e159a-64a7-444a-9236-f3f5f89f4d6d","resolution":{"observed_at":"2026-08-07T10:43:48.792916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.930643Z","title":"Data-efficient image recognition with contrastive predictive coding","venue":null,"work_id":"04a055a6-ea70-4923-812a-7d871bf831eb","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:48.900329Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:862bc06a07c36c447fdd823e30edbaba69d4abe1da4909bf6853404566f34527","observation_id":"7ef80515-c706-4db4-aca2-c786b375c998","resolution":{"observed_at":"2026-08-07T10:44:00.026223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06670","last_updated":"2019-02-22T18:38:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-08-20T19:52:51Z","title":"Learning deep representations by mutual information estimation and maximization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06670","snapshot_observed_at":"2026-08-07T10:43:49.036069Z","title":"D., Fedorov, A., Lavoie-Marchildon, S., Grewal, K., Bachman, P., Trischler, A., and Bengio, Y","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.036069Z"},"links":{"cited_paper":"/paper/1808.06670","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:bdd08a7235dd2fc818f9d3308dff8431f8156a3cb904586c1bd57a6aea49a40a","observation_id":"0a512020-b3a2-41f5-bbf5-824e0b3f5143","resolution":{"observed_at":"2026-08-07T10:43:49.036069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-07T10:43:49.215329Z","title":"The platonic representation hypothesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.215329Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:ec7c8e43590d5a588f46c4c9803a2b44de296404fa2b968a1814802819d32838","observation_id":"1bbcdb1d-fcc1-4784-87f7-40b231187f8a","resolution":{"observed_at":"2026-08-07T10:43:49.215329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:49.347851Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.347851Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:1bd5eaacfc54439465e4115c26a3ec358f306f3235157f2de30c91bd5258a4b5","observation_id":"d727041e-a611-4070-9a46-134a7a07a660","resolution":{"observed_at":"2026-08-07T10:43:49.347851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T10:43:49.457444Z","title":"B., Chess, B., Child, R., Gray, S., Radford, A., Wu, J., and Amodei, D","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.457444Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:e2ae701d344bccb557910d063f66f82946bd76bd64286e4b1da669e45f00434b","observation_id":"be1423b2-541a-4db9-8811-a469f8706d33","resolution":{"observed_at":"2026-08-07T10:43:49.457444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.650734Z","title":"and Fei-Fei, L","venue":null,"work_id":"6133fd48-cc62-4121-9b7d-ed34c60db8f0","year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.606054Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:8afaee495e20c9f8232e08f165992ca0fe334288e8d58c19df775d804e25c478","observation_id":"fe53ca34-dbc2-4294-814f-cded60e93e9c","resolution":{"observed_at":"2026-08-07T10:43:59.797740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06329","last_updated":"2025-04-09T12:54:43Z","snapshot_observed_at":"2026-08-03T22:26:20.540647Z","submitted_at":"2023-05-10T17:33:48Z","title":"Similarity of Neural Network Models: A Survey of Functional and Representational Measures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06329","snapshot_observed_at":"2026-08-07T10:43:49.704777Z","title":"Similarity of neural network models: A survey of functional and representational measures","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.704777Z"},"links":{"cited_paper":"/paper/2305.06329","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5aad2206e5ee497c87392b6adf46570edd5a9146d446a7954990fa1269fbbe0f","observation_id":"f4677737-ea69-4695-b35e-b9960013d66d","resolution":{"observed_at":"2026-08-07T10:43:49.704777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.400509Z","title":"Multimodal machine learning in precision health: A scoping review","venue":null,"work_id":"a6c20f1c-7f6b-451a-8be9-445886b33f92","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.859056Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:38f9cd8faaf8bc8891c9d496db314d2fc1bbe2f8241ddc620562336c63bbe2ef","observation_id":"3a06bb49-fb7a-43d5-8a52-b8f2304489a9","resolution":{"observed_at":"2026-08-07T10:43:59.524293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:49.988853Z","title":"Similarity of neural network representations revisited","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:49.988853Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:3fc0ae5aea900e8784913cab7a5fb45282cee50e87187e6f0a723104e66a62b2","observation_id":"3b7636c7-31dd-4674-8588-41f0704c3d7d","resolution":{"observed_at":"2026-08-07T10:43:49.988853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:59.165421Z","title":null,"venue":null,"work_id":"b462bb3e-3d6d-40d6-94a5-ba88daa4af3c","year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.099799Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:fa2ab406ade398841e3ae5d863434710b94f05df08cb6273a838e3f9b7a1e68e","observation_id":"28c61840-82ea-4352-8c3a-14b92c2ce6a9","resolution":{"observed_at":"2026-08-07T10:43:59.247387Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06037","last_updated":"2023-12-12T15:26:38Z","snapshot_observed_at":"2026-07-06T16:59:31.970458Z","submitted_at":"2023-12-10T23:32:55Z","title":"Multimodality of AI for Education: Towards Artificial General Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06037","snapshot_observed_at":"2026-08-07T10:43:50.212754Z","title":"Multimodality of ai for education: Towards artificial general intelligence","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.212754Z"},"links":{"cited_paper":"/paper/2312.06037","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5560cfe09bcf0188e2ce0691301d55ca9c950ca351f5fa86801f4b0f4f66fb59","observation_id":"36fa3e8e-4ba8-479f-9bf0-dbec2a285164","resolution":{"observed_at":"2026-08-07T10:43:50.212754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.362608Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.362608Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:b354390c8b006d976dd24241a2c2ba1ad2a147615d3560c6375d1567751fc7fe","observation_id":"4dd6bc00-54af-424e-8803-45f2e38014d2","resolution":{"observed_at":"2026-08-07T10:43:50.362608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.485083Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.485083Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:942b36f4aef2ae6a4905b248af0116fed5c48dc90c50fa2adaa7dffd557b4402","observation_id":"4fe12d65-a0ca-4a39-8999-5fd81d3c9909","resolution":{"observed_at":"2026-08-07T10:43:50.485083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.599256Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.599256Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:8b3ee732c6dd315e1d9c4b5b4d2b14d3faf336764bf57d6d0aa88a6ba0b4357c","observation_id":"c375fd7d-65c9-41ed-9dfd-6203a1447be7","resolution":{"observed_at":"2026-08-07T10:43:50.599256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.828105Z","title":"W., Zhang, Y., Kwon, Y., Yeung, S., and Zou, J","venue":null,"work_id":"1af740ca-663d-484e-87f3-91295a60a8f9","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.727904Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:044e9772d850195c94c6a352334ec99a4dcac687241a043c163e4e28ed141f6c","observation_id":"83014337-f148-44a0-ab54-c895f621bc11","resolution":{"observed_at":"2026-08-07T10:43:58.974562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:50.897039Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.897039Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:1777a299f62e6ea6b4775dfbcc909236bca0d9a65197837b9d93023a1cb65e1f","observation_id":"68a7ea7a-8b4f-43f6-99d1-8d8da587e645","resolution":{"observed_at":"2026-08-07T10:43:50.897039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02893","last_updated":"2018-03-07T22:02:10Z","snapshot_observed_at":"2026-07-06T06:27:10.408557Z","submitted_at":"2018-03-07T22:02:10Z","title":"An efficient framework for learning sentence representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02893","snapshot_observed_at":"2026-08-07T10:43:50.968337Z","title":"and Lee, H","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:50.968337Z"},"links":{"cited_paper":"/paper/1803.02893","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:f05f3444276c548d3809b64d74195fccdeeb846d5fd5637b337749403edfb2e3","observation_id":"81cebd5d-5443-4752-a1a7-5172e172c8c2","resolution":{"observed_at":"2026-08-07T10:43:50.968337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.577351Z","title":"dsprites: Disentanglement testing sprites dataset","venue":null,"work_id":"a8c085a2-f917-4d1e-8b7c-6802551d8550","year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.087163Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:50540b47a1302011f4a579f7010d7abc845171dacfe13b4b6c8a23644493cf34","observation_id":"1c1fc2f0-b2cb-4e52-b00f-d5ead15ef354","resolution":{"observed_at":"2026-08-07T10:43:58.716592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.351009Z","title":null,"venue":null,"work_id":"79628aff-b778-4ecd-a88b-24d63d191394","year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.238149Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:4600b0912f6ad66e50de9f95ae2ece7039a0bc218ce58521a5f0658a34732052","observation_id":"59104b35-e859-4568-b4fa-f06a06361f85","resolution":{"observed_at":"2026-08-07T10:43:58.444717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T10:43:51.373015Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.373015Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:cf90442f29c7230be7c8ff20ff78475f343e4f9adcfd59a334a92ea298a33294","observation_id":"ee5ad851-f58b-4567-9b13-fbbb8969d4e8","resolution":{"observed_at":"2026-08-07T10:43:51.373015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:51.448483Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.448483Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:213c2f0ca5045db31e01767b0f803decbdf0eff468e0ab4516bb10586c9fcf73","observation_id":"ec22d397-5de3-4705-9d60-db1bb1994bbf","resolution":{"observed_at":"2026-08-07T10:43:51.448483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:51.541369Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.541369Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5cbe18fbadbd997073f1d4d186462eae1d098b119b7ed67d8d96f668fa5272fb","observation_id":"2214f363-e5bf-4e0d-a0c3-835d3f6bad5f","resolution":{"observed_at":"2026-08-07T10:43:51.541369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:58.132540Z","title":"Svcca: Singular vector canonical correlation analysis for deep learning dynamics and interpretability","venue":null,"work_id":"424d2792-61ba-4edc-a36c-1a85144cf155","year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.636798Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:deb5ef3519953694e0c92f4f617066e3cfd32071a061fe3218638f5848a4cb00","observation_id":"1349164b-3004-4440-a5f5-f23ff71e7f90","resolution":{"observed_at":"2026-08-07T10:43:58.208963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.894147Z","title":"Do vision transformers see like convolutional neural networks? Advances in neural information processing systems, 34: 0 12116--12128, 2021","venue":null,"work_id":"cc4bd1ae-ab6f-449e-9fe0-4e30468905d3","year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.745091Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:38d45ee83a705d12fbc924d395e2d0229a98787e9848a21fcec509ac1f2710df","observation_id":"06818af3-0990-423d-8908-e3178ab625ac","resolution":{"observed_at":"2026-08-07T10:43:58.035135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.641371Z","title":"Accept the modality gap: An exploration in the hyperbolic space","venue":null,"work_id":"5d0e2344-3842-4f35-973d-e0d1f319d43b","year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.881919Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:56b28fed9c2933acf922b58952e8ca57db2f9da90b8c91ba3f45b799f9949a1f","observation_id":"ff31bb90-5308-49fb-a9f0-eb47f0acfc3c","resolution":{"observed_at":"2026-08-07T10:43:57.781066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-07T10:43:51.990399Z","title":"Hierarchical text-conditional image generation with clip latents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:51.990399Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c1ca8b6644fc2e2190c4f43b1eb6ecfb041a42a817617f9c9032f62392cf356e","observation_id":"34b2ccff-159a-4dd4-9823-ffba2d623a6c","resolution":{"observed_at":"2026-08-07T10:43:51.990399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-07-06T17:59:00.124173Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-08-07T10:43:52.101762Z","title":"T., Argus, M., Fischer, V., and Brox, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.101762Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:d7ec3e8c5c2edee5464cb16be0fe7078157877f6fc1d803f1008646ae2b42675","observation_id":"0db09d49-9aa0-466f-8fe7-43051d776125","resolution":{"observed_at":"2026-08-07T10:43:52.101762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:52.260970Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.260970Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:d603d7b27b853c18ba5f19a2fc43dc6f95bae2e467a7802823e48bd75e34f12c","observation_id":"0e00e42f-a7e5-45f8-adc0-50ab90b4bd2d","resolution":{"observed_at":"2026-08-07T10:43:52.260970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1703.00810","last_updated":"2017-04-29T17:32:47Z","snapshot_observed_at":"2026-07-06T05:32:06.316001Z","submitted_at":"2017-03-02T14:53:14Z","title":"Opening the Black Box of Deep Neural Networks via Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1703.00810","snapshot_observed_at":"2026-08-07T10:43:52.341489Z","title":"and Tishby, N","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.341489Z"},"links":{"cited_paper":"/paper/1703.00810","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c37a43dbfac37578939478110dde0297f11d326e393c0cea0a40fa41736004ff","observation_id":"c3efab6c-daf4-4a0e-9665-33ef5b4aa65b","resolution":{"observed_at":"2026-08-07T10:43:52.341489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.361033Z","title":"Human computer interaction","venue":null,"work_id":"2c7a67e0-4221-4db3-8c4b-5404b88f4230","year":2010},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.384067Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:a9d6b9d3192814902f49ef967c4940172a2fdc4495b52f73b0f64f83cef895ad","observation_id":"41dda261-ebe8-49c0-bc42-5d9d189c7b3b","resolution":{"observed_at":"2026-08-07T10:43:57.499813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:57.110527Z","title":"Contrastive multiview coding","venue":null,"work_id":"7114fe42-215f-4059-878d-2f8502d2fdd2","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.457484Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:93c4736927567d9671e46c4e93b55130aa3ac03a2d658dfb25219af49f704a50","observation_id":"05550c4d-5d7e-4741-8c5a-d9a3f66ed150","resolution":{"observed_at":"2026-08-07T10:43:57.244198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.896580Z","title":"What makes for good views for contrastive learning? Advances in neural information processing systems, 33: 0 6827--6839, 2020 b","venue":null,"work_id":"f40883c9-ebfc-4927-b46a-f43d3136c2eb","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.513864Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:8bd75f7b2b9ef9864796e687f94e11b3ab15b18a6785afbaca4d89e9ca93a468","observation_id":"32e8d6af-9389-4f4e-932f-8b61211d2c4e","resolution":{"observed_at":"2026-08-07T10:43:56.966682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:52.651924Z","title":"and Zaslavsky, N","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.651924Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:363d038bb8888db326f22f63a9f18eba30bae6638b8a2c7daa505d63e5d68035","observation_id":"539c845c-8aa8-417d-aaee-72957ed911c6","resolution":{"observed_at":"2026-08-07T10:43:52.651924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"physics/0004057","last_updated":"2000-04-24T15:22:30Z","snapshot_observed_at":"2026-08-07T10:46:08.274157Z","submitted_at":"2000-04-24T15:22:30Z","title":"The information bottleneck method","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"physics/0004057","snapshot_observed_at":"2026-08-07T10:43:52.766923Z","title":"C., and Bialek, W","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.766923Z"},"links":{"cited_paper":"/paper/physics/0004057","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:1ee984db4e15770ae994eafefaa4ffdd0c6ed223ad5394735b1f06654ab2715a","observation_id":"ae5d9413-d508-4eb9-b504-1bf9d320994a","resolution":{"observed_at":"2026-08-07T10:43:52.766923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05576","last_updated":"2021-03-22T20:40:22Z","snapshot_observed_at":"2026-07-06T09:27:31.979054Z","submitted_at":"2020-06-10T00:21:35Z","title":"Self-supervised Learning from a Multi-view Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05576","snapshot_observed_at":"2026-08-07T10:43:52.837965Z","title":"H., Wu, Y., Salakhutdinov, R., and Morency, L.-P","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.837965Z"},"links":{"cited_paper":"/paper/2006.05576","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:959c9dfd5abe6c183781a8fa6dc9353cd5f3936051c8f3fd22e3304292a03901","observation_id":"47b54910-45b3-463a-a080-5b925a6afcd6","resolution":{"observed_at":"2026-08-07T10:43:52.837965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.613979Z","title":"Understanding and fixing the modality gap in vision-language models","venue":null,"work_id":"bb0629f7-845b-4c04-a6d3-a585d63030be","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.915797Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:0db2024eda67ca106ad93c4adf39e0627dba01d9d1b6f58ad247f86a8d1e224e","observation_id":"db6bb444-ca00-4158-aed8-5e52c67975ef","resolution":{"observed_at":"2026-08-07T10:43:56.710884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.406914Z","title":"Ranking with ordered weighted pairwise classification","venue":null,"work_id":"1f344f55-04f6-4943-b8af-2a3c6ecbca6e","year":2009},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:52.975279Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:faf8e3f4a18d9cb54a797164824a714584b074288107595ba4221da9b6ac9874","observation_id":"b1cd255c-61ef-4cea-b98b-283d95136806","resolution":{"observed_at":"2026-08-07T10:43:56.503496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:53.034469Z","title":"Cider: Consensus-based image description evaluation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.034469Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:bcc80335c0adf7be4bc6c96156fac54b74af3ee5442079d1c0dfb3c728066d11","observation_id":"7571d6a9-6fe4-4cbc-b713-12541a4da7d7","resolution":{"observed_at":"2026-08-07T10:43:53.034469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:56.115990Z","title":"and Liu, H","venue":null,"work_id":"f5796fa3-76ce-474d-aa72-8a5c0fc8845c","year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.135692Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:59de477d681c1983a82e72040c2a910054e40e00f3cea484a0b090406d08ad52","observation_id":"201d5b3b-ef90-4609-97d8-0e10bc5204f4","resolution":{"observed_at":"2026-08-07T10:43:56.271112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.898041Z","title":"Rethinking minimal sufficient representation in contrastive learning","venue":null,"work_id":"65d13478-c80d-4226-bbae-0a183cb15412","year":2022},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.246203Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:20912d903f606b719a1e83432fdea3ae7ae40220be6554db0dc7cd3a04970ab7","observation_id":"5353f01a-b5bb-4167-bd6b-342b23a651ff","resolution":{"observed_at":"2026-08-07T10:43:55.983477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:53.333233Z","title":"and Isola, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.333233Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:3b77a282a5b03f1e0ef5ddaa46f15ad243ce5ba0145263fb58893577308becdd","observation_id":"ec1373d0-d0a9-44f5-83eb-6b7116d18087","resolution":{"observed_at":"2026-08-07T10:43:53.333233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.741866Z","title":"Disentangled representation learning","venue":null,"work_id":"63b79dfa-5a24-454e-a4ce-d27fcaf6d89b","year":2024},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.431053Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:c5521859b738e21bf6f314c87612cf1624db153da21662a91ce16fd031f81358","observation_id":"133e3845-c0d2-438c-bba2-c5335b980b1f","resolution":{"observed_at":"2026-08-07T10:43:55.805732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.541884Z","title":"and Wu, L","venue":null,"work_id":"b18b38fd-1dd7-428c-a341-fb1ae575c757","year":2023},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.530973Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:5391cd46ce8376f5823cf5d2623cf6108dfb16aa9e6303d277edee980ecad099","observation_id":"d2438757-e2ee-401b-9a22-87b6b39c630f","resolution":{"observed_at":"2026-08-07T10:43:55.642412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.262077Z","title":"Large scale image annotation: learning to rank with joint word-image embeddings","venue":null,"work_id":"1348ae74-bbf8-4511-babe-7d1adbde810d","year":2010},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.637255Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:bb8aa29b448b447965032acef662d3071d2532dd8fd984ec100ac32481863831","observation_id":"246f2540-ef4c-4778-963c-de6851ae21af","resolution":{"observed_at":"2026-08-07T10:43:55.392339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:53.721604Z","title":"X., and Lin, D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.721604Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:e09d26c756dfef3c802597590997b76cb861ff9de7620a0ebd6c35c3bae60279","observation_id":"8831b193-84d1-459c-aa61-835e83c4d88b","resolution":{"observed_at":"2026-08-07T10:43:53.721604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:55.043964Z","title":null,"venue":null,"work_id":"3de8dcd3-0bc4-4210-bdb3-40e253ba1897","year":2020},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.813507Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:ebfcb297ed05d2cd20fee874b1527a3ec3b8acda72128ace3b2882d261db8ac2","observation_id":"ac0b7945-438d-4213-8433-b61b1623e624","resolution":{"observed_at":"2026-08-07T10:43:55.145579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-07T10:43:53.900356Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.900356Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:73c7a2e14ea4b8d073f78d3f7aea855d93225d0b170ae3aea85d035f28881c63","observation_id":"1d03ffe8-d8c3-4558-9a22-81ccdd0cfdac","resolution":{"observed_at":"2026-08-07T10:43:53.900356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10689","last_updated":"2020-02-25T06:09:30Z","snapshot_observed_at":"2026-08-02T06:23:27.066738Z","submitted_at":"2020-02-25T06:09:30Z","title":"A Theory of Usable Information Under Computational Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10689","snapshot_observed_at":"2026-08-07T10:43:53.975431Z","title":"A theory of usable information under computational constraints","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:53.975431Z"},"links":{"cited_paper":"/paper/2002.10689","citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:1b26c1fccabb5c56f8f088aef6cf279e6db930e663a2c2dba4e34e915ecf0e27","observation_id":"ccc34d92-69f0-4757-ae50-eb8e762be252","resolution":{"observed_at":"2026-08-07T10:43:53.975431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:54.830300Z","title":null,"venue":null,"work_id":"1b31325a-d0dd-4552-b8a6-84eddc099aac","year":1988},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:54.097936Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:85386e3ca464734953405e181ad77084c582c7e0578d30649594eebeb66917ea","observation_id":"badf7ca8-b6ac-4039-878e-f64828ad176c","resolution":{"observed_at":"2026-08-07T10:43:54.922513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:43:54.223613Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T10:43:54.223613Z"},"links":{"citing_paper":"/paper/2506.04870"},"observation_digest":"sha256:737d8e235257d726634938d915eed2be0830f66d93c023005bcb39677af4e8da","observation_id":"6db1ae11-4405-4f9e-b140-f5941cf85b96","resolution":{"observed_at":"2026-08-07T10:43:54.223613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04870","last_updated":"2025-06-05T10:47:14Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:29:09.298734Z","submitted_at":"2025-06-05T10:47:14Z","title":"Aligning Multimodal Representations through an Information Bottleneck"},"reference_resolution":{"displayed":76,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":76},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 76 of 76 outbound references and 0 inbound Pith citation observations for arXiv:2506.04870."}