{"as_of":"2026-08-16T06:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1ff82f0ced98b6ccbdad9a53c5587e260b228b01244e4e9358187291a46819c2","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:01:38.878311Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11216/citation-record","integrity":"/paper/2505.11216/integrity","json":"/paper/2505.11216/citation-record.json","paper":"/paper/2505.11216"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"math/9911133","last_updated":"1999-11-18T08:19:58Z","snapshot_observed_at":"2026-07-07T06:11:54.997248Z","submitted_at":"1999-11-17T19:57:11Z","title":"Geometry of oblique projections","version":2},"cited_work":{"arxiv_id":"math/9911133","doi":null,"metadata_source":"pith","pith_arxiv_id":"math/9911133","snapshot_observed_at":"2026-08-15T21:01:39.342405Z","title":"Geometry of oblique projections","venue":"math.OA","work_id":"a4727f8a-553a-480e-805f-0fe33ae43074","year":1999},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.413972Z"},"links":{"cited_paper":"/paper/math/9911133","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:73841f2aa5cd58ce2ab8b91e9d830b7bebd03c60d0ad7d7d83b2f237a6d58a62","observation_id":"66cfa46f-a0bd-4a78-a9c2-e6ee31dbede3","resolution":{"observed_at":"2026-08-15T21:01:39.347568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.420078Z","title":"Vqa: Visual question an- swering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.420078Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:c87b696856a60bea6f57f77d1429a54f77476e84c40fb6ef881682a492bb5d1c","observation_id":"8659d41e-7dc6-4ffd-93b0-1cb8e5a0b684","resolution":{"observed_at":"2026-08-15T21:01:38.420078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.424841Z","title":"Geodesic matting: A framework for fast interactive image and video seg- mentation and matting","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.424841Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:78b9e40a30f7ec8e96d9a33821e9938fca6969c8d84faf3afac2748c862fa2cf","observation_id":"55c1edf9-c5ee-4ba4-9e2f-9b139486cc82","resolution":{"observed_at":"2026-08-15T21:01:38.424841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.429348Z","title":"Vlmo: Uni- fied vision-language pre-training with mixture-of- modality-experts","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.429348Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f68ede0524c8101233e1723bf415f0c98a36692ba4f219845f30b34d5f023a91","observation_id":"b7dec225-807d-4d7d-82d5-77a26f2fff1c","resolution":{"observed_at":"2026-08-15T21:01:38.429348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.434050Z","title":"Grit-vlp: Grouped mini-batch sam- pling for efficient vision and language pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.434050Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:060137a2bef182bc15f14afee58d82869b05d1cd452fa7123422a1cc5616207e","observation_id":"21f0c57b-7496-4784-8aa4-7068f74eefbe","resolution":{"observed_at":"2026-08-15T21:01:38.434050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.438839Z","title":"Mafa: Managing false negatives for vision-language pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.438839Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:09efac11b678650d87b7d51b69aeae06f505e6269e48636dbe0e027e7d79eb75","observation_id":"7a3ce4a2-f859-4cbe-af60-3c16ac592db2","resolution":{"observed_at":"2026-08-15T21:01:38.438839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.443858Z","title":"End-to-end object detection with trans- formers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.443858Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:66cc9c04dedc406f8833109c9700c86771046aca5ad4edde19dde5434c0ef1db","observation_id":"a48256e5-9822-428d-9acf-0f65b344a5e5","resolution":{"observed_at":"2026-08-15T21:01:38.443858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.448550Z","title":"Un- supervised learning of visual features by contrasting cluster assignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.448550Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:c5f5efa2f6d176a768a37fb335c70299a0292d1817346ccad14e2adeea72643a","observation_id":"db3622f6-0593-4b8f-87af-fff6fcf727bb","resolution":{"observed_at":"2026-08-15T21:01:38.448550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.452997Z","title":"Emerging properties in self-supervised vi- sion transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.452997Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e873892269953358ff6a6c1f84f750bf9d5a90b599d245116099fb99c274b1f7","observation_id":"fb5ad8ad-31d2-4fa2-a7ab-c9bb930b2de1","resolution":{"observed_at":"2026-08-15T21:01:38.452997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.457508Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.457508Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:8e8702028b4adb6e5383b561a7213310cbf44b959c7aef19599bc6cb39073982","observation_id":"99d13011-6d78-4073-b0c4-48eab8b4d2d9","resolution":{"observed_at":"2026-08-15T21:01:38.457508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13081","last_updated":"2023-02-08T02:29:27Z","snapshot_observed_at":"2026-08-13T12:55:02.148160Z","submitted_at":"2023-01-30T17:21:30Z","title":"STAIR: Learning Sparse Text and Image Representation in Grounded Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13081","snapshot_observed_at":"2026-08-15T21:01:38.462143Z","title":"Stair: Learning sparse text and image representation in grounded tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.462143Z"},"links":{"cited_paper":"/paper/2301.13081","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f1424d4056994d7574155b5ced53d98e63611aa1150a6e07e4ba7d6c864009eb","observation_id":"274db597-f706-466c-94af-bff1aab1ab82","resolution":{"observed_at":"2026-08-15T21:01:38.462143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.466898Z","title":"Vlp: A survey on vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.466898Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:aa2adf8ef8b81ff62cf1aa2d621eb57ded548e01baf453c5b2aacaa5796f0ba5","observation_id":"65cd4779-0669-4769-8fb5-cf7d80842a14","resolution":{"observed_at":"2026-08-15T21:01:38.466898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.471735Z","title":"A simple framework for con- trastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.471735Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:2f706dff2c348afe5348d42df5fcb198e34b65158cdd382d6182e0ab69be4d7f","observation_id":"2fe0d320-69d6-4761-914f-af8965a929be","resolution":{"observed_at":"2026-08-15T21:01:38.471735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.475985Z","title":"Exploring simple siamese representation learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.475985Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:893b58fa5fada94f7186930656414521d56c10ce48ee3903e7257daaf0d23146","observation_id":"004bccc6-a759-477a-b537-6ce78ea73233","resolution":{"observed_at":"2026-08-15T21:01:38.475985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-15T21:01:38.480255Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.480255Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:0c0451e7f37209a8022d8f561bfcf0dbe4f82a8ff2039b4855493ae15c9e114b","observation_id":"4196cc9e-1fce-4152-ae6c-f046f859e2b4","resolution":{"observed_at":"2026-08-15T21:01:38.480255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02253","last_updated":"2021-06-07T09:03:46Z","snapshot_observed_at":"2026-08-13T19:10:09.499335Z","submitted_at":"2021-06-04T04:32:02Z","title":"X-volution: On the unification of convolution and self-attention","version":2},"cited_work":{"arxiv_id":"2106.02253","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.02253","snapshot_observed_at":"2026-08-15T21:01:39.289487Z","title":"X-volution: On the unification of convolution and self-attention","venue":"cs.CV","work_id":"c172543c-a80f-41de-afcb-714860f17f71","year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.484805Z"},"links":{"cited_paper":"/paper/2106.02253","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d100f794f7bee88abffbe23200a811e726839080a2d1a4e7e3e46c0ecdd0adc6","observation_id":"8adae875-cc7c-4b7c-959d-a92eeedff320","resolution":{"observed_at":"2026-08-15T21:01:39.294667Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.489680Z","title":"Uniter: Universal image-text represen- tation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.489680Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:102d7ef71dc1758aabb623b93e77affbfbc69d785aee317235438b02cbeba33d","observation_id":"ad3267df-c538-4ee7-b467-0337bcb55ec6","resolution":{"observed_at":"2026-08-15T21:01:38.489680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07496","last_updated":"2023-11-20T15:57:43Z","snapshot_observed_at":"2026-08-13T14:25:35.024825Z","submitted_at":"2022-09-15T17:37:08Z","title":"Unsupervised Opinion Summarization Using Approximate Geodesics","version":3},"cited_work":{"arxiv_id":"2209.07496","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.07496","snapshot_observed_at":"2026-08-15T21:01:39.259921Z","title":"Unsupervised Opinion Summarization Using Approximate Geodesics","venue":"cs.CL","work_id":"d406bb59-1708-4fcd-b053-efc8eeb842a2","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.494361Z"},"links":{"cited_paper":"/paper/2209.07496","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:809a24a3d84244ddaaac8d2e260fd6f0880fae3b3a386caa739006c9dbcc46e1","observation_id":"b5b4d7b4-0948-4db1-bff5-bb6998010a34","resolution":{"observed_at":"2026-08-15T21:01:39.267081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.499121Z","title":"Geodesics in heat: A new approach to computing distance based on heat flow","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.499121Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f28ac49073caa2bc41c0150faaf2745fdd1eb1bca8984d77444a02848e2f08b3","observation_id":"54f20193-659f-4878-8e05-b9d15bf37185","resolution":{"observed_at":"2026-08-15T21:01:38.499121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.503671Z","title":"Imagenet: A large-scale hierar- chical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.503671Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:0cd6d09aeb6a10195be3428c2590470177dd2d89dfb239eed3f3b260b217c49c","observation_id":"3478c4dc-1800-4b8a-8fa1-150a8fac611b","resolution":{"observed_at":"2026-08-15T21:01:38.503671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-15T21:01:38.508186Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.508186Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:467ed69ea5603513049c2dcb5bb17459fce5c4f0578288c818048b61d41fb7cc","observation_id":"b6a0e3ef-a335-403a-afe0-dea09844afcb","resolution":{"observed_at":"2026-08-15T21:01:38.508186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.512748Z","title":"Similarity reasoning and filtration for image-text matching","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.512748Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d860ec7b6cf772bde883d11a656b516e20429b7692ae42973be3bbb5131eb4cd","observation_id":"563e7ed6-9e23-49c7-8249-556a7a4e2d39","resolution":{"observed_at":"2026-08-15T21:01:38.512748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.517378Z","title":"A note on two problems in con- nexion with graphs","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.517378Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:cd10afb87018e264c55b01b6adf6a83698f6b92c119f50fda5570749ae12cdf3","observation_id":"8ede5920-4d59-4b00-996e-06fa677e62b4","resolution":{"observed_at":"2026-08-15T21:01:38.517378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T21:01:38.522500Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.522500Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:0319e9452fc20417bdc2382ac1fefabc9f4060050380a12fdc8a5fedc858f2e8","observation_id":"2bf51a31-6b6b-42d0-a3bf-253e0f9ca610","resolution":{"observed_at":"2026-08-15T21:01:38.522500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.528050Z","title":"Algorithm 97: shortest path","venue":null,"work_id":null,"year":1962},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.528050Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:2c3e346cc03d57dab0f0f7aa8a21b591b224c59ed56da3a1c6e40c8b88f3bc68","observation_id":"31a91c94-7b3c-49b9-b09a-29f0d3911a19","resolution":{"observed_at":"2026-08-15T21:01:38.528050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.532702Z","title":"Large-scale adversar- ial training for vision-and-language representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.532702Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d22476ebbee09126c4c1f93cc3caf33e6ea0429d5de5fda660b0a7186d5fc4e1","observation_id":"3ef1901e-d388-47be-9797-5288ce17d716","resolution":{"observed_at":"2026-08-15T21:01:38.532702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.537300Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.537300Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:70c93ddadac8d6bf07f764651bd6101f4dd487493d1b8c675001d7b6c8b61242","observation_id":"94e9c6b0-76e3-4cfc-825b-3ce545cc4019","resolution":{"observed_at":"2026-08-15T21:01:38.537300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.541805Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.541805Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:83decf3d6e5207c740fadde2d80d5fb995acbcfbaa112173da8e27a112f690ab","observation_id":"53a7fab5-efb6-4ff8-bbec-c2242f7cbfc4","resolution":{"observed_at":"2026-08-15T21:01:38.541805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.546457Z","title":"Masked autoen- coders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.546457Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f564193fde295d5a1fde59d0aa9a3e159e588727bec1891d277599fbc542ae67","observation_id":"a3f9074b-fbab-445c-a06a-d73412d91706","resolution":{"observed_at":"2026-08-15T21:01:38.546457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.551765Z","title":"Geonet: Deep geodesic networks for point cloud analysis","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.551765Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:0894f8b6f926e5641ef49e28f50ef5420555eab51f930993f13aba1c3473de86","observation_id":"fc0aedf2-1406-4814-93fc-e27dac959f1f","resolution":{"observed_at":"2026-08-15T21:01:38.551765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.00849","last_updated":"2020-06-22T09:09:22Z","snapshot_observed_at":"2026-08-15T14:49:08.287205Z","submitted_at":"2020-04-02T07:39:28Z","title":"Pixel-BERT: Aligning Image Pixels with Text by Deep Multi-Modal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.00849","snapshot_observed_at":"2026-08-15T21:01:38.561792Z","title":"Pixel-bert: Aligning image pixels with text by deep multi-modal transformers","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.561792Z"},"links":{"cited_paper":"/paper/2004.00849","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:514456fa366d7d8e1172436c97dab116db16461df7a2ba024d9f05364d4e0150","observation_id":"276fe121-e048-4455-a1f0-4be44f6352e2","resolution":{"observed_at":"2026-08-15T21:01:38.561792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.566170Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.566170Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4c94b40619479894ee0b497254684eebb76f5187baae9994272dd0ec8cfb4892","observation_id":"8ab911b9-f86b-4331-9caf-a74d29e77a59","resolution":{"observed_at":"2026-08-15T21:01:38.566170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.570688Z","title":"Vilt: Vision-and-language transformer without convolu- tion or region supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.570688Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:77733bcc403d2b7aa79d5e2ede914549a557f844da899b1f154021023cb0de21","observation_id":"4da22129-6ec5-4438-9d0f-38cac98f3077","resolution":{"observed_at":"2026-08-15T21:01:38.570688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.574725Z","title":"Computing geodesic paths on manifolds","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.574725Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:c09b97a389065a770c7c088e545ebc5fdd83626a3901729f577873b98e1867d8","observation_id":"43dd0a4b-2483-4364-90ad-ed7f8b51290b","resolution":{"observed_at":"2026-08-15T21:01:38.574725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.579261Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annota- tions","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.579261Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4cb7546d4378298e8ddc9df293cb5adf1f1cc6da6c783a2687cf8f9e39c13362","observation_id":"27c0734b-23d0-43c1-9612-5e6207f46290","resolution":{"observed_at":"2026-08-15T21:01:38.579261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.583852Z","title":"Numba: a llvm-based python JIT compiler","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.583852Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d86eb21c7e19157094f1ff656ad09a892dae98466d09e44a80c548887cf42af4","observation_id":"7e43bedb-4f44-468c-bcf5-b3c469f4d285","resolution":{"observed_at":"2026-08-15T21:01:38.583852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.588469Z","title":"Le, Vu Nguyen, Chen-Ping Yu, and Dimitris Samaras","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.588469Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:747e05b56381a6ba378ae181d0353a390e8ae0764fcd6198a5d0a6aa1de9eea0","observation_id":"aa33debf-79a4-4188-b5a2-4d393a1c1ee8","resolution":{"observed_at":"2026-08-15T21:01:38.588469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.592895Z","title":"Stacked cross attention for image- text matching","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.592895Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:99d73ec0e9e3008d82e94c54d1516824e5c03dd6b30c3286518041481c1f0901","observation_id":"46ea7ca2-464f-42cf-bda9-8f1d75c8caee","resolution":{"observed_at":"2026-08-15T21:01:38.592895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10020","last_updated":"2023-09-18T17:56:28Z","snapshot_observed_at":"2026-08-13T10:10:39.294234Z","submitted_at":"2023-09-18T17:56:28Z","title":"Multimodal Foundation Models: From Specialists to General-Purpose Assistants","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10020","snapshot_observed_at":"2026-08-15T21:01:38.597292Z","title":"Multimodal foundation models: From spe- cialists to general-purpose assistants","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.597292Z"},"links":{"cited_paper":"/paper/2309.10020","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:002e65cbbcdd2ccf20bc62220ffc6c1bc601a1bf56ef30362b05bd01e959f884","observation_id":"23f519ed-53c6-45ae-a6e6-f7b0681e5b9d","resolution":{"observed_at":"2026-08-15T21:01:38.597292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:38.602455Z","title":"Align before fuse: Vision and lan- guage representation learning with momentum dis- tillation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.602455Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4a77b6a9160b65bae7765c90b80b64a0c0ccce46c507670e9e762629d05302b7","observation_id":"71eddf66-8905-4e23-8355-6cd0d419bc8e","resolution":{"observed_at":"2026-08-15T21:01:38.602455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.186664Z","title":"Blip: Bootstrapping language-image pre- training for unified vision-language understanding and generation","venue":null,"work_id":"7e7fc2e7-fc26-4b6d-a556-58baca0cfe7a","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.607159Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:83b8ab2badd7c6e944db3ad40ff931a3cbb65d2beb243d11dc1cf3814e906dfa","observation_id":"f3f7b385-b0a0-4dbb-88c2-1a9fd92507e0","resolution":{"observed_at":"2026-08-15T21:01:40.191284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00200","last_updated":"2020-09-29T20:37:17Z","snapshot_observed_at":"2026-08-13T09:35:23.538598Z","submitted_at":"2020-05-01T03:49:26Z","title":"HERO: Hierarchical Encoder for Video+Language Omni-representation Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00200","snapshot_observed_at":"2026-08-15T21:01:38.611677Z","title":"Hero: Hierarchical en- coder for video+ language omni-representation pre- training","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.611677Z"},"links":{"cited_paper":"/paper/2005.00200","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:be354fc1a1dae8755af61b61f121feddecd36a36ccf8b3b3051eb97220bcc865","observation_id":"365af228-59ce-46e0-ae1c-7e91497c43c6","resolution":{"observed_at":"2026-08-15T21:01:38.611677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-15T21:01:38.616515Z","title":"Visualbert: A simple and performant baseline for vision and language","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.616515Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:1d39d3d485ba40873b5ad1f79613a6150bf54daf3f1ab2ad28f35b264f76cc0a","observation_id":"4cb98fbf-d047-4e6d-bfcd-bb8854344691","resolution":{"observed_at":"2026-08-15T21:01:38.616515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.172550Z","title":"Oscar: Object-semantics aligned pre-training for vision-language tasks","venue":null,"work_id":"79389415-ac36-4199-89f7-8e078e758494","year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.621318Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:219cd13c5ed19390c5f61af6c10da7129376dfb1b5b975dba04913dbbf9a70c0","observation_id":"4d8b67ea-7b08-4c7a-89fb-c7d019169cfe","resolution":{"observed_at":"2026-08-15T21:01:40.177109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-13T17:55:27.704848Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-15T21:01:38.625976Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre- training paradigm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.625976Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:96221ef2cfd45cc7c41d0ecc4d52b36278cdbfe8300c2280ca64e94620803394","observation_id":"b18e0303-3dcd-4727-b2b8-c843df5c473e","resolution":{"observed_at":"2026-08-15T21:01:38.625976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.158697Z","title":"Scaling language- image pre-training via masking","venue":null,"work_id":"7235ccdf-7f6c-47e0-b520-dc3b923e2d17","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.630755Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f513e2ac3d462baa512465a0822cc0ef761f6c1755ee7591f0e71e632e8e96b6","observation_id":"c4cc866d-c672-4f5d-9e80-c0fa2e1bc243","resolution":{"observed_at":"2026-08-15T21:01:40.163177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.144302Z","title":"Geodesic self- attention for 3d point clouds","venue":null,"work_id":"6daba089-484c-4aac-a6ce-74ea04a067b1","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.635022Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e50a20e9d233d0c35338b35eb36986963979bb2c8ca610aaa03035db99290653","observation_id":"9254e8d4-3858-4246-a97a-f3fa3252d5e7","resolution":{"observed_at":"2026-08-15T21:01:40.148944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.127837Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":"03e4b030-7772-497a-bd95-19e66b052b06","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.639316Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f2246e03f42825702f2d29ae6f05fc8aeba81a81fd837cda139d80d7615d7b91","observation_id":"06178822-4c25-4d71-a750-3cdcaa1e655d","resolution":{"observed_at":"2026-08-15T21:01:40.134318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.113244Z","title":null,"venue":null,"work_id":"e1936f33-bb0c-4735-9d12-a6a0f3ae54c6","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.644092Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:987c2c9a72c87d5cd7d17f8bb8a5563b862cd008fe33c63aafdf63fd34d95c12","observation_id":"60a9f332-f09a-4b03-abb3-693a13838ba4","resolution":{"observed_at":"2026-08-15T21:01:40.118132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.098122Z","title":"Adap- tive reconstruction network for weakly supervised re- ferring expression grounding","venue":null,"work_id":"6b8d3f3d-e84b-4b6c-be68-87725b081909","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.648566Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:9a0568f8fcd3eb12bd1e50f05399d6681a212718308317a21ae99f6445c7c16c","observation_id":"39a9358a-fce3-4c28-a839-3c9deeedb799","resolution":{"observed_at":"2026-08-15T21:01:40.102936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.083767Z","title":"Algorithm as 136: A k-means clustering algorithm","venue":null,"work_id":"7dcc36d4-2b2a-4a6e-8d6e-8e58396f2e32","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.652851Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:96be3684cc7f4fac0f8885acb7cdc9702a31782fd087281002f84d2b7847c3ef","observation_id":"2351d9c4-6ef2-45fb-8709-8d500a8fbb70","resolution":{"observed_at":"2026-08-15T21:01:40.088456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.069323Z","title":"Decoupled weight decay regularization","venue":null,"work_id":"6127b72e-1849-4600-a00f-ef7ef1f2bebe","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.657146Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:71cf4a50067837496d0a527375d63d956f6f50126875bc6b402880e057e90b0c","observation_id":"4d014c8a-5557-4533-8c80-b64489b474eb","resolution":{"observed_at":"2026-08-15T21:01:40.074084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.054536Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic rep- resentations for vision-and-language tasks.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"658bc405-acd9-4215-9692-4b5e698d78b9","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.661372Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:ddf811d61a9ec9a9cef7c405a03709db8d82f6633ed11af879290c6f67948dd0","observation_id":"fe50d3e3-97e6-4ba1-989f-c0f4b8c4e66e","resolution":{"observed_at":"2026-08-15T21:01:40.059524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.037761Z","title":"Computing geodesics on triangular meshes.Comput- ers & Graphics, 29(5):667–675, 2005","venue":null,"work_id":"f14bdf5a-c781-4982-9537-4162f2470527","year":2005},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.665984Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:b0b2169bc3a80cda154fe9462d1f56a9e9f975d331fc586436f66f4b194d7cbc","observation_id":"5246da00-04c3-45f3-8e9a-2f135549850b","resolution":{"observed_at":"2026-08-15T21:01:40.042868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.022360Z","title":"Bron- stein, and Pierre Vandergheynst","venue":null,"work_id":"d9cc5661-d5bd-4098-9d4f-0e019f92df93","year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.670412Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:72b4c95f4907f2caf930b4203005bef97e1c55b19e3dc8f9066eb93b5a678b49","observation_id":"b5cd8895-692e-4312-9a36-eb02c979757c","resolution":{"observed_at":"2026-08-15T21:01:40.027471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:40.006175Z","title":"Jensen’s inequality","venue":null,"work_id":"06fee18d-c045-4ea3-82ed-f24fbd0f55e8","year":1937},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.674622Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:4a4f3e82bee34945fec78f50c9075a54e39e928bdc823ea90b43a466df53e488","observation_id":"db0dae6f-1b92-491a-9eec-622b4be87742","resolution":{"observed_at":"2026-08-15T21:01:40.011409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.990691Z","title":"Towards bridging sample complexity and model capacity","venue":null,"work_id":"11803809-0de4-4883-b57e-d5f9910f94d0","year":1972},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.679359Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:b48b023a702b5108182a314b5f7d126f5aabc35d6f74921ddd41fe254fb5f93a","observation_id":"53b6afc6-3b03-4001-99e5-aa01f5ddb3f2","resolution":{"observed_at":"2026-08-15T21:01:39.995610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.975583Z","title":"Towards interpreting and utiliz- ing symmetry property in adversarial examples","venue":null,"work_id":"6bb3b1ad-5a34-4627-8f19-d3d64ad20d0a","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.684246Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:a05101f7e3ff72eddfb05c737a66ce1d513e39fc3bfb03b8ef3c0238ffcc7a0f","observation_id":"037bcfe0-7300-451f-8c0e-90acd50e9d26","resolution":{"observed_at":"2026-08-15T21:01:39.980284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.960756Z","title":"Exploring and utilizing pattern imbal- ance","venue":null,"work_id":"990b1c82-5bd6-455a-8934-a6be375c3964","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.688557Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:931be26e96e503ca39a0300f8e48f83f24e08690097ecef5d397579aa12c5b7d","observation_id":"eb72ad7e-e4f0-4cb7-ac55-d7d92f501aee","resolution":{"observed_at":"2026-08-15T21:01:39.965557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.11562","last_updated":"2024-11-18T13:32:59Z","snapshot_observed_at":"2026-08-12T18:20:03.057276Z","submitted_at":"2024-11-18T13:32:59Z","title":"MSSIDD: A Benchmark for Multi-Sensor Denoising","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.11562","snapshot_observed_at":"2026-08-15T21:01:38.693131Z","title":"Mssidd: A benchmark for multi-sensor denoising","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.693131Z"},"links":{"cited_paper":"/paper/2411.11562","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e0f4e4d7d32c27657a0b49b9fc2a643eabeb5ecd7dceb7ef29aa2cf7c518907f","observation_id":"fc249f86-bb9e-4169-b426-df1f88ff3b4b","resolution":{"observed_at":"2026-08-15T21:01:38.693131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.946107Z","title":"Object- oriented anchoring and modal alignment in multi- modal learning","venue":null,"work_id":"19590422-6dbf-419a-b229-a2aeaec0c147","year":2025},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.697887Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:a9b1528dc2310d46e1a092f99e2f794f3623f8a0902cf9a43791fff25e9eb922","observation_id":"8667fbc0-cf70-4172-a709-7e11fe756667","resolution":{"observed_at":"2026-08-15T21:01:39.950715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.931887Z","title":null,"venue":null,"work_id":"0bc0a5d8-6c73-4a34-8296-b92b25cd3190","year":1987},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.702453Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:c74347aa4d0baf8f7aebd5f84b983d6eab1a8fc42ed6c50d919d78b57c02bb84","observation_id":"ab70750a-7f52-41d8-b35d-9c13d9cf1988","resolution":{"observed_at":"2026-08-15T21:01:39.936600Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.917259Z","title":"Analytic inequalities","venue":null,"work_id":"edbd965a-4519-414c-b7c2-317ec5d7441f","year":1970},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.706836Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:1b87050590ae03194542862b80e36d827a648e9a676590d77488b4b076487071","observation_id":"dfa2bc74-bcff-4279-9090-48d22c9a014a","resolution":{"observed_at":"2026-08-15T21:01:39.921950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.902201Z","title":"Slip: Self-supervision meets language- image pre-training","venue":null,"work_id":"5f2c9371-7da8-4982-b6bf-11d07dca6230","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.711315Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:2d96cf816c7e6d20360946f65cd4c63cb6a215f4a3b8cd76212d3a808f2c0019","observation_id":"779b1cb0-4418-4c9a-b5ee-c5bbc4d44e24","resolution":{"observed_at":"2026-08-15T21:01:39.907114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.886059Z","title":"Geodesic-former: A geodesic-guided few-shot 3d point cloud instance segmenter","venue":null,"work_id":"387801d8-8acc-41e7-82f7-87673cbe8933","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.715810Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:5e03ea8d4c2c1c761d55d876844f0deff55c72f9d7b34fac54928c06fb4e3f50","observation_id":"fa827551-edcc-4c9e-9912-3714a5411439","resolution":{"observed_at":"2026-08-15T21:01:39.891302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-15T21:01:38.720127Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.720127Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:69b7755bbb67e4b5fe4e9cd650a48e5a2a94b4e4015e19e1a31c4478237f03fb","observation_id":"365b3a40-91df-420d-8e36-a9d33cf78743","resolution":{"observed_at":"2026-08-15T21:01:38.720127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.870320Z","title":"Im2text: Describing images using 1 million cap- tioned photographs","venue":null,"work_id":"33d35920-a01a-4ce5-aa23-5d3ee141de2b","year":2011},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.724243Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:d58748449454694cb1b8da50454c463cfd54680a6a89099c0c45ff80faef7d66","observation_id":"02cfc387-40af-4776-aaca-1ce14fa83ce9","resolution":{"observed_at":"2026-08-15T21:01:39.874796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.855684Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":"e2ee8241-8def-4f26-9052-ba12b754e07d","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.728504Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:49b14370cadf0cbfc2bc4ee93c9468a64f1a2ab6d4a4566ab5ce29d7e05b8fa6","observation_id":"c050648a-b3e4-47df-b98c-50d09c10e2f9","resolution":{"observed_at":"2026-08-15T21:01:39.860351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06366","last_updated":"2022-10-03T11:47:10Z","snapshot_observed_at":"2026-08-13T14:45:57.387723Z","submitted_at":"2022-08-12T16:48:10Z","title":"BEiT v2: Masked Image Modeling with Vector-Quantized Visual Tokenizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06366","snapshot_observed_at":"2026-08-15T21:01:38.732801Z","title":"Beit v2: Masked image modeling with vector-quantized visual tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.732801Z"},"links":{"cited_paper":"/paper/2208.06366","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:7d73ad4fc971a1c9ba04a6739fd91656c03b6ee90a1ce5811e0628f9ba695478","observation_id":"cdca1922-b4c5-44fe-b249-9b550c72b70f","resolution":{"observed_at":"2026-08-15T21:01:38.732801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.841218Z","title":"Computational optimal transport: With applications to data science","venue":null,"work_id":"daa02951-4c52-41ae-9049-2fd8ac7e5bd6","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.737328Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:f2c719117fe59ed64d415f96c3f4b827a128bb5542a715bdffe03293bfea5f71","observation_id":"963c7e38-774e-441b-a3ab-26fa8a413f82","resolution":{"observed_at":"2026-08-15T21:01:39.845941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.826584Z","title":"Combined scaling for zero-shot transfer learn- ing","venue":null,"work_id":"8d6b43e8-1d47-46f5-8fb4-909f19693189","year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.741852Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:69061560ede88383ffdd140a0ce3b1dfb5181897f210235ec0ec0e9dbd006c8b","observation_id":"b1c8fd83-b920-4b38-bd53-203dd2f7e424","resolution":{"observed_at":"2026-08-15T21:01:39.831296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.811827Z","title":"Flickr30k entities: Collecting region-to- phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"b1f858a6-7dc4-4aeb-a0bc-0f9f5f0237b4","year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.746508Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:a136ff74072e309b718269bf862863ea7e149c00b31642ae7d43f0e49fa08e8e","observation_id":"a45f9e51-ef3b-4c23-9477-b6dc223754f4","resolution":{"observed_at":"2026-08-15T21:01:39.816611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.796323Z","title":"Straightest geodesics on polyhedral surfaces","venue":null,"work_id":"c8f785ac-5318-4113-99a3-b3c2d6698715","year":2006},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.751231Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:db457667d6fc71bba73d2e1fb56b75e5d7c783cea0bb5e6690243913b9e80ec3","observation_id":"3aa8b2b5-f6c8-432a-bfad-9389940629e9","resolution":{"observed_at":"2026-08-15T21:01:39.800960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.781652Z","title":"Graphwalks: Efficient shape agnostic geodesic shortest path estimation","venue":null,"work_id":"c3e4a8c2-5813-4479-b5a7-a9008352a8ee","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.755787Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:5f74533f518ceeab2166c4aee5eae9b04aea431bd0e7242edd6f472e1864a945","observation_id":"69d4cb8f-1a1c-4d7f-beaf-ea39ec9da25a","resolution":{"observed_at":"2026-08-15T21:01:39.786494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07966","last_updated":"2020-01-23T08:03:27Z","snapshot_observed_at":"2026-08-13T04:05:30.435237Z","submitted_at":"2020-01-22T11:35:58Z","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07966","snapshot_observed_at":"2026-08-15T21:01:38.760337Z","title":"Imagebert: Cross-modal pre- training with large-scale weak-supervised image-text data","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.760337Z"},"links":{"cited_paper":"/paper/2001.07966","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:830dabaad734a56b518e33427288245a8335fecdd31fc3b3c31659ee337ed101","observation_id":"83ece59c-1713-4f08-9db8-d05488a96e43","resolution":{"observed_at":"2026-08-15T21:01:38.760337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.766207Z","title":"Improving language under- standing by generative pre-training","venue":null,"work_id":"f1de6b15-ccde-4140-b565-ddd0a2a4892a","year":null},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.764854Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:34cd955554ecff2df861de1c1cb54a7335442f675ef1004c2fc2174e64b586b6","observation_id":"b91a6b2b-8976-4bc4-9df4-028ed954f459","resolution":{"observed_at":"2026-08-15T21:01:39.771893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.751420Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a50daa93-bf62-4ef7-a28e-3643d2608e5f","year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.770102Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:9f80c0f69d795b1103b0827ee8fd550be575de15fb03a9ed0959aeb70d624ec5","observation_id":"cf238571-3c66-4790-a28d-b0db7bb9eb3c","resolution":{"observed_at":"2026-08-15T21:01:39.756264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.735278Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"85bee4af-f375-4ee8-905f-ed4c1865c501","year":2015},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.774550Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:b7233923db89c6e8d91f09f5e2c3c4a6d747d575c021a123216303bd22ad9c27","observation_id":"34b842d2-b60f-445a-a601-22e99fb888e9","resolution":{"observed_at":"2026-08-15T21:01:39.739955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.719292Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization","venue":null,"work_id":"387185ef-40ec-4431-b11e-5793e667b099","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.779246Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e38332d9ceec31bfe76731bb2270214b004d5cf7411294698a25d2194e4d47f3","observation_id":"8da1e150-ae73-490d-a9c7-3157e38dbdf1","resolution":{"observed_at":"2026-08-15T21:01:39.724753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.704281Z","title":"Conceptual captions: A cleaned, hy- pernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"1b29f9c6-5731-4618-8418-07e0be0ee812","year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.783626Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:61d2587a833830b76f3fcc23d8875887b61230b82d8f3fc84202ca9cd514a1b6","observation_id":"71a53bd5-3456-4d4e-aa00-1ceb46daee9c","resolution":{"observed_at":"2026-08-15T21:01:39.709325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-15T21:01:38.788840Z","title":"Vl-bert: Pre-training of generic visual-linguistic representations","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.788840Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:5aca511454fe398558a5a98ab98fb70e64a1fc5348f633e3356ae4ee2d09abcf","observation_id":"ef6e53a7-c2d1-4362-8650-182f8a060ede","resolution":{"observed_at":"2026-08-15T21:01:38.788840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-15T21:01:38.793508Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.793508Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:b71cbc200cbdbdabfed063306a7df851daf98ec31e309b0a123703a9d26e04f1","observation_id":"37bb562b-fa2e-443f-b0de-ce00af6ef2dd","resolution":{"observed_at":"2026-08-15T21:01:38.793508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-14T18:05:37.795597Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-15T21:01:38.798297Z","title":"A corpus for reason- ing about natural language grounded in photographs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.798297Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:69dfbb3e88294edfce14f29b41f41a8ddf58e1789575be9f32acdda3ad52d6bc","observation_id":"2d304298-9594-4627-bfbf-0b7daf9418fe","resolution":{"observed_at":"2026-08-15T21:01:38.798297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.690089Z","title":"Revisiting unreasonable effective- ness of data in deep learning era","venue":null,"work_id":"1ec6e2b2-91d6-441b-9eee-d4b2af376ea9","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.802864Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3fa6af007ccfb3e10dbe4827a171d6504718f16dffae04387df2a8d314294caf","observation_id":"140a7beb-1be5-4a53-ad80-278df7e9ca50","resolution":{"observed_at":"2026-08-15T21:01:39.694704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.674206Z","title":"Gortler, and Hugues Hoppe","venue":null,"work_id":"0714001b-9467-4402-a4d6-6568ce20e807","year":2005},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.807626Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:91fd64a8dad9323878fe58e0f74d518ffc6c609b45a8c535965d427d7219c4e4","observation_id":"80e6a150-979d-4e34-96b5-8e289fb4060b","resolution":{"observed_at":"2026-08-15T21:01:39.680072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.660015Z","title":"LXMERT: learning cross-modality encoder representations from trans- formers","venue":null,"work_id":"814ab457-0ad1-4f2a-a8ff-723e762a6530","year":2019},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.812216Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:1cad4dd16e2d510d53b40303da197a9e1836ab468ff00ff4f99da3575cbaaa3c","observation_id":"71871314-e8da-4eb1-821a-1a4f8785f83e","resolution":{"observed_at":"2026-08-15T21:01:39.664840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.645601Z","title":"Tenenbaum, Vin de Silva, and John C","venue":null,"work_id":"3095ee81-e923-4029-a1f9-fd1fc3aa9f8d","year":2000},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.816540Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:c4c1957ee63cfb4a2f30355484ba588a3de7387dc6343f9f55e97554a33a313b","observation_id":"06bf8c74-6ea4-4cce-afc8-ea3c2782f5ee","resolution":{"observed_at":"2026-08-15T21:01:39.650272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.631330Z","title":"Pigeon hole principle","venue":null,"work_id":"7d9d78ef-1b81-41f4-b513-cdecaf4eb296","year":1990},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.821250Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:bd6130f6013a3ce5239beb174f9b3c8b941e0466ebc242259e53a9c0ec5acdc2","observation_id":"65913de9-b905-4a15-910a-51ccf44688da","resolution":{"observed_at":"2026-08-15T21:01:39.635830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.616669Z","title":"Attention is all you need","venue":null,"work_id":"7c241388-44c4-47cc-b7c0-e76d6932b524","year":2017},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.826010Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:dcad6d218b84ad0b755cc529bf0eaf58dcc677e7cd39bf5e98f40159af3bc9ee","observation_id":"403d64ff-a537-4552-8f49-4041e217dbac","resolution":{"observed_at":"2026-08-15T21:01:39.621277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.601429Z","title":"Optimal transport: old and new","venue":null,"work_id":"2e51b488-78d1-4690-a341-80119d15582d","year":2009},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.831030Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:58bd7a49940b772927164aba569d4d5d2c6ecb7e353550f3fbce7c0351ea1269","observation_id":"db607275-2142-4af8-8dd8-14cb766e6385","resolution":{"observed_at":"2026-08-15T21:01:39.606340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.586928Z","title":"Learning to combine: Knowledge aggrega- tion for multi-source domain adaptation","venue":null,"work_id":"fa846bdb-2d10-4389-a7c7-fca96691d653","year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.835846Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:7171c192a6fe7bbffed7dd89675db0ec58585aec25b7c63b355f2c8e09a2bd4e","observation_id":"2dcf3c28-e99f-4ec3-ae7c-e8c33c20b304","resolution":{"observed_at":"2026-08-15T21:01:39.591726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-15T21:01:38.840420Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.840420Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:27b8efb579cb7e1849ad46d33ccf68607e2ec80e183c7661b6fe126bfb93a278","observation_id":"7c0b0f61-e2b7-46d9-bb19-459480b1a9e1","resolution":{"observed_at":"2026-08-15T21:01:38.840420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.572304Z","title":"Mvp: Multimodality-guided visual pre-training","venue":null,"work_id":"d3407d54-652e-479e-aab8-63287876f247","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.845368Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:3ca315944562522d96f1e50a658e253be4244e56d9c2db6e12dab81ad218c23d","observation_id":"55b012a0-b38b-49f9-b321-51c4f2c794b8","resolution":{"observed_at":"2026-08-15T21:01:39.577128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.06706","last_updated":"2019-01-20T17:55:05Z","snapshot_observed_at":"2026-08-14T17:28:29.344751Z","submitted_at":"2019-01-20T17:55:05Z","title":"Visual Entailment: A Novel Task for Fine-Grained Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.06706","snapshot_observed_at":"2026-08-15T21:01:38.849934Z","title":"Visual entailment: A novel task for fine-grained image understanding","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.849934Z"},"links":{"cited_paper":"/paper/1901.06706","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:30c995c208b4da3fd6d15164c0e88fb77f4c790e8a075e3dab928f9adff31f90","observation_id":"deaa2c2d-f7ac-4aec-a500-d1e3e843a593","resolution":{"observed_at":"2026-08-15T21:01:38.849934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.557417Z","title":"A fast proximal point method for computing exact wasserstein distance","venue":null,"work_id":"46c2ce49-398c-407e-a06b-75647b284382","year":2020},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.854916Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:bf12459e66106197f1cb5974216d73840ec0deca6ec9294b7d4608902b34d5a8","observation_id":"35dd7e54-89fe-4315-8fb4-62c1fc13119e","resolution":{"observed_at":"2026-08-15T21:01:39.562192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.542881Z","title":"Vision-language pre- training with triple contrastive learning","venue":null,"work_id":"2668a5c7-15b9-4edb-bfa0-d8f6b74baff3","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.859498Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:37dcc6b79ac6a5dee674aa27c67cee1e5adaf004ffbd3a3d8a317844c5d21be5","observation_id":"9f1ffb73-0c4f-45eb-8907-460c0cd33c99","resolution":{"observed_at":"2026-08-15T21:01:39.547744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.528355Z","title":"Unified contrastive learning in image-text-label space","venue":null,"work_id":"f25beadc-a26d-4826-a1fd-83194aaebc81","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.864421Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:342eade588f7235c22f7adc3b4357a0b1db750a2ee6beb76f3762b1b5a2ad0f3","observation_id":"89478e07-0d26-4164-881d-72924a471f13","resolution":{"observed_at":"2026-08-15T21:01:39.533274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-08-13T15:16:57.345726Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-15T21:01:38.868708Z","title":"Filip: Fine-grained in- teractive language-image pre-training.arXiv preprint arXiv:2111.07783, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.868708Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e3b5267711c6c9c5ef4b0d344fa28cbc7b3c3becff11cdce6cd8ffadceb82d22","observation_id":"957b594d-6f13-47fe-96d9-93b44a7a7eb9","resolution":{"observed_at":"2026-08-15T21:01:38.868708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:39.513664Z","title":"FILIP: fine-grained interactive language-image pre-training","venue":null,"work_id":"450625eb-16b0-4cbd-a5e4-b62933328c0d","year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.873663Z"},"links":{"citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:e972a1768fc7c113f95c2e4258e9a30cc5f639b4593d16bd36cc9b67e729ea13","observation_id":"5c558f01-be97-4bf8-aa03-68cd271fc20d","resolution":{"observed_at":"2026-08-15T21:01:39.518572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-13T15:12:42.567441Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-15T21:01:38.878311Z","title":"Coca: Contrastive captioners are image-text founda- tion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:38.878311Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.11216"},"observation_digest":"sha256:89eb189b85b40ee5bfb28bfe244649edae0b5a5ef008aa770de79bf2ceeeee7c","observation_id":"132e1aec-03d9-42ba-a78b-d52284e19a45","resolution":{"observed_at":"2026-08-15T21:01:38.878311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11216","last_updated":"2025-05-16T13:12:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T23:38:07.984232Z","submitted_at":"2025-05-16T13:12:41Z","title":"GeoMM: On Geodesic Perspective for Multi-modal Learning"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":3,"verified_fuzzy":44},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2505.11216."}