{"as_of":"2026-08-08T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4360d14d649833f3768fd72bc6ba45b8c592a23391d84fc419ded812be6996ec","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:00:57.269520Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T18:48:40.813486Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T18:53:08.558584Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"cited_work":{"arxiv_id":"2506.03174","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03174","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7fa76960-680b-4b65-b75d-98b656105c92","year":2025},"citing_paper":{"arxiv_id":"2604.02711","last_updated":"2026-04-08T23:13:03Z","snapshot_observed_at":"2026-08-04T09:42:48.573822Z","submitted_at":"2026-04-03T04:09:47Z","title":"Foundation Models Defining A New Era In Sensor-based Human Activity Recognition: A Survey And Outlook","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-13T18:48:40.813486Z"},"links":{"cited_paper":"/paper/2506.03174","citing_paper":"/paper/2604.02711"},"observation_digest":"sha256:9e671bab1dee8b06eec2e32ae6d7dfb717fbd59d9685eff446cd76c581774596","observation_id":"b21a931f-3449-4056-aa31-7922c9c1bef5","resolution":{"observed_at":"2026-05-13T18:53:08.561045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03174/citation-record","integrity":"/paper/2506.03174/integrity","json":"/paper/2506.03174/citation-record.json","paper":"/paper/2506.03174"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.808335Z","title":"Imu2doppler: Cross-modal domain adaptation for doppler-based activity recogni- tion using imu data","venue":null,"work_id":"f0175577-4537-4469-8de1-3112f40a915e","year":2021},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:54.638915Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:915a55dd1affd01c05c3009a8b22c2ffa6c435fae70fad2e47d3c038efa4f82e","observation_id":"16a36a81-077d-46e7-a36f-4083957d07ed","resolution":{"observed_at":"2026-08-07T13:01:00.850539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T13:00:54.721113Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:54.721113Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:aa76c70111adc1566aabeaf259c311de7cb145afbf4030fb4c5aab7e6ad734a1","observation_id":"8bff663f-f3eb-43fa-b3b0-4ef0b53668d9","resolution":{"observed_at":"2026-08-07T13:00:54.721113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.702556Z","title":"Language models are few-shot learners","venue":null,"work_id":"36e113c4-4139-44a3-8116-a4080376d731","year":1901},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:54.905897Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:0734c28ac284762ecdb1f0f18198291e24a6b5d9b400a785ad5ccedebd2b606e","observation_id":"1b25788c-f478-4172-92fd-1146224a4682","resolution":{"observed_at":"2026-08-07T13:01:00.755749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.556195Z","title":"A simple framework for contrastive learning of visual rep- resentations","venue":null,"work_id":"707ef1c3-60d3-4edf-84d7-23340dc914d9","year":2020},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:54.994473Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:26e4f4063b07429cdb20b1ddfed90ae89a5f40cb1e7f9e1d947c12108c538476","observation_id":"c3f689f4-cc84-4fd9-be40-1aa9686ba0cc","resolution":{"observed_at":"2026-08-07T13:01:00.630434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.440006Z","title":"Cocoa: Cross modality contrastive learning for sensor data","venue":null,"work_id":"cd065b17-eeb6-47ed-8284-3182f7fbdbbc","year":2022},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:55.164807Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:57bd79290102e1cc4a3766200ad8faca5abf57deeac2dd8972cc59dfdc4b6ae2","observation_id":"68343256-f6bf-4e42-84e0-2d6f2257020b","resolution":{"observed_at":"2026-08-07T13:01:00.504764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.335797Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"fb542039-bbf7-4ebd-834c-3a7610ce9a15","year":2019},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:55.333310Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:8da8ed015be2d1e7867d7136b4aa9c665fd9d1d458ccb2a130193ce0cd172712","observation_id":"8b01799c-bc06-48b2-bc2a-217120cae277","resolution":{"observed_at":"2026-08-07T13:01:00.389718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.219100Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"2a74509a-8259-41d2-9cb2-8a02cf32d475","year":2021},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:55.467050Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:e36e48e491ff1eba73e97dcdbb2f563d672a5a64a88321749da486b360d16229","observation_id":"891f8e61-de52-4458-bb5d-6f8b6a13cf41","resolution":{"observed_at":"2026-08-07T13:01:00.283744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:01:00.109558Z","title":"Unsupervised representation learning by predicting image rotations","venue":null,"work_id":"cd762679-3845-4eb7-9b6a-af8a18846ec0","year":2018},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:55.592184Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:66d58e219f2c052751bff0230bfe75ba4a1797a1f2e3f126297bd401b842fd83","observation_id":"41046ee5-395c-46a1-8b43-a8a24aefe8de","resolution":{"observed_at":"2026-08-07T13:01:00.153940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.996332Z","title":"Image- bind: One embedding space to bind them all","venue":null,"work_id":"204ef38e-0373-42f2-af47-dc2a240072f3","year":2023},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:55.771780Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:7685add5683224d07765199d02bceecbe48b5581e3dfa5da8905ab24636c90a5","observation_id":"dcd26bd9-5bc2-4823-a973-f76ed14f6b48","resolution":{"observed_at":"2026-08-07T13:01:00.054850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.860147Z","title":"Ego4d: Around the World in 3,000 Hours of Egocentric Video","venue":null,"work_id":"a633f60f-e155-4d81-8450-52dd197e7cb5","year":2022},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:55.908690Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:c215773f46356cf979aa014b7a1253b7e1566b8262c3a453a481ee486c426804","observation_id":"ac55b056-73d0-4946-a78a-6673ca449ed9","resolution":{"observed_at":"2026-08-07T13:00:59.932890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.748636Z","title":"Bikram Boote","venue":null,"work_id":"a7ae17d3-a33c-41cd-8afc-bb20ca19db8c","year":2024},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.014994Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:8099af5b20760dffef0c9c47bc0ba83d5e95a58e4d8e6cd6c4a119770dbf4d04","observation_id":"4d119b10-d556-433c-9b7a-9e3298c30105","resolution":{"observed_at":"2026-08-07T13:00:59.802040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.594908Z","title":"Momentum contrast for unsupervised visual representation learning","venue":null,"work_id":"5c9b5f89-0dae-4958-9809-e258c6d17401","year":2020},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.134192Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:a67606fa90a19013eae53bebf1245871d3ff222ba85ee97cea97ab0bc1cc21ab","observation_id":"32cc8468-8017-4f3d-a36d-83beeb0ac547","resolution":{"observed_at":"2026-08-07T13:00:59.678019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.364903Z","title":"Abowd, Nicholas D","venue":null,"work_id":"ca0cd322-6356-4c15-9893-1aec27a90937","year":2020},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.257477Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:c5750aff31489b968b1840cca1d3fc1cd72463fc1d5b5d2647878cec7933de38","observation_id":"f74cddfb-b989-4817-b9a7-ad8596a693a9","resolution":{"observed_at":"2026-08-07T13:00:59.480671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.177701Z","title":"Imu2clip: Language- grounded motion sensor translation with multimodal contrastive learning","venue":null,"work_id":"785ea5c3-df50-48f1-a092-0b455a967b55","year":2023},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.403102Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:ac77c5962a7fdfe4bb451ab74740ed5e4134165a603882338b2ee12345194d25","observation_id":"18cf59d9-431f-46fe-9bab-935f3ec5e0f9","resolution":{"observed_at":"2026-08-07T13:00:59.268626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:59.030152Z","title":"Unsupervised learning of visual representations by solving jigsaw puzzles","venue":null,"work_id":"b7c91688-2dad-4d30-bd74-38166c78bf7e","year":2016},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.521970Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:8a5b85548725f8eee1a8de00f72a7bfb2417f1aeceb3645b5eec50b7dc0ec374","observation_id":"b69b3137-9803-4b1e-be10-d40b09221670","resolution":{"observed_at":"2026-08-07T13:00:59.092399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.864070Z","title":"Berkeley mhad: A comprehensive multimodal hu- man action database","venue":null,"work_id":"d6b3d8c3-a8c2-427d-9464-72892f890d51","year":2013},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.611697Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:8c6d68e3ad6542d71b56609ba5bc7301ff3d4918362daca89fe1287ef598a2f2","observation_id":"a2d4a8ff-dde6-4724-abf4-ec026832e11e","resolution":{"observed_at":"2026-08-07T13:00:58.953308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T13:00:56.725182Z","title":"Representation learning with contrastive predictive coding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.725182Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:d39a0b8cab7df39b715df924a5789f7e380dc4f1ac7083a105472f4046650e53","observation_id":"49b5eea2-86a3-462f-9330-259b650d4555","resolution":{"observed_at":"2026-08-07T13:00:56.725182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.663668Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"0176a523-7118-4e2c-a317-8d853eb4dab1","year":null},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.873258Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:5245b72fc596b3b2b92bac6f6fb529672a6fd10b643910faa65ce44c1f8dca82","observation_id":"83348343-c0bb-4265-9d8a-5b56c66c07a1","resolution":{"observed_at":"2026-08-07T13:00:58.748914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.203260Z","title":"Introducing a new benchmarked dataset for activity monitoring","venue":null,"work_id":"9bcced73-ef74-4cd3-9e2d-7b5f55c9ab9b","year":2012},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.039481Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:30b39a3efe335580457ef549ea3696f2e2b046030558d005427d55b601dd6341","observation_id":"39090540-1c75-47bf-b82a-a74a8a7cd8d0","resolution":{"observed_at":"2026-08-07T13:00:58.322693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.991336Z","title":"Facenet: A unified embedding for face recognition and clustering","venue":null,"work_id":"6c6361aa-5b4d-4416-8beb-9e8079afaa5b","year":2015},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.144155Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:c207f1e309c6369876910fcb23b026545857a32256304dabf2259827f993ac0f","observation_id":"e37e35de-baae-4f25-b6c2-d3de0b12a788","resolution":{"observed_at":"2026-08-07T13:00:58.093811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.723374Z","title":null,"venue":null,"work_id":"1ea60477-2954-41df-aeeb-f7aff5c40a07","year":2022},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.189278Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:5754146800f0dcd27b42022941e6b7c2ba3d241aa330aada9cc172dd1f6dce60","observation_id":"3665b6c9-fc31-4d2f-b6b7-d7faa8705c47","resolution":{"observed_at":"2026-08-07T13:00:57.842932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.484026Z","title":"Atten- tion is all you need","venue":null,"work_id":"144330fb-9ac7-4442-9b0c-524475c959e0","year":2017},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:57.269520Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:a067c1ec0baeb589e8248b0f89b419ace7f4aea80c46a2e793fa2126a9aff152","observation_id":"89a62ae4-eec6-457f-8d73-b4eef2a6e5cd","resolution":{"observed_at":"2026-08-07T13:00:57.583075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.433397Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks IJABC: International Journal of Activity and Behavior Computing 25","venue":null,"work_id":"031afb9b-3883-4dd7-ad6a-9595f8d9094f","year":2021},"citing_paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks","version":1},"reference_index":8763,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:56.971111Z"},"links":{"citing_paper":"/paper/2506.03174"},"observation_digest":"sha256:601765e4597c35d89d42757f9dfa158e42791bacc0ac6cf6aff4f7d3ecc0eb07","observation_id":"402185f3-1984-4164-915a-eb865fc894f0","resolution":{"observed_at":"2026-08-07T13:00:58.539978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03174","last_updated":"2025-05-29T01:47:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T12:53:35.804557Z","submitted_at":"2025-05-29T01:47:43Z","title":"Multimodal Foundation Model for Cross-Modal Retrieval and Activity Recognition Tasks"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 1 inbound Pith citation observation for arXiv:2506.03174."}