{"as_of":"2026-08-23T00:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4c81f597948c0eaa827e8372c8d30c3d458c57dd21d8a9d6a40292590016f825","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:53:40.274702Z","state":"measured"},{"denominator":22,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":22,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T04:53:37.109195Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T04:53:40.793301Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":"2509.05925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.05925","snapshot_observed_at":"2026-08-05T04:53:40.793301Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","venue":"cs.CV","work_id":"ae031f28-a18c-4209-a95e-8e3a31a67f8b","year":2025},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.109195Z"},"links":{"cited_paper":"/paper/2509.05925","citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:7ec1f65dadb89c42073ad6ecc8831e5e79c3ea92e2401edf74e5e5bb3cac6722","observation_id":"4da74bc6-7662-495c-8f57-b1581587e833","resolution":{"observed_at":"2026-08-05T04:53:40.956069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.05925/citation-record","integrity":"/paper/2509.05925/integrity","json":"/paper/2509.05925/citation-record.json","paper":"/paper/2509.05925"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":"2509.05925","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.05925","snapshot_observed_at":"2026-08-05T04:53:40.793301Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","venue":"cs.CV","work_id":"ae031f28-a18c-4209-a95e-8e3a31a67f8b","year":2025},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.109195Z"},"links":{"cited_paper":"/paper/2509.05925","citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:7ec1f65dadb89c42073ad6ecc8831e5e79c3ea92e2401edf74e5e5bb3cac6722","observation_id":"4da74bc6-7662-495c-8f57-b1581587e833","resolution":{"observed_at":"2026-08-05T04:53:40.956069Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:45.604092Z","title":"In this paper, we exploit the CLIP model [10], which aligns images’ visual features with corresponding textual descriptions using contrastive learning","venue":null,"work_id":"95badc1f-5f68-4f6a-ad4c-85135a36c660","year":null},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.212450Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:6ea0feb6288fc9696a5f1d809419afed3cfca7ccf21a02c88bceffb760d87691","observation_id":"3e4b8b92-64d7-45bf-ae39-e9e3b8a96ae0","resolution":{"observed_at":"2026-08-05T04:53:45.779523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:45.294272Z","title":"Overall architecture The proposedPQVAE-sharedscheme for feature compression is illustrated in Fig","venue":null,"work_id":"d03f0c05-7d84-4e0e-886c-625969f70dcb","year":null},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.365495Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:b260147dfd3ca703b98f663f215f0f7562401b76fdbff9f7971fcab302b36bf4","observation_id":"b930a5d7-96a3-4c70-88c8-709ac71c5bb9","resolution":{"observed_at":"2026-08-05T04:53:45.460737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:45.017694Z","title":"ViT-L/14@336px","venue":null,"work_id":"59f7fe36-17de-4497-a859-757950257c40","year":null},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.545821Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:539df159fcdbe3cff454c7f3094933ad1fcfa5db467ead4ce0e01ddb9e4eaf15","observation_id":"98ba6847-84da-4c22-837f-686021cfa1aa","resolution":{"observed_at":"2026-08-05T04:53:45.157943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:44.713904Z","title":"Experiments demonstrate that original CLIP features can be compressed more than 30-fold while maintaining satisfactory semantic preservation","venue":null,"work_id":"9faa3968-5e18-4f81-bc4c-9d62e7938608","year":null},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.732831Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:ea69dc50447eec60d3122b3e7219fc2bc4b27e8ede0b4526207d786a5c583930","observation_id":"49c524aa-4c30-4682-96c8-ff1e1e88ae93","resolution":{"observed_at":"2026-08-05T04:53:44.881018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:44.388711Z","title":"Variational image compres- sion with a scale hyperprior,","venue":null,"work_id":"5ea06215-6631-40b2-be01-33a85fb17dd5","year":2018},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.846515Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:668a297147c32b157fda16756094bd57ac9c9e44da7c4d8c2a63a760604a353b","observation_id":"4c18d651-de56-42e2-948b-856674ad208a","resolution":{"observed_at":"2026-08-05T04:53:44.538181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:44.132104Z","title":"Learned image compression with discretized gaussian mixture likelihoods and attention modules,","venue":null,"work_id":"d05cf30b-a518-4b32-b329-20e7aa070566","year":2020},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:37.990074Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:0409394630138fe95553b0cbaa83ef90dae39c1eabe3a202bae18d9ad583834d","observation_id":"c30253b3-e511-40cb-ae82-a0938a3096a3","resolution":{"observed_at":"2026-08-05T04:53:44.229520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:43.744991Z","title":"LotteryCodec: Searching the implicit representation in a random network for low-complexity image compression,","venue":null,"work_id":"c9e7cd60-2a10-446e-b333-48f5560bc5a2","year":2025},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:38.128128Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:8f2cf4b96bf81572d26d82abee0a22baae5da938e8c8c5a6052bc1831e319579","observation_id":"0faa6861-b94f-4fd5-8f15-ff29a2154ebb","resolution":{"observed_at":"2026-08-05T04:53:43.937660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:43.422065Z","title":"DiffCP: Ultra-low bit collaborative perception via diffusion model,","venue":null,"work_id":"359126ae-c264-4b08-8707-5530eba0f503","year":2025},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:38.325003Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:3474e8b16168865eb01e4c2e8e8d8652b4628070ee22f35c5102d5bfdc922798","observation_id":"79f7c581-45c2-4254-93f9-a973395c26ef","resolution":{"observed_at":"2026-08-05T04:53:43.585584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:43.109596Z","title":"Edge computing with artifi- cial intelligence: A machine learning perspective,","venue":null,"work_id":"9410d7e3-5fd5-4417-a2ba-e70f2f2e97d2","year":2023},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:38.471273Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:d961904e06f788b26cfcfac24b123e520a5831da096efaaed9fc8a9e79990295","observation_id":"3f440b27-71b5-44d2-baa4-fd5054b0754a","resolution":{"observed_at":"2026-08-05T04:53:43.228545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18200","last_updated":"2025-05-29T05:24:20Z","snapshot_observed_at":"2026-08-16T12:55:21.787781Z","submitted_at":"2025-02-25T13:41:06Z","title":"Zero-Shot Semantic Communication with Multimodal Foundation Models","version":2},"cited_work":{"arxiv_id":"2502.18200","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.18200","snapshot_observed_at":"2026-08-05T04:53:40.512787Z","title":"Zero-Shot Semantic Communication with Multimodal Foundation Models","venue":"eess.SP","work_id":"b1d4e793-33e5-4433-a0c4-be97277d4795","year":2025},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:38.668546Z"},"links":{"cited_paper":"/paper/2502.18200","citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:5be1ac822bd8f30effd4db2476780ea98709b373b3c5c8231dea0b20e4c6e764","observation_id":"8344dd89-30d4-4e30-9f33-5b5450bedc06","resolution":{"observed_at":"2026-08-05T04:53:40.618283Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:42.857605Z","title":"Beyond transmitting bits: Context, semantics, and task-oriented communica- tions,","venue":null,"work_id":"196ed48d-7d72-405f-adc5-87c1cc332679","year":2022},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:38.799433Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:d64ab1318e0d6d1bb28d93b29d16782d8005e65e24f8ae8491e40d7640ed6b1c","observation_id":"5f18c227-aa9e-44d9-8dd5-6fea3e89f022","resolution":{"observed_at":"2026-08-05T04:53:42.994790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:42.557906Z","title":"DeepSIC: Deep seman- tic image compression,","venue":null,"work_id":"741604a0-6cad-4600-8501-1a27941ae373","year":2018},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:38.928515Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:98b336fc68c9d3712c554a538906eadb11dc7730eb81159be42d669fc47f2e2d","observation_id":"726ecdf7-0423-452b-bb21-9a7230df89af","resolution":{"observed_at":"2026-08-05T04:53:42.704977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:42.329756Z","title":"Semantic-aware video compression for automotive cameras,","venue":null,"work_id":"d750cdf1-cb28-4bd6-ac34-17567f3ec4d9","year":2023},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:39.116202Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:60c8b2298cf86407b5da507918b4e06494f35cc8af1269a150531a042a7ba6b2","observation_id":"d44ca2ab-d800-49d6-bc68-a7c436f92386","resolution":{"observed_at":"2026-08-05T04:53:42.441709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:39.260529Z","title":"Learning transferable visual models from natural lan- guage supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:39.260529Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:4b389385c6c834ec2dd61fedfcc6cf639fc2d06b3d8c47461e9bc26465320e46","observation_id":"bd65ecac-78b6-4594-bdb6-76471a14d328","resolution":{"observed_at":"2026-08-05T04:53:39.260529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:42.045449Z","title":"Visual instruction tuning,","venue":null,"work_id":"9ebf6373-5422-436d-ae6b-2c10d02eebb5","year":2023},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:39.427350Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:b2d7c86bd3cf0945ef4cd01974e25e2d8133049d1f1394c0ed451a5d19239874","observation_id":"08a3f453-71aa-47f5-8cdb-67d81a778822","resolution":{"observed_at":"2026-08-05T04:53:42.182134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:41.755712Z","title":"Neural dis- crete representation learning,","venue":null,"work_id":"79d5b0a5-62ef-4cc7-b7d8-a13a3b989fef","year":2017},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:39.607838Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:9792c8c26db80763776c0602c9e125993baec8848a127ed5b1420c5a678892f4","observation_id":"45688dfc-2174-42b4-b4c8-c112b8b33677","resolution":{"observed_at":"2026-08-05T04:53:41.912848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:41.358529Z","title":"Learning product code- books using vector-quantized autoencoders for image re- trieval,","venue":null,"work_id":"8bcef74b-0313-4899-814b-9ef04b0b56e4","year":2019},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:39.802706Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:344eb6a2eb5f386e910490885929e33416fc9822cf38ff4be7255d69daeb2d08","observation_id":"56b51f31-9b2b-414a-8f29-7f39a4720ab9","resolution":{"observed_at":"2026-08-05T04:53:41.541895Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:41.086599Z","title":"Image coding for machines with edge information learning using segment anything,","venue":null,"work_id":"66c13d62-f488-4770-a370-e9e47b9ec239","year":2024},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:39.940748Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:bd61d9d59c7c4c3659713684c3fb1147c255010362402964128d899cf67bdf28","observation_id":"767f95a8-06b9-401a-92d3-e93b484ed41f","resolution":{"observed_at":"2026-08-05T04:53:41.188624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-05T04:53:40.077127Z","title":"Clip- cap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:40.077127Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:0f7d2bb506b4c1b389d747457ce017510636f3885c1c3b898b585ed31866bbd2","observation_id":"cdb27136-dcf8-43a4-98ed-2f7bc45059c5","resolution":{"observed_at":"2026-08-05T04:53:40.077127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T04:53:40.274702Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T04:53:40.274702Z"},"links":{"citing_paper":"/paper/2509.05925"},"observation_digest":"sha256:8a930ecd1a3bef0a640004438896a65c024533e31373cc76595c01d66c57b6ea","observation_id":"070a47ef-e630-4fa9-8a2c-d9f9301890bd","resolution":{"observed_at":"2026-08-05T04:53:40.274702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.05925","last_updated":"2025-09-07T04:49:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-22T06:59:41.296706Z","submitted_at":"2025-09-07T04:49:25Z","title":"Compression Beyond Pixels: Semantic Compression with Multimodal Foundation Models"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":16},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 1 inbound Pith citation observation for arXiv:2509.05925."}