{"as_of":"2026-08-08T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06457c430fbcf5ec515be2d69a51774629dbc737a00a26f69b5b049bb0224118","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:42:19.724749Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:19:13.788988Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-07T12:42:19.724749Z","title":"Contrastive lo- calized language-image pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23766","last_updated":"2025-05-29T17:59:56Z","snapshot_observed_at":"2026-08-08T00:05:10.710300Z","submitted_at":"2025-05-29T17:59:56Z","title":"Argus: Vision-Centric Reasoning with Grounded Chain-of-Thought","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:42:19.724749Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2505.23766"},"observation_digest":"sha256:c311267a8845518c30790a0b48111fac518039d76ff347e05cc073979c609451","observation_id":"10317e8e-dfcd-4da6-b919-f54e55f45b5d","resolution":{"observed_at":"2026-08-07T12:42:19.724749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-06T20:37:31.659608Z","title":"Con- trastive localized language-image pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02273","last_updated":"2025-07-03T03:27:11Z","snapshot_observed_at":"2026-08-06T20:30:53.679444Z","submitted_at":"2025-07-03T03:27:11Z","title":"Fx-Encoder++: Extracting Instrument-Wise Audio Effects Representations from Mixtures","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:37:31.659608Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2507.02273"},"observation_digest":"sha256:04c732c5d883ceaa27e73d9be7a28fc7414f3c25dd221943d42d4f02d2fe6154","observation_id":"db769080-4e8a-4ec9-bb79-9fcfc021e317","resolution":{"observed_at":"2026-08-06T20:37:31.659608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-05T18:47:45.225148Z","title":"URL https://arxiv.org/abs/2410.02746","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18235","last_updated":"2025-08-20T00:57:21Z","snapshot_observed_at":"2026-08-05T18:44:01.835548Z","submitted_at":"2025-08-20T00:57:21Z","title":"Sealing The Backdoor: Unlearning Adversarial Text Triggers In Diffusion Models Using Knowledge Distillation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T18:47:45.225148Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2508.18235"},"observation_digest":"sha256:66620bcc5ea014b673c34296c204d638771cd85e531e8237b6b32481cbe09f5e","observation_id":"97a0e847-3537-4f22-8915-6afb4ad9b595","resolution":{"observed_at":"2026-08-05T18:47:45.225148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-05T10:46:04.661105Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03800","last_updated":"2025-09-04T01:28:44Z","snapshot_observed_at":"2026-08-07T21:49:24.536323Z","submitted_at":"2025-09-04T01:28:44Z","title":"MedVista3D: Vision-Language Modeling for Reducing Diagnostic Errors in 3D CT Disease Detection, Understanding and Reporting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:46:04.661105Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2509.03800"},"observation_digest":"sha256:08c110710ebc97c456a310ba35374b07e754c16e016b9d942e2a21d05cfd8a93","observation_id":"41ed5110-7327-4e3d-bafa-1a1622ef2ee5","resolution":{"observed_at":"2026-08-05T10:46:04.661105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-04T10:18:42.682062Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10921","last_updated":"2026-05-25T02:35:42Z","snapshot_observed_at":"2026-08-04T10:18:40.408381Z","submitted_at":"2025-10-13T02:32:07Z","title":"FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T10:18:42.682062Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2510.10921"},"observation_digest":"sha256:431c41b28239e63cc1570de847c8e4df3770d453c4452a68bffc15e163fc8a03","observation_id":"21d5ce15-807a-4a5b-b0db-72252ee48611","resolution":{"observed_at":"2026-08-04T10:18:42.682062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2604.09552","last_updated":"2026-06-05T13:56:30Z","snapshot_observed_at":"2026-08-03T06:07:39.172822Z","submitted_at":"2026-01-31T03:09:47Z","title":"MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T09:29:32.250418Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2604.09552"},"observation_digest":"sha256:b89986a8de4b98f48de59f850f9e5c5564d92d68d8254340c3e8757c645494ca","observation_id":"206d0ac7-b75d-4f82-bf73-4bb50d3769c9","resolution":{"observed_at":"2026-05-16T09:30:48.231935Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-03T06:07:40.022288Z","title":"Contrastive localized language-image pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.09552","last_updated":"2026-06-05T13:56:30Z","snapshot_observed_at":"2026-08-03T06:07:39.172822Z","submitted_at":"2026-01-31T03:09:47Z","title":"MCERF: Advancing Multimodal LLM Evaluation of Engineering Documentation with Enhanced Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:07:40.022288Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2604.09552"},"observation_digest":"sha256:74ebb0561f6c3f6eed6eccf2bd172030503d224e7d8b023527aa00c616d66e5e","observation_id":"b6db835f-6bf8-4700-a978-b909f73139ca","resolution":{"observed_at":"2026-08-03T06:07:40.022288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2605.29776","last_updated":"2026-05-28T11:21:44Z","snapshot_observed_at":"2026-08-03T05:52:15.988085Z","submitted_at":"2026-05-28T11:21:44Z","title":"Improving CLIP Adaptation by Breaking Tail Alignment for Source-Free Cross-Domain Few-Shot Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:16:57.329872Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2605.29776"},"observation_digest":"sha256:288ff22595cc37ec8708d607097958f01fca837691117fc82c454bf6b5943e3b","observation_id":"14c2ff8d-487a-420e-9634-def8d146bdca","resolution":{"observed_at":"2026-06-29T08:23:15.562958Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-06-28T15:18:17.427707Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:de3da46669d1b03453ccc19cafc5d796be634f58e146a0e36ede337e7678ea1e","observation_id":"3c81927d-03e5-4188-a63f-84cfb6a3c2b0","resolution":{"observed_at":"2026-07-01T22:36:16.876040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2606.01825","last_updated":"2026-07-01T05:50:06Z","snapshot_observed_at":"2026-08-05T10:25:09.105468Z","submitted_at":"2026-06-01T07:41:44Z","title":"ROGLE: Robust Global-Local Alignment with Automated Region Supervision for Text-Based Person Search","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-02T23:17:03.456746Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2606.01825"},"observation_digest":"sha256:ecaeb70db546463da862fd6ce285544e3c8c8c78a6e747cb24008c1ab54e3b13","observation_id":"2c58a7a9-7f40-4e70-a6dd-a1069d22512b","resolution":{"observed_at":"2026-07-02T23:17:28.864002Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":"2410.02746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-07-04T00:19:13.788988Z","title":"Contrastive localized language-image pre-training","venue":null,"work_id":"73043e5e-bcc6-467c-9c9e-5ed3881fc65a","year":2024},"citing_paper":{"arxiv_id":"2606.19489","last_updated":"2026-06-17T18:27:17Z","snapshot_observed_at":"2026-08-08T00:47:44.045909Z","submitted_at":"2026-06-17T18:27:17Z","title":"Concept Flow Models: Anchoring Concept-Based Reasoning with Hierarchical Bottlenecks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T21:16:21.252304Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2606.19489"},"observation_digest":"sha256:d34be87a6b3b20c46ba19fede868617d150492c7a3f31309737e52493eef69b9","observation_id":"7cb20dff-3047-436b-b11c-4a52cd1dafc0","resolution":{"observed_at":"2026-07-04T00:19:13.790413Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02746","snapshot_observed_at":"2026-08-01T11:31:04.191369Z","title":"Contrastive localized language-image pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19889","last_updated":"2026-07-22T08:20:52Z","snapshot_observed_at":"2026-08-05T17:22:37.189170Z","submitted_at":"2026-07-22T08:20:52Z","title":"LAVIFT: Latent-Action-Guided Vision Fine-Tuning for Surgical Interaction Recognition","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-01T11:31:04.191369Z"},"links":{"cited_paper":"/paper/2410.02746","citing_paper":"/paper/2607.19889"},"observation_digest":"sha256:12b3f9374495093f50afcd807bbd14c34e167155608d7369527c5ad196671179","observation_id":"29fc88c7-d200-4558-8e6a-94ca6844798f","resolution":{"observed_at":"2026-08-01T11:31:04.191369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.02746/citation-record","integrity":"/paper/2410.02746/integrity","json":"/paper/2410.02746/citation-record.json","paper":"/paper/2410.02746"},"outbound":[],"paper":{"arxiv_id":"2410.02746","last_updated":"2025-02-19T05:59:59Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T15:05:24.928841Z","submitted_at":"2024-10-03T17:56:09Z","title":"Contrastive Localized Language-Image Pre-Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2410.02746."}