{"as_of":"2026-08-05T03:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:17792064c9c009dfcbba01baec535055fee69267e4751a2f4edc02cfcdce5ec2","coverage":[{"denominator":13,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":13,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T00:26:34.931761Z","state":"measured"},{"denominator":13,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":13,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2511.01390/citation-record","integrity":"/paper/2511.01390/integrity","json":"/paper/2511.01390/citation-record.json","paper":"/paper/2511.01390"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1909.11740","last_updated":"2020-07-17T22:19:59Z","snapshot_observed_at":"2026-07-06T08:24:38.792721Z","submitted_at":"2019-09-25T20:02:54Z","title":"UNITER: UNiversal Image-TExt Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11740","snapshot_observed_at":"2026-08-04T00:26:34.881258Z","title":"Uniter: Learning universal image-text representations.arXiv preprint arXiv:1909.11740,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.881258Z"},"links":{"cited_paper":"/paper/1909.11740","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:ad61efe19ba9350c265d02c967460ffc21567e5932eabd80b7b6dd416e4efa0c","observation_id":"13e18712-028d-4062-86a6-8106ca9f484a","resolution":{"observed_at":"2026-08-04T00:26:34.881258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T00:26:34.890073Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.890073Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:ad5e577ae009002970540d0afd93c58d8ade4d11886b4f44d67d6ed2f83b7394","observation_id":"e8e8c1f8-b211-4a09-9b66-1dcaaccc404e","resolution":{"observed_at":"2026-08-04T00:26:34.890073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-04T00:26:34.907274Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.907274Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:51dc62c2bfc1d7da06953fae9c09b1b1e7b5939d7c5b1ca45414d8fd2f5c334c","observation_id":"ef988689-8f4a-486f-b352-e90a489da990","resolution":{"observed_at":"2026-08-04T00:26:34.907274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.915761Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.915761Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:14bc8e2c950017180f3511b9a7e8a26554347ec91322e216782ac1b606210320","observation_id":"9ba09913-986d-473a-bb3a-c946c2025e09","resolution":{"observed_at":"2026-08-04T00:26:34.915761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.927587Z","title":"Table 4: The comparisons of image-text retrieval for SEPS-Vit and SEPS-Swin with different selec- tion ratioρon Flicker30K","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.927587Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:a89be1a5a649c19db6738e36ba07b8afb9c36b5306a53e4d456056f8d7fe18f2","observation_id":"e41aaab0-26be-4162-815c-c83f2c3eb5ed","resolution":{"observed_at":"2026-08-04T00:26:34.927587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.931761Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.931761Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:a292c388a848cf4524d49aab696f8ea5947e621dcfe7bb0ce5ed1a7122f37953","observation_id":"4e09f437-9490-4a72-a487-2cda4586577e","resolution":{"observed_at":"2026-08-04T00:26:34.931761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.898696Z","title":"Image-question-answer synergistic network for visual dialog","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.898696Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:82894ae91cab4c21513f302a91d8ef5af952302220061605bb3fb63161ea965b","observation_id":"56fa954e-cab7-4085-88b5-3f7fa5188f2f","resolution":{"observed_at":"2026-08-04T00:26:34.898696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.00712","last_updated":"2017-03-05T16:59:44Z","snapshot_observed_at":"2026-08-05T03:48:52.905768Z","submitted_at":"2016-11-02T18:25:40Z","title":"The Concrete Distribution: A Continuous Relaxation of Discrete Random Variables","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.00712","snapshot_observed_at":"2026-08-04T00:26:34.911429Z","title":"The concrete distribution: A continuous relaxation of discrete random variables.arXiv preprint arXiv:1611.00712,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.911429Z"},"links":{"cited_paper":"/paper/1611.00712","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:71ca028e7bb490543dc4354501731b85b079ae3b1f0fb24db150a43233c451c8","observation_id":"627a55b4-1432-4506-bed7-97b5580d9b60","resolution":{"observed_at":"2026-08-04T00:26:34.911429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-07-06T05:51:36.145913Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-04T00:26:34.894136Z","title":"Vse++: Improving visual- semantic embeddings with hard negatives.arXiv preprint arXiv:1707.05612,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.894136Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:f789c5807afd05d2fbeef91e781c24fd30fb2888f833157635a085355bbbe28f","observation_id":"14faa27c-3a61-4dfa-9a5c-93b367c8ba76","resolution":{"observed_at":"2026-08-04T00:26:34.894136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.886208Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.886208Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:033f1b4eb89346aeb4ab98029cb5b4934f7649158941eda36d787f74ac1e13e9","observation_id":"b6643d60-1288-4c2e-b079-7bd486bcfd1f","resolution":{"observed_at":"2026-08-04T00:26:34.886208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.919618Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.919618Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:11ed040cc446b7f3cec5dee4f5cf267d16dcc0d9a9ac0782b0a3134448b97320","observation_id":"4fa0c16c-36bd-49c5-9b8b-91f1bd5ba792","resolution":{"observed_at":"2026-08-04T00:26:34.919618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14953","last_updated":"2025-07-17T13:40:04Z","snapshot_observed_at":"2026-07-06T20:55:09.392546Z","submitted_at":"2025-03-19T07:42:24Z","title":"Aligning Information Capacity Between Vision and Language via Dense-to-Sparse Feature Distillation for Image-Text Matching","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14953","snapshot_observed_at":"2026-08-04T00:26:34.902867Z","title":"Novel cross- dimensional coarse-fine-grained complementary network for image-text matching.PeerJ Com- puter Science, 11:e2725, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.902867Z"},"links":{"cited_paper":"/paper/2503.14953","citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:a37ae47307e9fe6d8a0de26afac7d9197049c1469103f4ff5507643cde1b1230","observation_id":"2cd20453-59c6-4e10-af28-860e8b47f367","resolution":{"observed_at":"2026-08-04T00:26:34.902867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T00:26:34.923686Z","title":"In stark contrast, SEPS not only significantly surpasses all prior fine-grained methods but also successfully bridges this performance gap","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T00:26:34.923686Z"},"links":{"citing_paper":"/paper/2511.01390"},"observation_digest":"sha256:a1488873d5e9a952e12990991fde2171c5073b633e95923c98ed23603b3eddd9","observation_id":"1efe51f5-7dbe-4d7b-9141-9e9ba65ec5e8","resolution":{"observed_at":"2026-08-04T00:26:34.923686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2511.01390","last_updated":"2026-07-02T07:36:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T00:26:34.112709Z","submitted_at":"2025-11-03T09:41:32Z","title":"SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment"},"reference_resolution":{"displayed":13,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":13},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 13 of 13 outbound references and 0 inbound Pith citation observations for arXiv:2511.01390."}