{"as_of":"2026-08-08T14:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f9e4c1701ca083e1b467e3e0b9fa9ffe99d7dc100049c2d1003f44707fb08a33","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:39:56.292313Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.21057/citation-record","integrity":"/paper/2607.21057/integrity","json":"/paper/2607.21057/citation-record.json","paper":"/paper/2607.21057"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.456719Z","title":"Person search with natural language description,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.456719Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:edef79f3e38e692221adc02a7d701c9980315f03781a41fee27766f387e4552b","observation_id":"f705be14-ef26-4f5a-84b5-ccac04b19c98","resolution":{"observed_at":"2026-08-01T08:39:51.456719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.522020Z","title":"Scalable person re-identification: A benchmark,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.522020Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:e613dc31171e88a21ac9988a68ee5c59833620a88c46460462d0a89f5ea2863f","observation_id":"514c843f-d3bc-462d-a1c5-591ce3e83a72","resolution":{"observed_at":"2026-08-01T08:39:51.522020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.596032Z","title":"Person transfer gan to bridge domain gap for person re-identification,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.596032Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:a133c2e4ebeb2d186220f74750e92053f0f911c2e7e8fa65a41d78413448dc6e","observation_id":"521da11e-4550-4808-aa5a-2185c4f7fa9b","resolution":{"observed_at":"2026-08-01T08:39:51.596032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.693399Z","title":"Transreid: Transformer-based object re-identification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.693399Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:ce4dd4678601ce219990665f3711bd44976770a33842ee686c9326db31adb734","observation_id":"15180668-7c43-4297-911c-322b25118f9d","resolution":{"observed_at":"2026-08-01T08:39:51.693399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.809867Z","title":"Cross-video identity correlating for person re- identification pre-training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.809867Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:d28cd8064b916bab5efe923a9b4925f5f2a2a984a0a0080e283a49c8345eb6c4","observation_id":"6af78c06-e39e-4db4-9cab-889d4fb98079","resolution":{"observed_at":"2026-08-01T08:39:51.809867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.900025Z","title":"Deep learning for person re-identification: A survey and outlook,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.900025Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:2bf8400b95eea0d45977bd3d54f8c66b71ebec6cb83f1a7e2db0c78cf9606478","observation_id":"5c09c510-de1a-4527-aad7-eeffbf2108e4","resolution":{"observed_at":"2026-08-01T08:39:51.900025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:51.987548Z","title":"Transformer for object re-identification: A survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:51.987548Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:62a825143cd476c85263ff116c078034214e52dc5664b4bd3ff522b4336585ef","observation_id":"1ee2ec2c-5ec7-4031-ab73-cfa1af343b34","resolution":{"observed_at":"2026-08-01T08:39:51.987548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.12666","last_updated":"2021-08-09T02:21:14Z","snapshot_observed_at":"2026-07-06T11:32:50.865714Z","submitted_at":"2021-07-27T08:26:47Z","title":"Semantically Self-Aligned Network for Text-to-Image Part-aware Person Re-identification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.12666","snapshot_observed_at":"2026-08-01T08:39:52.070351Z","title":"Semantically self-aligned network for text-to-image part-aware person re-identification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.070351Z"},"links":{"cited_paper":"/paper/2107.12666","citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:7ca8d796f51daa82048fcd704c5736e815828c9f7769f31f40445acd3e78c0c0","observation_id":"ecf7bc91-b023-4c86-b00a-b64413d76e35","resolution":{"observed_at":"2026-08-01T08:39:52.070351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.183986Z","title":"Dssl: Deep surroundings-person separation learning for text-based person retrieval,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.183986Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:892cfc85a330102c20d4df216c97a6c8b58f16528bbed3efd94ca0be2dc15efe","observation_id":"6a6f8e9d-959f-4ac2-af41-6917f099edf3","resolution":{"observed_at":"2026-08-01T08:39:52.183986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.265398Z","title":"Ufinebench: Towards text-based person retrieval with ultra-fine granularity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.265398Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:d04eac3f4eefe60152e69e1d8f06f76f56f7ea41c9e0dc2fa89cadecfe597ef8","observation_id":"359a081f-c333-4b6c-9ca9-70c49c34d9bd","resolution":{"observed_at":"2026-08-01T08:39:52.265398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.354158Z","title":"Chat-based person retrieval via dialogue-refined cross-modal alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.354158Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:645415c8a37ac5267dd7511727a87246bf6d43907a076dc31f11ea4c32ba19e1","observation_id":"7094c35c-4195-49d9-ac2a-c485087aaa1c","resolution":{"observed_at":"2026-08-01T08:39:52.354158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.443180Z","title":"LLaVA- reID: Selective multi-image questioner for interactive person re- identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.443180Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:ad860575d5e3736af87669a30bff0bdf9d6c1f2b5ff3e3b20443962894bc4778","observation_id":"11d8f8e1-76f9-4701-8676-e48d599290e5","resolution":{"observed_at":"2026-08-01T08:39:52.443180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.558070Z","title":"Human- centered interactive learning via mllms for text-to-image person re-identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.558070Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:6f4837ad6907086c69393f58664ebddb74ffdb855b5602c760276f8a6f713da3","observation_id":"3987306d-0212-49a1-b4f8-1d541b6fdfc6","resolution":{"observed_at":"2026-08-01T08:39:52.558070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T08:39:52.636090Z","title":"Qwen2.5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.636090Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:f3f926962a6749503767ee4f2c12c497cba897ee65dfd182901841921217ef67","observation_id":"28f14bae-949b-4542-80c7-ff16f4a896d7","resolution":{"observed_at":"2026-08-01T08:39:52.636090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T08:39:52.699255Z","title":"Qwen3 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.699255Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:deae7ca0e1558dd40bed767b95fa77e8b10698eb79ed7e5b4bb6230ac2a16127","observation_id":"463469ab-4745-4da5-aa1a-40f99e641bbc","resolution":{"observed_at":"2026-08-01T08:39:52.699255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.780198Z","title":"Cross-modal implicit relation reasoning and aligning for text-to-image person retrieval,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.780198Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:9c96045f483d21c065303f879b388818741f0d33466d0e7ccd2723f9321f12f6","observation_id":"54acf2aa-e705-4ede-b97e-70e0040622c5","resolution":{"observed_at":"2026-08-01T08:39:52.780198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.862839Z","title":"Noisy-correspondence learning for text-to-image person re- identification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.862839Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:68b0e8c19c6f80897f1995ece7c0586e0468add0a01e56002ccf3f61c58412eb","observation_id":"d42d72cc-2314-456b-9146-1c0b508f95a7","resolution":{"observed_at":"2026-08-01T08:39:52.862839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:52.948862Z","title":"FG-CLIP: Fine-grained visual and textual alignment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:52.948862Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:b913a198024dead1b10b52cc60163228e7dff18768e8c8e9b650fedddfdc7610","observation_id":"dd5be114-4492-4ada-a562-7e9757b36344","resolution":{"observed_at":"2026-08-01T08:39:52.948862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.029159Z","title":"Plip: Language-image pre-training for person represen- tation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.029159Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:6a08b1867e825468e474630c8a7ed5f6b85408b3935104ccf330519490360f9f","observation_id":"d3a61b59-abd7-4027-a936-57786ae45605","resolution":{"observed_at":"2026-08-01T08:39:53.029159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.108400Z","title":"Towards unified text-based person retrieval: A large-scale multi-attribute and language search benchmark,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.108400Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:77ca43547387857d6b57b77eb10e3375bf1c36d3c0ab218638b3c714686e7324","observation_id":"de591ac6-7512-4799-9af5-57e3acf86c8f","resolution":{"observed_at":"2026-08-01T08:39:53.108400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.193884Z","title":"Deep cross-modal projection learning for image-text matching,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.193884Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:4d12fa73766eaa255a734b76e1859480e2e96b1b61596f467bbda796a83588a6","observation_id":"2d922c06-112e-478d-be03-83af4873482d","resolution":{"observed_at":"2026-08-01T08:39:53.193884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.310436Z","title":"Dual-path convolutional image-text embeddings with instance loss,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.310436Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:d2e88f0aabd35588792e8a18da26658ff5e452f352063db4db841f2ac0a5daeb","observation_id":"a726d55b-c105-4fba-9d25-90a3dbe8f11f","resolution":{"observed_at":"2026-08-01T08:39:53.310436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.368902Z","title":"Improving text-based person search by spatial matching and adaptive threshold,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.368902Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:7e9002a81dbac48e2c763e22112e949021b79eb96955e1891d4b9a1e12859674","observation_id":"82df7c6a-bd0a-418f-9cf9-27efa0a98b1f","resolution":{"observed_at":"2026-08-01T08:39:53.368902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.448251Z","title":"Language person search with mutually connected classification loss,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.448251Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:47f73a3ed3dbcd972258282511febaceee0112fad341cc8f99da816ab7a26e67","observation_id":"cf9bdb9e-01f9-4997-9628-e0de5bf0eb85","resolution":{"observed_at":"2026-08-01T08:39:53.448251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.536996Z","title":"Pose-guided multi-granularity attention network for text-based person search,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.536996Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:5b58ce26d7eec37dc6f2eb50ffab95b63bdc99d201b05034fa65755b3364b8f8","observation_id":"f54ff8db-d391-4408-85b6-79f371a34fea","resolution":{"observed_at":"2026-08-01T08:39:53.536996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.624824Z","title":"Vitaa: Visual-textual attributes alignment in person search by natural language,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.624824Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:632c1ef839ba6763824f8aafcd52f736f0ba572c63efe30e45ae52ab8d026985","observation_id":"ac50907d-727a-477a-9057-e89a3209d422","resolution":{"observed_at":"2026-08-01T08:39:53.624824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.677015Z","title":"Improving description-based person re-identification by multi-granularity image-text alignments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.677015Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:dbd41325b546a0fd9575958f4f0b97313042ee650211346cd395091e11ca1f70","observation_id":"d092d3d2-2763-49c8-861b-941bf7764b22","resolution":{"observed_at":"2026-08-01T08:39:53.677015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.763999Z","title":"Caibc: Capturing all-round information beyond color for text- based person retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.763999Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:a243ca50b4795d3cc13b9de43266b18bba073ac21affc51ce6627b936bf5f593","observation_id":"88f107d5-6f1a-4335-b30b-1cfc38e640f0","resolution":{"observed_at":"2026-08-01T08:39:53.763999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.843893Z","title":"Lapscore: language-guided person search via color reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.843893Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:2409283b7247efaffc7412678f97c163dc1a1dc67606a92f52b11f25449fdc98","observation_id":"e864882a-34bb-484e-b50c-cf6d2e726538","resolution":{"observed_at":"2026-08-01T08:39:53.843893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:53.935168Z","title":"An empirical study of clip for text-based person search,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:53.935168Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:ae51ae9b72da2041c069deffa4cb7921c20ab7ab9aa38fff950cf18bedcbc076","observation_id":"80d04a95-633e-466c-99c2-85d85a873046","resolution":{"observed_at":"2026-08-01T08:39:53.935168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.008527Z","title":"Clip-driven fine-grained text-image person re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.008527Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:a5f36e9d2d9c6453d55f45d1fb3106dfa94b8b5f9f8943bad91a47fa4b162065","observation_id":"985547cd-dc85-426a-b4a9-33533b9b0bd8","resolution":{"observed_at":"2026-08-01T08:39:54.008527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.056571Z","title":"P-clip: Pro- gressive discrepancy learning for one-shot text-to-image person re-identification,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.056571Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:0b469de28d026cd60addae2e334d9dac144d27e40f1cbd4921480e0054748d47","observation_id":"ddfe9609-a561-41a9-b414-95cf951d0ca7","resolution":{"observed_at":"2026-08-01T08:39:54.056571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.115222Z","title":"I2id: Disentangling identity features via synchronized masking for zero-shot composed person retrieval,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.115222Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:f4cb0bd8ea9a34f21515cf3066130366545744bd6db20b7d8303c7995b05549f","observation_id":"0a56e313-8fdc-4d3f-81af-f3f1789723a2","resolution":{"observed_at":"2026-08-01T08:39:54.115222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.202307Z","title":"Learning transfer- able visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.202307Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:20699e9cdf6db6711035b7cb029144601ffaacf0f98d1404f4d3ac7bf4cbfb0f","observation_id":"7c4612fe-f0d1-4bfa-8e0d-cdcd4622519e","resolution":{"observed_at":"2026-08-01T08:39:54.202307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.281064Z","title":"Fine-grained semantics-aware representation learning for text-based person retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.281064Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:fddf30e236763d5142c4814bc26c01fbab3c7d46ededb6e1e316f8a4383c5d6e","observation_id":"281e3411-fe0a-4220-9976-dc8fd894b912","resolution":{"observed_at":"2026-08-01T08:39:54.281064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.345532Z","title":"Clip-based synergistic knowledge transfer for text-based person retrieval,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.345532Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:8027059c0ce0424cd5694edd3803d71649d47ff40ae4eac56bd28c6a119d877b","observation_id":"8ca44d65-69fd-407f-b2bf-5d58e8bd9ed0","resolution":{"observed_at":"2026-08-01T08:39:54.345532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.400658Z","title":"Enhancing visual representation for text-based person searching,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.400658Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:24b03dcf424b1d45785f1c120e39f5d02c308e207e23d49b2017dd5a47a4ae74","observation_id":"ab154ccb-af5f-4a07-80ed-0f536ec253ef","resolution":{"observed_at":"2026-08-01T08:39:54.400658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.453173Z","title":"Vse++: Improving visual-semantic embeddings with hard negatives,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.453173Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:b4e60aa46cb2ec967d7b02dccefe2031873c065c65d33524883ffafd8b38acb8","observation_id":"437216d6-173c-49a9-8cd0-b95ae07781dc","resolution":{"observed_at":"2026-08-01T08:39:54.453173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.515309Z","title":"Align before fuse: Vision and language representation learning with momentum distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.515309Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:a7cc5c013d9cb9e8bfdbef7ac7366bbac0535d0f332fb4ee46872ede62aef7ba","observation_id":"e6998038-0c89-4403-9d32-1a3c07a4e399","resolution":{"observed_at":"2026-08-01T08:39:54.515309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.576095Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.576095Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:26413602990cd6c25f1b55ead7971917d086c4944f6cbdf79ba69870017c18e6","observation_id":"4b729f50-56d4-44a8-a2f8-4a7c9c8ae74b","resolution":{"observed_at":"2026-08-01T08:39:54.576095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.625994Z","title":"FILIP: Fine-grained interactive language- image pre-training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.625994Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:479e8cd4a70c75895711b4f7d23af387b8ca64b6de9cfdbb46225cdac802046c","observation_id":"cae77c36-b1b6-46b4-8767-7000dc57be3c","resolution":{"observed_at":"2026-08-01T08:39:54.625994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.689246Z","title":"Long-clip: Unlocking the long-text capability of clip,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.689246Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:e6ae79c5f4c1d567136a07c54dffe71ad015048ac4a1fb03ba2fb8659194b317","observation_id":"aa545b6b-e859-40eb-86fc-a74f5debad78","resolution":{"observed_at":"2026-08-01T08:39:54.689246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.798834Z","title":"Imram: Iterative matching with recurrent attention memory for cross- modal image-text retrieval,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.798834Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:aa6fcef7e8b12046099c114618cfd014d22408f6b4ba79988b023262a45fc5df","observation_id":"eab21aa5-6720-4c58-ba5e-b4d65821749f","resolution":{"observed_at":"2026-08-01T08:39:54.798834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.854960Z","title":"Fine-grained image-text matching by cross-modal hard aligning network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.854960Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:0db8f86e3b523d6e8a44c2fffe376357989661a09eab5676d4da8b2b2869c78b","observation_id":"c77b49e5-cd24-46d3-b651-eda6eb6add97","resolution":{"observed_at":"2026-08-01T08:39:54.854960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.916390Z","title":"Flair: Vlm with fine-grained language-informed image representations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.916390Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:cecfb12489f41f26cdd6274479671991e6043adb612e73f1582ed47824829611","observation_id":"a08a6341-0738-4435-a341-d8635a7045d4","resolution":{"observed_at":"2026-08-01T08:39:54.916390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:54.986989Z","title":"Benchmark granularity and model robustness for image-text retrieval: A reproducibility study,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:54.986989Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:1fa464f92a5e7fc1f04e56528ec284128cf732390450b6679b434313e870aee0","observation_id":"13762a02-8010-40aa-be40-7a9ccf36f842","resolution":{"observed_at":"2026-08-01T08:39:54.986989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.070307Z","title":"Multi-grained vision language pre- training: Aligning texts with visual concepts,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.070307Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:1c9888f5ab6495470da3f1825b5325c5a4cdcaac6f6e6e9b3e26a79a5efe3bf0","observation_id":"c7b3c6d8-6d94-4145-99d5-5cc17cc40625","resolution":{"observed_at":"2026-08-01T08:39:55.070307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.117776Z","title":"Pixclip: Achieving fine-grained visual language understanding via any-granularity pixel-text alignment learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.117776Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:467ec1fcd64a3b749ba6e6c9273eec40aa31d731ed875123d53655302601b7ed","observation_id":"5983c611-e48c-4f72-b760-ab50f88074d3","resolution":{"observed_at":"2026-08-01T08:39:55.117776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.185953Z","title":"Mulclip: A multi-level alignment framework for enhancing fine-grained long-context clip,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.185953Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:6911d07a055d7d72f699c0838635d73583d50d1aea19cdde2e541663d016c7ff","observation_id":"9d25eef9-d9e9-4634-91ec-b39813b6fbc9","resolution":{"observed_at":"2026-08-01T08:39:55.185953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.276654Z","title":"X-clip: End-to- end multi-grained contrastive learning for video-text retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.276654Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:2e0564ba8ddb82b2b956e7912d7f558f916bf955c7fb1bd3d6f260d0b6ee72af","observation_id":"fff04b9e-bcf7-45cc-a2e3-8506a172836c","resolution":{"observed_at":"2026-08-01T08:39:55.276654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.359086Z","title":"Mgsgm: Multi-granularity selective graph mamba for image-text retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.359086Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:159dfeae9ca42a51eb1958d4b32ef388f2490dc83f7266620bcd7416bcbc74d9","observation_id":"8fa120c3-1eee-4afe-bb2f-f58fc727c850","resolution":{"observed_at":"2026-08-01T08:39:55.359086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.406172Z","title":"Fairmot: On the fairness of detection and re-identification in multiple object tracking,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.406172Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:8dd58c326e91e32d1e571bb1a0e226bb1353613867d8201c1712a549862c7e31","observation_id":"28a22baf-687d-4624-86e5-7eb0c64f035a","resolution":{"observed_at":"2026-08-01T08:39:55.406172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.489120Z","title":"Rgb-infrared cross-modality person re-identification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.489120Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:57821dd41abb62e402d0855649980a2d66ddac1cc99c02111cd261cc9a3b359a","observation_id":"6c6780c6-f5f7-44ed-8411-defa60f1099f","resolution":{"observed_at":"2026-08-01T08:39:55.489120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.556994Z","title":"Diverse embedding expansion network and low-light cross-modality benchmark for visible-infrared per- son re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.556994Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:e0a1045f485fb640ed917f6e06bd443ea8bc982e45e1a2417e82780e8db4f87c","observation_id":"e4f377f7-1cf8-41e3-99ad-3b07aaaa0d4d","resolution":{"observed_at":"2026-08-01T08:39:55.556994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.624184Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.624184Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:239670e8efe07660a90c5b4d0629be12b36d66b6ffc3dc4a1ae6a5c359a0f9a3","observation_id":"4d3ec39a-7913-47dc-9bba-57fc1495157a","resolution":{"observed_at":"2026-08-01T08:39:55.624184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.698050Z","title":"Har- nessing the power of mllms for transferable text-to-image person reid,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.698050Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:63ceaf3dad7a4c51c6a00caeb3c25b4c0813225310607516793bae7777bd6b8e","observation_id":"77ffe639-09af-412b-9a2d-447fc70509d9","resolution":{"observed_at":"2026-08-01T08:39:55.698050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.760993Z","title":"Modeling thousands of human annotators for generalizable text-to-image person re-identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.760993Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:f0cd3ab87974d91155019de742cb86bf95d30deffd0aa93273d59799c0d35bd4","observation_id":"8a57b1f0-5a85-4488-a8ea-96814ffa4c1e","resolution":{"observed_at":"2026-08-01T08:39:55.760993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.843019Z","title":"Learn- ing granularity-unified representations for text-to-image person re-identification,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.843019Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:0b36a4c75ce0fff65e991213d6dfba61ba971a904d40c8a33b2b29e1fe50b6b3","observation_id":"c2de62c2-4873-4f11-be38-317944a0be82","resolution":{"observed_at":"2026-08-01T08:39:55.843019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:55.934224Z","title":"Bilma: Bidirectional local-matching for text-based person re-identification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:55.934224Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:92fd96491fdecbcd1fb53d149711e0e85626ec037b3ae5de00a19279831a2f2c","observation_id":"34aa4cd2-0b60-4138-8cb7-9a172bdacbd3","resolution":{"observed_at":"2026-08-01T08:39:55.934224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:56.027248Z","title":"Rasa: relation and sensitivity aware representation learning for text-based person search,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:56.027248Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:abd251074ad503becceed2181f2b0a70a94c42055ab928213da60021e7d744fd","observation_id":"5193a357-9e88-4b63-a769-7122c800f59c","resolution":{"observed_at":"2026-08-01T08:39:56.027248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:56.079608Z","title":"Hier- archical knowledge-guided reasoning for text-based person re- identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:56.079608Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:b6bf2980d9a9807b9cd93efe312f02413c644fdc28e46f72c920b89f1fdfdd40","observation_id":"32b09506-9fd1-475b-949f-2daac96c194e","resolution":{"observed_at":"2026-08-01T08:39:56.079608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:56.132887Z","title":"Instance-level feature bias calibration learning for text-to-image person re- identification,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:56.132887Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:9fb5b64325ee98a3fe94365c69f16221fde098013b43cf65315bfc61222ba80c","observation_id":"9d0b9e7d-428d-4c0a-8ae7-5bfe3bfaffce","resolution":{"observed_at":"2026-08-01T08:39:56.132887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:56.292313Z","title":"degree in the School of Artificial Intelligence and Au- tomation, Huazhong University of Science and Technology, supervised by Prof","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:56.292313Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:e20e9272df9604ad67ff83e470618d201c6be32b639dc14bcc4b2093cd88f787","observation_id":"2820c19f-0c92-4e1c-a16c-7825e84aadea","resolution":{"observed_at":"2026-08-01T08:39:56.292313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T08:39:56.227672Z","title":"degree in the School of Artificial Intelligence and Au- tomation, Huazhong University of Science and Technology, supervised by Prof","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:56.227672Z"},"links":{"citing_paper":"/paper/2607.21057"},"observation_digest":"sha256:f2128d6cb3d98bd632f1548a5e92f7a13de518a9efe80520cb65d1e05c947ca8","observation_id":"ae47c0d8-d743-4837-b40f-d96707c079cd","resolution":{"observed_at":"2026-08-01T08:39:56.227672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.21057","last_updated":"2026-07-23T08:42:25Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T17:46:04.605724Z","submitted_at":"2026-07-23T08:42:25Z","title":"Achieving Text-based Person Retrieval with Any Granularity"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":64,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2607.21057."}