{"as_of":"2026-08-19T10:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4fc5aa8f9d35d8a6476b3addeb769ed272e703396c10135053183271b801ee82","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:01:17.880281Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22864/citation-record","integrity":"/paper/2506.22864/integrity","json":"/paper/2506.22864/citation-record.json","paper":"/paper/2506.22864"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T22:01:14.958121Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:14.958121Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:99137e4d23265690df272b312f779e5c685e3a3389e28dd6a444d6cc76d2d9cb","observation_id":"af4f88cd-f1e6-4f4c-9cb4-b3441e5314f7","resolution":{"observed_at":"2026-08-06T22:01:14.958121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T22:01:15.010180Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.010180Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:8303f6124abd542e8697ce604756be5a17ec712bed7f166cc4d072ea7e7d9f53","observation_id":"3a10a0ca-2cbb-439e-88d9-a3f07552ffb7","resolution":{"observed_at":"2026-08-06T22:01:15.010180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-16T01:18:27.067382Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T22:01:15.129919Z","title":"Lawrence Zitnick","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.129919Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:abf373ef33cea6e5d4a823bcddef8aca8662fc2b2d32a93519a413c81f3283d8","observation_id":"64618d66-c776-4cb6-9173-2fe80d8a8943","resolution":{"observed_at":"2026-08-06T22:01:15.129919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.493803Z","title":null,"venue":null,"work_id":"674002d2-cfa2-414e-8ccf-ec3f4075d985","year":2020},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.198419Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:03990d791f0e548b8186f61359bf923af1b182aaf19ee7c902943aa9be638aba","observation_id":"5b12c948-8986-4611-ab17-fb54f75b3d24","resolution":{"observed_at":"2026-08-06T22:01:23.499007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.477184Z","title":null,"venue":null,"work_id":"3b397fd9-229b-4ece-b82e-de81aac9bb21","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.271304Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:a87f653b88591b09057c4d549c10ad6fa220dd57746cc9ad6a23f806656725eb","observation_id":"332e1244-27e0-485f-8b37-2cb6f057d9ac","resolution":{"observed_at":"2026-08-06T22:01:23.482402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.459544Z","title":null,"venue":null,"work_id":"12944594-e9db-4b9f-8f9d-3319592549e4","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.306843Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:7739321db4079f056143b7d50b67e68115f4cd0b8f5ff3e5ff03afd7684b6c90","observation_id":"356208b5-8602-4cbc-873f-65f5a5ca0318","resolution":{"observed_at":"2026-08-06T22:01:23.465112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.441941Z","title":null,"venue":null,"work_id":"eb9fd8d8-1bd5-4485-be69-b7046a9473da","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.378625Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:4f18f7ffbfe68eba5da0e151d5f50415a5c82be2156ce8357ebb421a09a020a8","observation_id":"6de720c7-2a90-488b-a3e1-66a9e9e49211","resolution":{"observed_at":"2026-08-06T22:01:23.447491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.422462Z","title":"Fleet, J","venue":null,"work_id":"a4ca8435-c367-4d78-94ac-7c916d6541b6","year":2018},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.439576Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b651f565f395e79e9746a8cf40e2676b7865a82df023248f2444a820a28db24d","observation_id":"1da9c28a-5a96-4511-af27-b4b957dcfc36","resolution":{"observed_at":"2026-08-06T22:01:23.429173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:23.201558Z","title":null,"venue":null,"work_id":"a4439fe5-2d52-4993-b0f9-d712c66e1d02","year":2013},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.537066Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:1b726b5a24e5a6b09ab3836531b7f5ea991c7fe71f581536e018615553f8bec6","observation_id":"e7a7dd82-8a36-44f0-9a5d-daaaf6edddfd","resolution":{"observed_at":"2026-08-06T22:01:23.316252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.970278Z","title":null,"venue":null,"work_id":"ffa240fc-aa40-4753-9ae1-77c01e9050df","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.642411Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b6d609129731f54106960f7c4af53f18f41674e95c49de77542d47a2c1bedff6","observation_id":"d7a12c41-6613-406a-8082-2147d9a64fe2","resolution":{"observed_at":"2026-08-06T22:01:23.078550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.760606Z","title":null,"venue":null,"work_id":"5f8b3f29-e399-4b0b-9168-d90c62eb0cfe","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.701554Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:18d0b710cae5d3e2d5ade3573bc15ec9f6be80f4a720aa25f1474d8b6cac72b2","observation_id":"633cd53e-d8e8-4593-aded-8eccdf33c7a1","resolution":{"observed_at":"2026-08-06T22:01:22.862994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.542495Z","title":null,"venue":null,"work_id":"c3b73791-a1cc-419c-a094-28a3a4fcf806","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.812184Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:64bd80521f4768ee3add37c0a72546640edbebfc5d080bbfd7d9c8af2470c284","observation_id":"6ab782b1-0f51-4f29-9a7d-7fe154942768","resolution":{"observed_at":"2026-08-06T22:01:22.640324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:22.198071Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":"7ed7b983-6d9f-4589-b969-12dd29ab496a","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.862222Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:3339e3808eb267018eba892abe49293c4f5197768d3efb60ef6c13eddd8d661b","observation_id":"6f2789e6-1d4c-4168-ac1b-a8818913e3c0","resolution":{"observed_at":"2026-08-06T22:01:22.394073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:15.909428Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.909428Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:cc20025664fe40321ece7e56a2a993e39d1c6f3ccdedbd43cdd75237fe83522a","observation_id":"1b278cd2-1984-44ec-96e6-0cd0f5da9c7e","resolution":{"observed_at":"2026-08-06T22:01:15.909428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.650271Z","title":null,"venue":null,"work_id":"14d8e2de-9222-499c-bc09-b21cfe1b96ad","year":2018},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.102523Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:fbae5b368c9309b8cb03a2d7900b9bc3427b16479d5cf5524b65049be921bf2f","observation_id":"8ce80548-01d9-4c66-88ad-1f43bf3695b3","resolution":{"observed_at":"2026-08-06T22:01:21.753024Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.359557Z","title":null,"venue":null,"work_id":"84985729-f7ce-416f-b897-8a29b93ac261","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.180181Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:68702eb6cc2b184d958f43106482ee578d03875b2da12377441b35d9d67e901a","observation_id":"a123a3c4-f60f-4ffe-8508-f11ff3a583e1","resolution":{"observed_at":"2026-08-06T22:01:21.517139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.135498Z","title":null,"venue":null,"work_id":"3d24c62b-e116-4e8a-8a4c-8f3c587370ac","year":2019},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.263800Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:86ebcca9664a5c197f31b8414692e96a1bc857dd7b1dcf504a31ae905b14fae7","observation_id":"a165ea8b-3538-4e2a-890d-4a7ada235aff","resolution":{"observed_at":"2026-08-06T22:01:21.201689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.946159Z","title":null,"venue":null,"work_id":"60769629-5c06-4a52-90c3-c066582252d7","year":2025},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.337695Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:0efa867c8d7f176cc01be32672e2c54188f3592bf013184f33c34c0bd1b4353b","observation_id":"cec90bcf-0620-45b7-8391-13ecf95b42a3","resolution":{"observed_at":"2026-08-06T22:01:20.997686Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.721449Z","title":"Lawrence Zitnick","venue":null,"work_id":"135a0aeb-4c29-49ea-b325-b230857fb6b4","year":2014},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.409999Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:9da557867eb3886f79b3650e555f5134c32786ce1b40fda9662b421c56315f08","observation_id":"392d425a-d5d9-4466-b1fa-79a9ff158adc","resolution":{"observed_at":"2026-08-06T22:01:20.807247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.448645Z","title":null,"venue":null,"work_id":"b6f1b621-3645-4182-8496-ee9292dbb289","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.465792Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:1fd3f730695700037a5b99bb5a7828d17e596c68ef87c012680f5017fa0444a2","observation_id":"2a9c9549-87f7-4ce9-8b30-1f6eb803151e","resolution":{"observed_at":"2026-08-06T22:01:20.550669Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:16.547995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.547995Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:5270896bc0ce892fd9a0831ba9d21ab3fba4a75ead15a30e66001af0a6addbc6","observation_id":"3e54e89f-c239-4a17-862e-ea75631b0ea5","resolution":{"observed_at":"2026-08-06T22:01:16.547995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:20.175227Z","title":"Yuille, and Kevin Murphy","venue":null,"work_id":"b45c373c-6ce5-4134-b1d8-1dbd39105242","year":2016},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.639823Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:336990b440ee9d951534d7fb6d0d5a83616468c9323df41f0e6886ca1ebad82f","observation_id":"d5e03549-b518-4fc8-bee1-aab083ba1f9d","resolution":{"observed_at":"2026-08-06T22:01:20.299450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.909122Z","title":null,"venue":null,"work_id":"8ed54e77-1c23-4ced-83c5-b09139763f17","year":2020},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.739528Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:8a7719e9cd75adefa94b436b0b0de3ac572cd87886730a552417a5e02277d741","observation_id":"6aef445c-4043-4b3f-9faf-7d8fa203b189","resolution":{"observed_at":"2026-08-06T22:01:20.002247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.750547Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":"e1a98076-54a1-4bd7-96ee-a6aaf837b4c8","year":2015},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.791637Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:ab7d1e2726e25674ce5d03e3e7b35b79f2ed627057464a1c22c4249db2e9a1ec","observation_id":"02783244-5382-4fe6-a4a9-886c5252e041","resolution":{"observed_at":"2026-08-06T22:01:19.797590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.572442Z","title":null,"venue":null,"work_id":"c7423c3a-fdc3-4127-a636-44f5804b20d2","year":2021},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.883314Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:f79fb9b45a5dbc5f11fa1729072bf813219023f518eb831038d100fea3f8e8c7","observation_id":"b2b26024-f779-4822-9c79-7ef3911da8c8","resolution":{"observed_at":"2026-08-06T22:01:19.631058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.415616Z","title":null,"venue":null,"work_id":"97831e64-0d37-4bf8-9be8-ddfc924d244c","year":2025},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:16.980024Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:45d6f1ca6eac43eef7272349c006d88e4c74fcc90e41331b0bcd6a2222de93ef","observation_id":"8248b3d5-d73e-4b5d-aed3-92bd39972813","resolution":{"observed_at":"2026-08-06T22:01:19.504047Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.169624Z","title":null,"venue":null,"work_id":"d0a6bc25-441c-450a-aa01-7f311bf91263","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.094244Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:394b182dfd487ecc918c5e7f404399f18add3d2639547114a267c1d483300f70","observation_id":"85c89b84-f7e0-4ff2-a8eb-d0f13106f0cf","resolution":{"observed_at":"2026-08-06T22:01:19.270633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:19.014043Z","title":null,"venue":null,"work_id":"414b37a4-60d2-4f79-8192-0babbcfb4f80","year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.186919Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b9ab496fd1b1ef74e862c54001168e06a8a015fbfa522b546161c9e15eba39ac","observation_id":"044c99a1-c2ed-4fd1-ab3e-24ed63f3bdd3","resolution":{"observed_at":"2026-08-06T22:01:19.098647Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.852613Z","title":null,"venue":null,"work_id":"a866c9ac-c8d7-44d3-84e5-a03a865711a2","year":2020},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.305749Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:061993d61ab00e18ba68a83486a0a464dd73d08d62c57200661f541cd5a2483f","observation_id":"fdae505f-faa3-48c0-a3d5-cf31a993905f","resolution":{"observed_at":"2026-08-06T22:01:18.923242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.740640Z","title":null,"venue":null,"work_id":"7ad1fb43-b86f-4de1-b92b-6939ea31ff0d","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.381675Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:f827ef90171d31335fb7b3fdc6d05e527725a12a8ba89ce13d6da4c7aad93a1a","observation_id":"a60be571-2172-4c6e-a908-91698f9252f7","resolution":{"observed_at":"2026-08-06T22:01:18.787682Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.613865Z","title":null,"venue":null,"work_id":"9f2854a7-30e9-4599-909d-073d5e7c7e65","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.476487Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:69f369bb31d7fce64fdbea928c8c02002857a572fe1a40530fa1636b764e33ac","observation_id":"a3f708d9-28b8-4d12-8e94-35b26fe0719b","resolution":{"observed_at":"2026-08-06T22:01:18.667208Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.513307Z","title":null,"venue":null,"work_id":"84d8a585-52f9-4fb6-8bff-7124f1e3cf00","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.538226Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:810129025278c7ae9e18b138bd7c11bdd90d40dbfda8bd8b8ee3a60a1e00672f","observation_id":"7f6889c7-85af-487e-8c4d-b9db7fcf056d","resolution":{"observed_at":"2026-08-06T22:01:18.574967Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-08-16T14:31:04.236202Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-06T22:01:17.601173Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.601173Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:b2cd74c664ca503719c3d192a0f4a3d6cb415980c7a6d234e82ecd99636705f8","observation_id":"2d7ca62d-95d5-4b56-b589-3428429f9c51","resolution":{"observed_at":"2026-08-06T22:01:17.601173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.398706Z","title":null,"venue":null,"work_id":"ac685a68-635f-4bf8-bcf2-fbbb70e35a52","year":2022},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.649884Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:c14706b073f71c1bdbbc32a129e7696803c86997a3d2997d5d71d2fe973e11f1","observation_id":"36088f1c-0028-4d58-883b-6ac615ef85cb","resolution":{"observed_at":"2026-08-06T22:01:18.452170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.306177Z","title":"Berg, and Tamara L","venue":null,"work_id":"5e5cee78-1a40-462d-bb56-2303a5a88695","year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.711250Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:dd6d0da5bd90c00f442766921a2409ac111bf4892f060090d4e79618d1cf4463","observation_id":"979ca89a-df6f-4ef3-a184-98364b1be7d6","resolution":{"observed_at":"2026-08-06T22:01:18.341334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:17.827019Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.827019Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:e5fe3db1972472dcf2d610550939e775039637cff04cd8415fe49c94fc824d5a","observation_id":"ea511b3d-f2be-49e2-9734-8a8d053b875a","resolution":{"observed_at":"2026-08-06T22:01:17.827019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.064027Z","title":null,"venue":null,"work_id":"025ffca2-c010-4b4c-88b8-e970cb248a4a","year":2023},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.880281Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:5f66f7fdb9f1c14ea65813994a5796444264886161697e1a48a4d014a508f8b4","observation_id":"c8f682cb-2f3c-4ff2-84ad-88dea724241b","resolution":{"observed_at":"2026-08-06T22:01:18.111593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:18.193775Z","title":"InEuropean Conference on Computer Vision, Bastian Leibe, Jiri Matas, Nicu Sebe, and Max Welling (Eds.)","venue":null,"work_id":"6f93a804-0ed0-4bbe-a6f4-90d44ba35320","year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:17.770840Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:0507acc3e90fcfd6418b9ff702eb41cacac42e36a339e80e5538c7a5346b31d7","observation_id":"9e3e4cf0-5dac-4280-b91d-48a4f9cae3ca","resolution":{"observed_at":"2026-08-06T22:01:18.245858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:01:21.904463Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"379b4bd0-9072-4c5d-9132-d66fc30c2f75","year":null},"citing_paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:01:15.997379Z"},"links":{"citing_paper":"/paper/2506.22864"},"observation_digest":"sha256:39f37f32abc7640110d68727853f102068497964a46201c47dac44ef554bf5d2","observation_id":"fb30d2ae-831b-4437-9341-13f24448d513","resolution":{"observed_at":"2026-08-06T22:01:22.035731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.22864","last_updated":"2025-06-28T12:19:49Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T21:00:54.147236Z","submitted_at":"2025-06-28T12:19:49Z","title":"Mask-aware Text-to-Image Retrieval: Referring Expression Segmentation Meets Cross-modal Retrieval"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2506.22864."}