{"as_of":"2026-08-07T05:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1da66df41f52a768c9f18d6f8498372075089486d7bede036d4c32899849fe9","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:36:18.716315Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23751/citation-record","integrity":"/paper/2506.23751/integrity","json":"/paper/2506.23751/citation-record.json","paper":"/paper/2506.23751"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-06T21:36:18.524118Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.524118Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:1fb78489a630ba50f3ca470b476a4561a82b31cc81aa3f58376baeb1e1f042c4","observation_id":"f5687623-310d-422f-a3ae-193d0cacf9d4","resolution":{"observed_at":"2026-08-06T21:36:18.524118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17270","last_updated":"2024-02-22T13:05:52Z","snapshot_observed_at":"2026-08-06T03:42:49.390767Z","submitted_at":"2024-01-30T18:59:38Z","title":"YOLO-World: Real-Time Open-Vocabulary Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17270","snapshot_observed_at":"2026-08-06T21:36:18.528719Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.528719Z"},"links":{"cited_paper":"/paper/2401.17270","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:1c720d34ae102a126fd4d0d0debf51a42319969886b6014e228e44bd29a90ed1","observation_id":"778040ca-9e55-4ba1-906c-18f08e9b5900","resolution":{"observed_at":"2026-08-06T21:36:18.528719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.417242Z","title":"InProceedings of the IEEE/CVF International Conference on Computer Vision, 1780–1790 (2021)","venue":null,"work_id":"10b9d850-9b0a-4d50-8202-1a83ba23cb87","year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.532495Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:13135c7528e1f7661459779e086aaaf0a02fb45e4b27d4dde11e5c2d19c751ce","observation_id":"54f7e7c1-d14f-4c68-978e-ffe9e38d0606","resolution":{"observed_at":"2026-08-06T21:36:19.420862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.407756Z","title":"Glipv2: Unifying localization and vision-language understanding.Advances in Neural Information Processing Systems35, 36067–36080 (2022)","venue":null,"work_id":"19c1703e-a3d7-4ca1-86ba-4204f64de792","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.536062Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:664622c9e23edca1d62755a59e9711765dbced77af100ea2cb6bcda95c88dfaa","observation_id":"884ade83-e5fe-4d97-b814-0a68e06cf6cb","resolution":{"observed_at":"2026-08-06T21:36:19.411326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.397406Z","title":"InProceedings of the IEEE/CVF conference on computer vision and pattern recognition, 16793–16803 (2022)","venue":null,"work_id":"bd6321db-1b85-4e5f-ad8e-48a775ebec2d","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.539533Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:ce830f9f3115c1e968024b28446ccd4940c6c6e8b7fe0862a4413681d12ccd31","observation_id":"2f495057-dc90-4445-bde4-174ada3abcbc","resolution":{"observed_at":"2026-08-06T21:36:19.401428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.385795Z","title":"In Proceedings of the IEEE/CVF International Conference on Computer Vision, 6339–6350 (2023)","venue":null,"work_id":"b70e1ed1-ef55-45ce-b3d8-c91a2aa9f17b","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.542883Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:30d9c8f480d2eaab521f5765524bef83305fd78ef103eb8944560b1362328bb1","observation_id":"2b74f78c-c0a6-446a-bf76-4cf0149304f6","resolution":{"observed_at":"2026-08-06T21:36:19.390251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.376421Z","title":"A simple framework for open-vocabulary segmentation and detection","venue":null,"work_id":"56d0d70a-17be-49d2-987f-65c998e58f18","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.546520Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:a0688f2ade8334563ca497d222fa0c9604c736b5c6f05e6d89ace33a585b7dbf","observation_id":"0a5d0124-4576-468f-9bfe-074f9e12ae86","resolution":{"observed_at":"2026-08-06T21:36:19.379908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11221","last_updated":"2024-08-20T22:39:52Z","snapshot_observed_at":"2026-07-06T19:03:43.883872Z","submitted_at":"2024-08-20T22:39:52Z","title":"On the Potential of Open-Vocabulary Models for Object Detection in Unusual Street Scenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11221","snapshot_observed_at":"2026-08-06T21:36:18.549547Z","title":"& Rottmann, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.549547Z"},"links":{"cited_paper":"/paper/2408.11221","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:d7419e16bc2d42e193194d92941bda5353677e3365ac5e62b237c81e614d0d08","observation_id":"989687e5-18d6-43b5-bb1c-f1c222a726bd","resolution":{"observed_at":"2026-08-06T21:36:18.549547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.366295Z","title":"& Sünderhauf, N","venue":null,"work_id":"3796dfc1-ddf6-4afe-ad0a-c709f2a8f78c","year":2018},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.552934Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:f19a380e25bcdaff923f61d6399db2565bf9007ccc54c060329078ddf0854458","observation_id":"6f525e28-8210-4bcc-99c1-ee2782f80ad3","resolution":{"observed_at":"2026-08-06T21:36:19.369634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.356527Z","title":"& Sünderhauf, N","venue":null,"work_id":"89f5fa90-eea8-4f95-9060-6cf0ac014b35","year":2019},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.556189Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:87b853389fc9baff69a77dfd07fbcab5ca2229ce64a0d032e9de26097079d71c","observation_id":"b42c637e-997c-46b8-b5c0-aab2e4c8c257","resolution":{"observed_at":"2026-08-06T21:36:19.360002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.346100Z","title":"& Rottmann, M","venue":null,"work_id":"c5ff9cb3-631f-46be-8a22-11aaaf2ce4ca","year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.559322Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:bc253fbdccb3369f55081b9724726280378a2dd536110c36c58f834ed18ffc46","observation_id":"1f083ea2-83ff-47b8-ae5f-c397044fcc8c","resolution":{"observed_at":"2026-08-06T21:36:19.349452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.336005Z","title":"& Gottschalk, H","venue":null,"work_id":"707d618b-90ed-42dc-b513-68ee845fa160","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.562442Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:d2ee0b5dbab43e146991f4a55bd2af2d3794025d6ffdd0ad6eb825eca8799a99","observation_id":"1fd289e5-8a96-4cf3-a955-833d92d6e5dc","resolution":{"observed_at":"2026-08-06T21:36:19.339661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.01197","last_updated":"2022-05-09T20:12:32Z","snapshot_observed_at":"2026-08-05T13:42:39.716639Z","submitted_at":"2022-02-02T18:43:01Z","title":"VOS: Learning What You Don't Know by Virtual Outlier Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.01197","snapshot_observed_at":"2026-08-06T21:36:18.565567Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.565567Z"},"links":{"cited_paper":"/paper/2202.01197","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:98ea4d38d296acdd9e1264e0455b741ba8865f82ffd6ee12dd19eb77dab0d508","observation_id":"44f5711f-afd6-49ed-945c-50c29de8f574","resolution":{"observed_at":"2026-08-06T21:36:18.565567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.324520Z","title":"& Sünderhauf, N","venue":null,"work_id":"ae0d4640-4f65-43ab-bfa8-203b69cb9e4b","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.569187Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:2205a384773d6482d485958469fa1289d2a55e88815bb597fbee736bbf5b5c4d","observation_id":"288ac21e-10a7-447f-b53f-7c4ee685b7a4","resolution":{"observed_at":"2026-08-06T21:36:19.328919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.313234Z","title":null,"venue":null,"work_id":"c5890d22-50b3-4d20-91ac-a4052ff976a0","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.572179Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:905dc38278f566c8fad47be47adf4f7d2f0587e6ee3359942cda3afa767d4f62","observation_id":"94e6f4d1-c9c6-4a2b-8b5a-139da077874d","resolution":{"observed_at":"2026-08-06T21:36:19.317540Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-06T21:36:18.575274Z","title":"& Chen, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.575274Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:1f5b1333e8570fe140dfd30e31310c35e83f4dca22132c7139d650b7d65c89ec","observation_id":"8efabe6d-8a82-4b7d-a99e-1b943be4158f","resolution":{"observed_at":"2026-08-06T21:36:18.575274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.303231Z","title":"& Nguyen, K","venue":null,"work_id":"677fb78e-df03-4eb7-9484-18f3f0621678","year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.578530Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:ce8603c9fddada1b633602b5990a45fdda2ef5a77f728e22dbe50e67c6e9cc43","observation_id":"0b821079-ab36-454a-8f8d-2f95aa026081","resolution":{"observed_at":"2026-08-06T21:36:19.306690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.293320Z","title":null,"venue":null,"work_id":"c0b641aa-e58f-484d-941a-2e9504153a7d","year":1995},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.581481Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:31b3f26c54c014590d4873169b3f827e97f553033fd8e42c8d893ffbdbef112e","observation_id":"86b10c76-9deb-4891-9170-411d5abc4c92","resolution":{"observed_at":"2026-08-06T21:36:19.296733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-08-06T21:36:18.584521Z","title":"& Lee, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.584521Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:412ee58c9b36c3f32171d0ab8101604d23a0e18f9807ef029153ba76aff2c55a","observation_id":"ba9b86d1-36fc-4666-a3d0-e19663fa8683","resolution":{"observed_at":"2026-08-06T21:36:18.584521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.01497","last_updated":"2016-01-06T06:30:17Z","snapshot_observed_at":"2026-07-06T04:19:53.343717Z","submitted_at":"2015-06-04T07:58:34Z","title":"Faster R-CNN: Towards Real-Time Object Detection with Region Proposal Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.01497","snapshot_observed_at":"2026-08-06T21:36:18.587917Z","title":"& Sun, J","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.587917Z"},"links":{"cited_paper":"/paper/1506.01497","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:3f182c12d5172f7df08b87c8c4a9cbad93191e4effdc4efad1034f5223c59966","observation_id":"683c3c39-2a82-47d4-8efe-b980f5937ef1","resolution":{"observed_at":"2026-08-06T21:36:18.587917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.283151Z","title":"Lost and found: detecting small road hazards for self-driving vehicles","venue":null,"work_id":"6682c7bf-c359-4cc2-b07b-e6993d323bb0","year":2016},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.591490Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:b4ae5ec4528f2a58f6407aed24b78dc30bb227e86c7cf9c069dce6eb6852ff25","observation_id":"302e95f0-0bb7-4dfd-b5f9-c9a3767853fa","resolution":{"observed_at":"2026-08-06T21:36:19.286769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.273006Z","title":null,"venue":null,"work_id":"846c9ee3-1721-46c2-8b42-064a6d3a9757","year":2020},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.594534Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:8e510eefee53698f4333a4f4eb626e2f7178e0389dcfcff77a9d644117703b97","observation_id":"6e6faa80-e0fc-4c6c-89a8-811a575d977a","resolution":{"observed_at":"2026-08-06T21:36:19.276487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T21:36:18.597583Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.597583Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:1886c63e8e18e226e324f2c9f856c606c970ef2d3c13ec1355ae9256130f9a93","observation_id":"27abc63b-c56c-4aef-a4a0-61e6f7532879","resolution":{"observed_at":"2026-08-06T21:36:18.597583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:18.600664Z","title":"& Ommer, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.600664Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:d33d940fecaa2affb0317b73fd5a4022d812045edc9b15880829bc735a310231","observation_id":"bbc74057-4bbf-485e-a6b1-a7c87506fec1","resolution":{"observed_at":"2026-08-06T21:36:18.600664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.256425Z","title":null,"venue":null,"work_id":"ac3fdd05-a815-47e9-a101-823aed35db93","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.603648Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:6d62fcb4071b0a4acc45fc92794358bdf9abc3ffa65997de50be99663ac92019","observation_id":"d234a649-8d1c-4b27-8615-25ab634781f9","resolution":{"observed_at":"2026-08-06T21:36:19.260347Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.246974Z","title":"& Zhang, K","venue":null,"work_id":"af76aa3e-1ea3-4330-93d7-6b4eb19e893e","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.607169Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:7c1d845be8a47c837310b38b2260d524634f704f4c2743755cdf1305a3f32d4d","observation_id":"5deb9100-bb4b-413a-a3e2-4cd695794ef0","resolution":{"observed_at":"2026-08-06T21:36:19.250263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.236215Z","title":"Repaint: Inpainting using denoising diffusion probabilistic models","venue":null,"work_id":"04485688-f6fb-417c-a289-64401c39c1a6","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.610361Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:8121bed4ed3a0bd4ef3e062a5990623b3a004cd1a3d1c4a5fbfbe4a35f87ff43","observation_id":"781c0f48-99f5-4455-93c0-d0c8d1e07d93","resolution":{"observed_at":"2026-08-06T21:36:19.240457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.225610Z","title":"& Martinez, A","venue":null,"work_id":"1956a441-ff08-4445-b7f8-e34d3bc235a0","year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.613417Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:8979199127d4fbd878bcff4d49b2d3295d06c9f197fc3967884144abcbdf1e29","observation_id":"4c45d631-d538-4be2-ae14-bf4968b30108","resolution":{"observed_at":"2026-08-06T21:36:19.229403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.215435Z","title":"& Yang, W","venue":null,"work_id":"b155289a-334c-4c4a-8fa6-b7af58f793a0","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.617018Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:f5588b897068cdc8d3583b6c51ddf17f52a78158df2842cdbe8f8c42d3256c32","observation_id":"01f3f2e8-63b8-4b2a-a23f-33f439620e0a","resolution":{"observed_at":"2026-08-06T21:36:19.218969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.204055Z","title":"Stable Diffusion Web UI (2022)","venue":null,"work_id":"239f5877-deeb-4fd4-97fc-df2dda3b7027","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.620060Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:b7a84ddd44ba60d7228ffbf5ec605f551ba1a004b35e7b6e4ad4afcddb3e16d2","observation_id":"04c200de-e7f8-41cb-beef-396b2739987d","resolution":{"observed_at":"2026-08-06T21:36:19.208258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01596","last_updated":"2024-03-10T21:41:51Z","snapshot_observed_at":"2026-07-06T16:26:46.131908Z","submitted_at":"2023-10-02T19:41:42Z","title":"ImagenHub: Standardizing the evaluation of conditional image generation models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01596","snapshot_observed_at":"2026-08-06T21:36:18.623140Z","title":"Imagenhub: Standardizing the evaluation of conditional image generation models.arXiv preprint arXiv:2310.01596 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.623140Z"},"links":{"cited_paper":"/paper/2310.01596","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:08b59f8608c79e794f8ab6ccb8049046f9bcc024ac84fc071490844b69018f66","observation_id":"185ed529-6866-42b3-bdda-bc85c0e22016","resolution":{"observed_at":"2026-08-06T21:36:18.623140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07027","last_updated":"2024-04-30T12:37:13Z","snapshot_observed_at":"2026-08-07T01:37:37.609304Z","submitted_at":"2023-10-10T21:29:41Z","title":"Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images","version":2},"cited_work":{"arxiv_id":"2310.07027","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.07027","snapshot_observed_at":"2026-08-06T21:36:18.901251Z","title":"Utilizing Synthetic Data for Medical Vision-Language Pre-training: Bypassing the Need for Real Images","venue":"cs.CV","work_id":"9d73986b-e17f-4ff2-bdbc-32bbceead8b3","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.626438Z"},"links":{"cited_paper":"/paper/2310.07027","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:a3da2aae9c9012019f220fbef84e825397aa247f6ca7a86552b708f4c13d28e8","observation_id":"92b6bef2-ac06-4d06-b511-b67f2d2c17d7","resolution":{"observed_at":"2026-08-06T21:36:18.905441Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.193067Z","title":"& Tang, Y","venue":null,"work_id":"3ceb230c-9141-4b35-8fab-3f4d98a3e930","year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.630496Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:8dcc0ecb5b6bee6b6ac6ff92961f6cf449eb00cf757fa3f1a27374bed30c0a74","observation_id":"bcc19d0e-d167-4da7-aef3-73a3f6a5e2c1","resolution":{"observed_at":"2026-08-06T21:36:19.196892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07061","last_updated":"2019-07-16T15:21:38Z","snapshot_observed_at":"2026-07-06T08:08:05.915923Z","submitted_at":"2019-07-16T15:21:38Z","title":"How much real data do we actually need: Analyzing object detection performance using synthetic and real data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.07061","snapshot_observed_at":"2026-08-06T21:36:18.634464Z","title":"E.et al.How much real data do we actually need: Analyzing object detection performance using synthetic and real data (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.634464Z"},"links":{"cited_paper":"/paper/1907.07061","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:5c3b936ff12aba32e51347aa295480b4247c81384844a57d6a54100847871a92","observation_id":"0dc6ffe2-90aa-4566-b9ef-b858c00170ce","resolution":{"observed_at":"2026-08-06T21:36:18.634464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.183447Z","title":"& Zhao, R","venue":null,"work_id":"4dcead2b-1510-4870-8112-c0bb5a28c658","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.637951Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:938b522b57e69700211a4390bfb12d12d5ba88216799802d79ee8b910718b612","observation_id":"982a6467-bfaa-4cf9-b4d7-23fa677f6da7","resolution":{"observed_at":"2026-08-06T21:36:19.186832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.173281Z","title":null,"venue":null,"work_id":"8e2bcb03-7f6f-4e9d-9621-3d98db61e958","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.641348Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:696f18489d9b179a7485dac760a7843b6f2b03f64d4e53396743d07515182660","observation_id":"d300ba11-ef78-48f0-b3dd-daa3c648b551","resolution":{"observed_at":"2026-08-06T21:36:19.176812Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05162","last_updated":"2024-09-08T17:28:22Z","snapshot_observed_at":"2026-07-06T19:12:11.032644Z","submitted_at":"2024-09-08T17:28:22Z","title":"Can OOD Object Detectors Learn from Foundation Models?","version":1},"cited_work":{"arxiv_id":"2409.05162","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.05162","snapshot_observed_at":"2026-08-06T21:36:18.875556Z","title":"Can OOD Object Detectors Learn from Foundation Models?","venue":"cs.CV","work_id":"be913fa5-21c1-425f-baf2-22b1f431550c","year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.645069Z"},"links":{"cited_paper":"/paper/2409.05162","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:80a3f6528f8c2a34f8d81cd0576e4fd4c4ddc186808899aad875f8aef605f6dc","observation_id":"734124be-46d0-48d3-94f5-86ec2c85fead","resolution":{"observed_at":"2026-08-06T21:36:18.881224Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.163595Z","title":"& Cadena, C","venue":null,"work_id":"74d3e0e2-d908-4ade-bb3f-f91ffffb5f2e","year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.648354Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:d728cc013bc3559fdc1a2618aa50257a98a7b98529903e7b923c49742f9b0b5e","observation_id":"07ea6929-638c-41b5-b492-83b281a620f3","resolution":{"observed_at":"2026-08-06T21:36:19.166956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.153933Z","title":"& Cord, M","venue":null,"work_id":"dfd6aac9-a4a3-4134-aa61-42b9ac07f285","year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.651534Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:fcd9be7fa75e7562d9f584558b98ab63a2db57cc3568abb5675fc165df248aaf","observation_id":"c672abfc-85dd-43e7-9327-3e0d40a4ed3e","resolution":{"observed_at":"2026-08-06T21:36:19.157509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.142665Z","title":"In 2021 IEEE Intelligent Vehicles Symposium Workshops (IV Workshops), 182–189 (IEEE, 2021)","venue":null,"work_id":"658bebce-5c3d-4b89-a4e6-516bc3c4dab9","year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.654656Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:f57636bbefc0441d00ba7a249899464c1ef19043315fab01cd1d5c1fc40696eb","observation_id":"5bcb5145-926b-44e3-8f65-cca68fb82b87","resolution":{"observed_at":"2026-08-06T21:36:19.146685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.132688Z","title":null,"venue":null,"work_id":"28b58830-ef85-4fd4-aac5-35f54d72a918","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.657892Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:d04e0ad7b5dd555f51136c96e6f5528186b2af844ecd0f45bb8d1e9acff36320","observation_id":"724ef5f0-1d63-4f6e-aacb-aa4e86596c1b","resolution":{"observed_at":"2026-08-06T21:36:19.136254Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.122556Z","title":null,"venue":null,"work_id":"925fcdca-44ac-404a-bcc4-3d9d940d67e1","year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.661072Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:86836a5bd28566ebff9c19107a5b231cc8bbf3d6c585b7c45c15ecf47fc95c57","observation_id":"46945fdc-6f9d-451a-8324-e0fc534edda8","resolution":{"observed_at":"2026-08-06T21:36:19.126061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.112056Z","title":"InComputer vision–ECCV 2014: 13th Eu- ropean conference, zurich, Switzerland, September 6-12, 2014, proceedings, part v 13, 740–755 (Springer, 2014)","venue":null,"work_id":"fe3c2b34-43f0-4057-89e9-ccba31aa0a2e","year":2014},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.664264Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:584f834abfba7ba233cb4e2fac56d9004af20b47e31de608d2064b98b6dd1809","observation_id":"8f8f51d4-909b-4ca6-abc0-bf65973a72f6","resolution":{"observed_at":"2026-08-06T21:36:19.116100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.101791Z","title":"& Girshick, R","venue":null,"work_id":"8be11fb1-e608-43c3-bf7d-c12b848011e1","year":2019},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.667338Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:843ad9b125bcb66231b9df2af183123f878eef6bac5e10d6e374d54474f39403","observation_id":"e9b914be-f8ad-443a-ac52-44ab612d347c","resolution":{"observed_at":"2026-08-06T21:36:19.105504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.090971Z","title":null,"venue":null,"work_id":"0d6a8d94-3259-496f-8d6f-958d2a9b0acb","year":2019},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.670612Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:b4f7a46ebd855784230056cc54bf7a85afbc6eaea9c2b7e7734c9d49b1b684bb","observation_id":"a59087b7-e1e5-4527-b185-ffecf43fea79","resolution":{"observed_at":"2026-08-06T21:36:19.094384Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.080436Z","title":"& Falchi, F","venue":null,"work_id":"d64fedbe-dfa7-449a-acb8-e8e50c532744","year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.673842Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:63fd0ef1a381da21949ac01880a8889a0e65790a1968dd269a50c80b6043f122","observation_id":"97847394-6117-478f-9244-6da8e53561e0","resolution":{"observed_at":"2026-08-06T21:36:19.084262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.069169Z","title":"Dreamshaper (revision 8c1bfc6) (2023)","venue":null,"work_id":"d47d74dd-c63b-442d-9bb7-c589e2a3906b","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.676876Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:a66da21dc46ca44c277967411bcd7a388e3c2b4c9408d21944f8194bed104789","observation_id":"e848b716-1c66-485d-a552-8158fc837812","resolution":{"observed_at":"2026-08-06T21:36:19.073585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.057578Z","title":"Stable Diffusion Inpainting","venue":null,"work_id":"83d611a6-edee-464e-b94c-8e0ef0905750","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.680204Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:513d283e2d243d9f9e4d4614ad97a211196a719785afe16d87636de7892abbf2","observation_id":"7fecbe25-c803-496b-8412-92c0695ceaf0","resolution":{"observed_at":"2026-08-06T21:36:19.062164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-06T21:36:18.683344Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.683344Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:ffe2815c04e908a0860f42abcf12090f718020b9cd854325f680b1da47f9ac87","observation_id":"40958ad3-8aa9-49f8-8685-e8c00513fa22","resolution":{"observed_at":"2026-08-06T21:36:18.683344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.045787Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":"78968068-514b-4820-9d69-09e6ae5300df","year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.687166Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:4c277827b34eba5870e3d97e5ec8855aace9f7d9b12d4b44e953c799b8545999","observation_id":"e125fe07-9d49-4589-983b-bee787913275","resolution":{"observed_at":"2026-08-06T21:36:19.050108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T21:36:18.690306Z","title":"& Toutanova, K","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.690306Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:3d0287e5731bf36e67f8bef173788ba35479dd541375f560f186077084919b27","observation_id":"75881d79-0e3c-424a-a6f8-ec2c9ed44463","resolution":{"observed_at":"2026-08-06T21:36:18.690306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.034225Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":"236a606e-9aaa-4916-915d-53c50d9aa0ca","year":2016},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.693530Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:8a37ed4749940cd3bab0b330b7d3d57a66e3fa82f36372d9fd1d772a078cc382","observation_id":"fac2a4bc-5f3a-4c66-a516-0089e2fbcca2","resolution":{"observed_at":"2026-08-06T21:36:19.038564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.024086Z","title":"& Qiu, J","venue":null,"work_id":"17d70378-39f6-4089-8dc6-f0d80b77e2f1","year":2023},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.697037Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:1555fe1659c538c5915fc7509a29f5809020a77a61edce1f8353a738d0189e06","observation_id":"d8239150-8093-4779-9ff2-a591f208e989","resolution":{"observed_at":"2026-08-06T21:36:19.027452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.013259Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"25e9c5ee-d65f-4483-9ac1-c36dfc7e3f1f","year":2021},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.700069Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:578a3847a8e2aa93f2a4da888ed3b0f36b0634f83c8aeaf3345701886b352b62","observation_id":"29ae174e-5e6d-4862-9af4-e1807b3583f6","resolution":{"observed_at":"2026-08-06T21:36:19.017053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:19.001816Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"4b0e7fca-6094-4b7a-add6-c3a07e0ac12c","year":2020},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.703213Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:342726153830d8235acd1b51912ec645dc660ad3d9fffb9055cde8a6df07d49c","observation_id":"4367e64b-8a1a-4b77-83c1-efbc75fabb28","resolution":{"observed_at":"2026-08-06T21:36:19.005713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-06T21:36:18.706367Z","title":"arXiv preprint arXiv:1907.11692 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.706367Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:dec810bfb6f5fa1ab6f04f4e2cd7c4a28eacfb8ece578833ec6f327ba56d54b4","observation_id":"d57a1505-2b3e-41cd-bb85-8d3eedc3d333","resolution":{"observed_at":"2026-08-06T21:36:18.706367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01095","last_updated":"2025-05-19T07:56:56Z","snapshot_observed_at":"2026-07-29T20:17:21.488997Z","submitted_at":"2022-11-02T13:14:30Z","title":"DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01095","snapshot_observed_at":"2026-08-06T21:36:18.709505Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.709505Z"},"links":{"cited_paper":"/paper/2211.01095","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:7bcd695b1131769e8c8611efec5713ed10a56b27faded39394963f76c0ea23aa","observation_id":"26a51f06-ae8e-4e81-8948-023bd30e66ef","resolution":{"observed_at":"2026-08-06T21:36:18.709505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-06T21:36:18.712859Z","title":"& Ermon, S","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.712859Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:f594a146c197ad4474b490017450161209955c65cc41f1e14f915ed9752317b5","observation_id":"ab22c0ad-749c-46da-a690-68b553b9401a","resolution":{"observed_at":"2026-08-06T21:36:18.712859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4950.3261","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:36:18.811033Z","title":"object in the street","venue":null,"work_id":"ed89d979-53e8-4943-988d-cc3694f3b4db","year":1980},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.716315Z"},"links":{"citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:e0bbb5cb86f5315f163580e3cb514dc09b7b2db667f25183723b33374d388eb6","observation_id":"c620061b-803e-4e43-8dc3-5c3f49360751","resolution":{"observed_at":"2026-08-06T21:36:18.817206Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":32},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2506.23751."}