{"as_of":"2026-08-07T16:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0ce529943440f07c464de9422d43600abf8c9b345692ab6d305eae6d5120b02","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:36:18.584521Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:29:57.555270Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-08-06T21:36:18.584521Z","title":"& Lee, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23751","last_updated":"2025-06-30T11:48:44Z","snapshot_observed_at":"2026-08-06T21:30:20.204873Z","submitted_at":"2025-06-30T11:48:44Z","title":"Can We Challenge Open-Vocabulary Object Detectors with Generated Content in Street Scenes?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:36:18.584521Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2506.23751"},"observation_digest":"sha256:412ee58c9b36c3f32171d0ab8101604d23a0e18f9807ef029153ba76aff2c55a","observation_id":"ba9b86d1-36fc-4666-a3d0-e19663fa8683","resolution":{"observed_at":"2026-08-06T21:36:18.584521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-08-06T14:54:36.900809Z","title":"\"\" Input: n: int k: int ffn: nn.Module","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17436","last_updated":"2025-07-23T11:51:06Z","snapshot_observed_at":"2026-08-06T14:45:20.998963Z","submitted_at":"2025-07-23T11:51:06Z","title":"Dynamic-DINO: Fine-Grained Mixture of Experts Tuning for Real-time Open-Vocabulary Object Detection","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T14:54:36.900809Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2507.17436"},"observation_digest":"sha256:5ebdf4069b4e88bf284ada28cead6fe09343e298888d46d0010548f35a238998","observation_id":"3284b77e-4e6b-4c96-9279-5610508bfeb2","resolution":{"observed_at":"2026-08-06T14:54:36.900809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-08-06T13:12:06.410938Z","title":"Real-time Transformer-based Open-V ocabulary Detection with Efficient Fusion Head","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20976","last_updated":"2025-07-28T16:38:06Z","snapshot_observed_at":"2026-08-06T13:12:04.197694Z","submitted_at":"2025-07-28T16:38:06Z","title":"Adapting Vehicle Detectors for Aerial Imagery to Unseen Domains with Weak Supervision","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T13:12:06.410938Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2507.20976"},"observation_digest":"sha256:44f61d37daef10c4a763964319670da558c67874d90ea0ee4e8253dc81a7dab8","observation_id":"882730d5-6ede-47b2-9511-4b58194dc926","resolution":{"observed_at":"2026-08-06T13:12:06.410938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":"2403.06892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-07-04T16:29:57.555270Z","title":"Real-time transformer-based open-vocabulary detection with efficient fusion head.arXiv preprint arXiv:2403.06892, 2024","venue":null,"work_id":"2b8da9a1-4f80-43c9-ae9c-51572fdd0167","year":2024},"citing_paper":{"arxiv_id":"2606.24805","last_updated":"2026-07-07T02:07:44Z","snapshot_observed_at":"2026-07-12T12:28:33.415778Z","submitted_at":"2026-06-23T16:54:11Z","title":"DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-26T00:34:12.256197Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2606.24805"},"observation_digest":"sha256:70c5b25b5e64d74b754bd945dde8bd0fe0e87cb55015563dc7bf6b6b368a8c85","observation_id":"bf10c91a-c0a4-4a79-8392-0fc7e86bbfc1","resolution":{"observed_at":"2026-07-04T16:29:57.556812Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-07-12T12:28:33.973570Z","title":"Real-time transformer-based open-vocabulary detection with efficient fusion head.arXiv preprint arXiv:2403.06892, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.24805","last_updated":"2026-07-07T02:07:44Z","snapshot_observed_at":"2026-07-12T12:28:33.415778Z","submitted_at":"2026-06-23T16:54:11Z","title":"DDStereo: Efficient Dual Decoder Transformers for Stereo 3D Road Anomaly Detection","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-12T12:28:33.973570Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2606.24805"},"observation_digest":"sha256:b67d2542351d03b602b6419282449c7ec4ca68df7c9eee9b7a301335b648a458","observation_id":"e663acef-80e3-4a3d-9096-801d61499182","resolution":{"observed_at":"2026-07-12T12:28:33.973570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06892","snapshot_observed_at":"2026-07-13T01:03:27.721212Z","title":"Real-time transformer-based open- vocabulary detection with efficient fusion head.arXiv preprint arXiv:2403.06892, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09008","last_updated":"2026-07-10T00:24:41Z","snapshot_observed_at":"2026-07-15T23:17:59.952233Z","submitted_at":"2026-07-10T00:24:41Z","title":"C-GAP: Class-Aware and Online Prompting Improves Vision-Language Models on Imbalanced Classes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-13T01:03:27.721212Z"},"links":{"cited_paper":"/paper/2403.06892","citing_paper":"/paper/2607.09008"},"observation_digest":"sha256:d5ac40cb095890f84165d4a92a6be178e4f43944afbea4d2e914ed2d3c60999a","observation_id":"1c5efbe0-6bac-4900-ae2b-967ca6bd989a","resolution":{"observed_at":"2026-07-13T01:03:27.721212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.06892/citation-record","integrity":"/paper/2403.06892/integrity","json":"/paper/2403.06892/citation-record.json","paper":"/paper/2403.06892"},"outbound":[],"paper":{"arxiv_id":"2403.06892","last_updated":"2024-12-02T11:24:20Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T17:42:45.397241Z","submitted_at":"2024-03-11T16:48:25Z","title":"Real-time Transformer-based Open-Vocabulary Detection with Efficient Fusion Head"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2403.06892."}