{"as_of":"2026-08-08T10:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:03cdaafc0166b723b29dfcccd621eac38d8dd3fb6171f7af2816dd8638528a3f","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:24:27.477404Z","state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.22830/citation-record","integrity":"/paper/2601.22830/integrity","json":"/paper/2601.22830/citation-record.json","paper":"/paper/2601.22830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:26.726674Z","title":"A review of sensor technologies for perception in automated driving,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:26.726674Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:a595ee79bdb333f750c170c989befe27f5fcd7c028f0c2e39d2a18f35fa0bce3","observation_id":"356bafe3-53a3-4550-9a7e-bd01fbe8184f","resolution":{"observed_at":"2026-08-03T06:24:26.726674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:26.768278Z","title":"ISO 21 448:2022, Jun","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:26.768278Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:e2c94e3abe004c0de04a2fac76f9bf8dec6cb2b12bc2f1146ad4b2004a8ad085","observation_id":"9f620751-3073-4210-9546-52d4620dabc7","resolution":{"observed_at":"2026-08-03T06:24:26.768278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:26.817360Z","title":"PeSOTIF: A challenging visual dataset for perception SOTIF problems in long-tail traffic scenarios,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:26.817360Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:270ddfe4233eb3663be09cfe78ed3fec4bbf5d38fbac07dc38d594936ad0a9c8","observation_id":"a91e091f-6510-4aa0-ad22-23547fc229c3","resolution":{"observed_at":"2026-08-03T06:24:26.817360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:26.862528Z","title":"Are we ready for autonomous driving? the KITTI vision benchmark suite,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:26.862528Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:94a0b94851c7afa7b9c601ca3fe71829321eca4a8f8b50d4966a112f883c2527","observation_id":"db01f6fa-8a0e-43c1-8d71-8a8990e017e8","resolution":{"observed_at":"2026-08-03T06:24:26.862528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:26.944411Z","title":"nuScenes: A multi- modal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:26.944411Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:bcaf6584440df5bb4c7b07122294a9820af3b340d41679571bc44a3b9e091ee7","observation_id":"eaba0d5c-a992-497f-abfb-6434ba0637d7","resolution":{"observed_at":"2026-08-03T06:24:26.944411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:26.987686Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:26.987686Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:5a2815d8955311c2b9294b2485156c62786ae6a43ec8854739864c3d5363df44","observation_id":"fee05175-e874-46aa-b81e-3d8e9485d9e9","resolution":{"observed_at":"2026-08-03T06:24:26.987686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.039041Z","title":"Uncertainty evaluation of object detection algorithms for autonomous vehicles,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.039041Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:72f51d54d8ec1c80a476e831351218a3e2fdd08f3b88c032fb43984fad46434c","observation_id":"132b2dd2-3c1c-4c7d-9ec5-106f450d62a8","resolution":{"observed_at":"2026-08-03T06:24:27.039041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.099041Z","title":"Ensuring SOTIF: Enhanced object detection techniques for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.099041Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:9f6f16737ad86ba96c4ae9b50dd230a4ae090f17a8647606abdffb6080ab5c06","observation_id":"41d44069-5a4a-4f7b-a8a1-24e418a21247","resolution":{"observed_at":"2026-08-03T06:24:27.099041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.141189Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.141189Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:18127f4895376fda9a73eab07525c6a645de0430f82db742558efd3e9b6e30a8","observation_id":"34f1f560-8bd4-4631-906a-fced57f6882b","resolution":{"observed_at":"2026-08-03T06:24:27.141189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.174985Z","title":"Semantic understanding of traffic scenes with large vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.174985Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:4df09891651fb6c199acc261b217868a3ca70df57cf887543278207a02941a01","observation_id":"fe6d911d-e8a8-4fb8-b549-ae85de49c4a7","resolution":{"observed_at":"2026-08-03T06:24:27.174985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.235777Z","title":"DriveSOTIF: Advancing SOTIF through multimodal large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.235777Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:f19d78bb114efa185e2965c270e2f12ecaf1ceeebfc0c690c09e028ad92c8f36","observation_id":"ff491f0e-f830-4a0c-a6ae-a982940bd795","resolution":{"observed_at":"2026-08-03T06:24:27.235777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.269139Z","title":"LLM-DiffAug: Enhancing few-shot object detection via LLM-guided diffusion augmentation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.269139Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:b35af7af07b1cc2bfdd58f2fcb37d723c3c774db41c82182295a260a4f20de5a","observation_id":"b6c7092f-b097-45cf-9661-ea0f6af0c991","resolution":{"observed_at":"2026-08-03T06:24:27.269139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.332494Z","title":"Filters for common resampling tasks,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.332494Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:d64b142befe95b0072d1ed74517571ba5b21a36a4e216b63b7b8054f50a31137","observation_id":"84fa26cd-ec98-4e62-9e33-ca426133761e","resolution":{"observed_at":"2026-08-03T06:24:27.332494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.369427Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.369427Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:6b6524e13987cf39c919bbd78aa87fca5ce9a986995d3a9f2d16939950b2448b","observation_id":"f9dc3583-4315-435a-a8f9-e069be0fb362","resolution":{"observed_at":"2026-08-03T06:24:27.369427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00201","last_updated":"2025-03-17T19:27:13Z","snapshot_observed_at":"2026-07-06T19:43:14.670881Z","submitted_at":"2024-10-31T20:45:00Z","title":"YOLO Evolution: A Comprehensive Benchmark and Architectural Review of YOLOv12, YOLO11, and Their Previous Versions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00201","snapshot_observed_at":"2026-08-03T06:24:27.422784Z","title":"Yolo evolution: A comprehensive benchmark and architectural review of yolov12, yolo11, and their previous versions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.422784Z"},"links":{"cited_paper":"/paper/2411.00201","citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:a119330b26a9fc06a8f12ca7cc948fab1ca85e5513c836072a8c0dcca33f7cee","observation_id":"f66a1820-df0a-41b9-b733-1594855db30f","resolution":{"observed_at":"2026-08-03T06:24:27.422784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:24:27.477404Z","title":"Microsoft COCO: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:24:27.477404Z"},"links":{"citing_paper":"/paper/2601.22830"},"observation_digest":"sha256:52775a5031c160a2a7a6fa635dea4b8c10c4d45060543c93d581a8ac269c0253","observation_id":"80a1c32b-1ed3-4ac7-aa27-0492b5cc5677","resolution":{"observed_at":"2026-08-03T06:24:27.477404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22830","last_updated":"2026-07-14T18:52:37Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T20:28:25.545043Z","submitted_at":"2026-01-30T10:58:24Z","title":"A Comparative Evaluation of Large Vision-Language Models for 2D Object Detection under SOTIF Conditions"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 0 inbound Pith citation observations for arXiv:2601.22830."}