{"as_of":"2026-08-18T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c81e0315d088511978f08c199015a0837f279aaea63aca8032e414282074aaa3","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:30:41.630296Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11507/citation-record","integrity":"/paper/2411.11507/integrity","json":"/paper/2411.11507/citation-record.json","paper":"/paper/2411.11507"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T18:30:41.437350Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.437350Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:0d4a9ea6d8315ea6087761a10a66e3a98eede1a4802f3963c9504f4317b5aecd","observation_id":"5f0e5f97-9b7d-4403-8658-9aeddfefe51a","resolution":{"observed_at":"2026-08-12T18:30:41.437350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.442195Z","title":"Introducing our multimodal models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.442195Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:73bc145428aec25c63680b29d2130fe4306a4aa361c528a0eb5ede6f4e83f688","observation_id":"70673e1b-1f8a-4d39-94dc-9d649faae99d","resolution":{"observed_at":"2026-08-12T18:30:41.442195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T18:30:41.446853Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.446853Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:2235fe5125e2cc8c6c589c1e1f797e9504e6936cd8ced340fa789733acf7dc23","observation_id":"1c3e2908-ed94-400c-a320-abd0228fc4e0","resolution":{"observed_at":"2026-08-12T18:30:41.446853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.196699Z","title":"Road traffic sign de- tection and classification","venue":null,"work_id":"7bc793af-9154-4802-9ed6-310883532c10","year":1997},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.451428Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:27854b21c7f3ae08d244bacb310da9d8275a6c4fe5470473bb85868c5d26e77a","observation_id":"806e932d-e04a-4fa1-a6ab-73b943737b25","resolution":{"observed_at":"2026-08-12T18:30:42.201146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.182935Z","title":"Regiongpt: Towards region understanding vision lan- guage model","venue":null,"work_id":"0663fdc1-bd21-4bc2-a7e8-520ef5e6a0dd","year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.456164Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:32509e3ee6be2f71453cda4e73a277ce6359868f50d11c3e743b87b6bb2819a0","observation_id":"a115c93e-db0f-4a7a-a6ab-7a3bad25a4a6","resolution":{"observed_at":"2026-08-12T18:30:42.187454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.168794Z","title":"Learning to understand traffic signs","venue":null,"work_id":"a0d17efb-73a0-42a2-afba-dde08e38b3a8","year":2021},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.460606Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:29b6ab7254ac164ec6efabe0d09fab8062793bf2ec699f98657ca2ac5bc0c460","observation_id":"1f1b16bd-f57d-48f1-8c48-0db05e2dabc0","resolution":{"observed_at":"2026-08-12T18:30:42.173599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.153612Z","title":"Visual traffic knowledge graph generation from scene images","venue":null,"work_id":"78c3b974-0c96-4426-be72-b1e0f93f89c6","year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.465310Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:5aeaa2ef7b421eb43d1e07bc5fe9934e24997ef98cb22be5cb863a627730b25b","observation_id":"38dd8ab5-7e3f-47c4-84ab-cdeeef133088","resolution":{"observed_at":"2026-08-12T18:30:42.158171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.139081Z","title":"Sign- parser: An end-to-end framework for traffic sign understand- ing","venue":null,"work_id":"9ffab3ad-d4e5-4379-86dd-2b973be5e15b","year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.469356Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:cfed66e1781de7bad9f1799c62356d91cb9a405b12fce24635f8e57ac1a9d630","observation_id":"9e967691-458d-4c57-91d0-5af285ff6c15","resolution":{"observed_at":"2026-08-12T18:30:42.143929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.473784Z","title":"Mask r-cnn","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.473784Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ade80d067639e31975bb6e4b79cad05877824670f8d5dffecbe82e69e2c295ac","observation_id":"ebc2f913-8c2a-4270-96ee-44dbbd4e4712","resolution":{"observed_at":"2026-08-12T18:30:41.473784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T18:30:41.478088Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.478088Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ac4ef420f012dfc9e6e3274396006771ef763e983c16f9b39e112a3fe960edd3","observation_id":"54f50c66-9b60-449c-b1d7-acb9790c1c30","resolution":{"observed_at":"2026-08-12T18:30:41.478088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.115788Z","title":"Selfocc: Self-supervised vision-based 3d oc- cupancy prediction","venue":null,"work_id":"a45293ad-db55-4f37-9e6a-51d605890653","year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.483022Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ecdf60dcc1cae7ed2998b4f691c625698434bd96382e597de5298ec1e8dfbf1d","observation_id":"a424771a-8aa0-42b5-be5f-bffe55f47786","resolution":{"observed_at":"2026-08-12T18:30:42.120494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.488199Z","title":"Segment any- thing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.488199Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:84e46259a1dd37ac38bd3bbbccb067c05d8f3fee766a389a130216fb55f2d15a","observation_id":"9ceac51e-3d29-4c98-b53f-e921f61dd939","resolution":{"observed_at":"2026-08-12T18:30:41.488199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.492361Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.492361Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ca14d8e91b891b362dbc3dc781b2174993c7775c7f998493f9e6ce06c20bf60a","observation_id":"a65f0ff1-24dc-4971-b081-b1e681188bb6","resolution":{"observed_at":"2026-08-12T18:30:41.492361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04219","last_updated":"2023-11-07T18:59:58Z","snapshot_observed_at":"2026-08-16T14:45:10.647424Z","submitted_at":"2023-11-07T18:59:58Z","title":"OtterHD: A High-Resolution Multi-modality Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04219","snapshot_observed_at":"2026-08-12T18:30:41.496598Z","title":"Otterhd: A high-resolution multi- modality model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.496598Z"},"links":{"cited_paper":"/paper/2311.04219","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:771fcd1e228c73ca5b44a9976dcbd4d639603fda7e7aa81817ef31d7f5024293","observation_id":"2b9dda70-50ba-40d6-8615-c24cf5685b5a","resolution":{"observed_at":"2026-08-12T18:30:41.496598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.501520Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.501520Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:cee77a3049e634ac1d5b323a60231381e050fbf0d4eee1667d100958b80c1ec8","observation_id":"f8be68f9-e551-4af1-acc6-c3e937ecd859","resolution":{"observed_at":"2026-08-12T18:30:41.501520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.505655Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.505655Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:76aeb109fee14de9eca9f1354566234c321c26b1d65466a2b5d86977db0e5fe0","observation_id":"edfaa45c-3738-4dd1-a7a7-29ca20c4cea2","resolution":{"observed_at":"2026-08-12T18:30:41.505655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.509741Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.509741Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:e5fa7d80e7edf2b5fd7f41a46b87675c17187ab1bb9a9d4852962cb1661f1f1b","observation_id":"e5359c75-54e5-4898-ac44-f3ca3f5b9eec","resolution":{"observed_at":"2026-08-12T18:30:41.509741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.513832Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.513832Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:a8c0521194ee59720b42f408e1c450420d6d96c9eaebbbd6e4c605566c4c1bd5","observation_id":"a0bf4407-92c6-4147-a1c3-a391547cbda5","resolution":{"observed_at":"2026-08-12T18:30:41.513832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.517856Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.517856Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:bf1cf8397094214961e5766da2875639c625c1b730fb4bb55e92b26d4743115e","observation_id":"98aaa76b-bae7-49d5-bb96-3aee99bfa913","resolution":{"observed_at":"2026-08-12T18:30:41.517856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T18:30:41.522144Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.522144Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:04ed9d5b18c0d43ee6b25598ca657c9d1b8b60f26f0a794a428c268cdb82739f","observation_id":"be7d13eb-ca7e-44aa-a846-85019ccf3071","resolution":{"observed_at":"2026-08-12T18:30:41.522144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T18:30:41.526492Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.526492Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ceab0cfd879cb32ee06ba0970259d68a4b484cc7a1f78cf085b78a50f5b7f80f","observation_id":"254c7517-d5ce-4dbe-b36e-a6daa68f7bf0","resolution":{"observed_at":"2026-08-12T18:30:41.526492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.040405Z","title":"Cotr: Compact occupancy transformer for vision-based 3d occupancy prediction","venue":null,"work_id":"fa745481-b9ea-45f4-83de-b7d04aca43ef","year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.530799Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:e9013f5aa5852f9e5e8a6d3265c4997722cc42dcb690c2cadf180d1aa5ada530","observation_id":"b5635c71-e85d-4550-8d29-900e47a8bdae","resolution":{"observed_at":"2026-08-12T18:30:42.044860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.026226Z","title":"Road-sign detection and recognition based on support vector machines.IEEE transactions on intelligent transportation systems, 8(2):264–278, 2007","venue":null,"work_id":"eec28a44-4504-48f3-941e-0dbe0c4ec9b3","year":2007},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.534909Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ab0f13f4132f0376b49d4564c09122aedfd11d764abcfe91eab0a709b05eb740","observation_id":"968105ce-838a-424b-852c-3b17749411b1","resolution":{"observed_at":"2026-08-12T18:30:42.030966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:42.011888Z","title":"Ultra fast structure- aware deep lane detection","venue":null,"work_id":"fbcb21f4-5100-4556-99d6-0b89f6174d95","year":2020},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.538904Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:5aba00dd4f6fe1b949d9717850b49211b548e074e51b98aacfe91cd3882b1fc9","observation_id":"bcd5c2d9-5527-434f-8cb8-87b6933f9327","resolution":{"observed_at":"2026-08-12T18:30:42.016767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.542994Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.542994Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:e69c1fb7fa03cecfa0c4ec6bc4a0634878f4f94be8e9b4c8280d8f6bc4c22d59","observation_id":"ce03307d-a44c-49e6-91a8-7706893f5ba9","resolution":{"observed_at":"2026-08-12T18:30:41.542994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.546941Z","title":"You only look once: Unified, real-time object de- tection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.546941Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:3d21ae85947752eaa1c8669572ecaef28ed25e57ccbe9ad9a58e8df25a9aee39","observation_id":"066d61cc-f13c-467a-a608-eaac5922a62d","resolution":{"observed_at":"2026-08-12T18:30:41.546941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.550746Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.550746Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:15933541478c7c66ed99b3dc856cf4ec59e5bb185b210594fb684f05ec9baefc","observation_id":"ea82bc25-796c-40ad-babe-5a93639f086d","resolution":{"observed_at":"2026-08-12T18:30:41.550746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.971078Z","title":"Deep learning for large-scale traffic-sign detection and recognition","venue":null,"work_id":"6185ef3f-2ddb-465c-ae11-0f9c723dfe78","year":2019},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.555050Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:f53a9aa0b34e19b16881f3592a14a9779ec12aa3a240809aa55a7157ca104a35","observation_id":"0f1a9314-fc36-4d1a-8611-dc9fec5adcc9","resolution":{"observed_at":"2026-08-12T18:30:41.975651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.957730Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for autonomous driving","venue":null,"work_id":"d1106ad2-d1f5-40db-abcd-387a9bfe9be1","year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.559245Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:48d1712ccbfc5b207704e0acd8f7498ff43e7d5ee5fc12013368494d3b45885d","observation_id":"f39668bd-2342-433f-b6c9-a3f0ccbee71f","resolution":{"observed_at":"2026-08-12T18:30:41.962093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.943353Z","title":"https://github.com/TuSimple/tusimple- benchmark","venue":null,"work_id":"a861769b-c12d-4d5b-801f-bd09401ecab2","year":null},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.564048Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:196cb1f8d7f85f60f98d2028698a7b630032fb03062c907050fad770488dd782","observation_id":"03549c53-f675-46ca-b616-c8cadd0b6c23","resolution":{"observed_at":"2026-08-12T18:30:41.947869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.568214Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.568214Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:65744d48f9df298f61485e3042a0a6e83cf025a045e9df71adade871568e708e","observation_id":"a7aaa87d-4d12-498e-9c10-e701e3dcbc5f","resolution":{"observed_at":"2026-08-12T18:30:41.568214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.921631Z","title":"All you need is boundary: Toward arbitrary-shaped text spotting","venue":null,"work_id":"8977a966-a23a-4d4e-9a09-09bf2a5c169c","year":2020},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.572183Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:2c48f395d2223429e400209cc596f1565edb4aabdcb900d324612493a62eeb2f","observation_id":"bd8e3774-dbca-4f14-b202-27e684d6430c","resolution":{"observed_at":"2026-08-12T18:30:41.926134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01907","last_updated":"2023-08-03T17:59:47Z","snapshot_observed_at":"2026-08-16T15:10:58.683169Z","submitted_at":"2023-08-03T17:59:47Z","title":"The All-Seeing Project: Towards Panoptic Visual Recognition and Understanding of the Open World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01907","snapshot_observed_at":"2026-08-12T18:30:41.575941Z","title":"The all-seeing project: Towards panop- tic visual recognition and understanding of the open world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.575941Z"},"links":{"cited_paper":"/paper/2308.01907","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:4cda96829080c333101ae1e88591add9b6f017ec585feedcf7df647464d31267","observation_id":"8c85ae15-a860-4770-a04f-dc9a8c4ea2f2","resolution":{"observed_at":"2026-08-12T18:30:41.575941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19474","last_updated":"2024-08-23T07:20:57Z","snapshot_observed_at":"2026-08-16T14:14:00.076855Z","submitted_at":"2024-02-29T18:59:17Z","title":"The All-Seeing Project V2: Towards General Relation Comprehension of the Open World","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19474","snapshot_observed_at":"2026-08-12T18:30:41.580179Z","title":"The all-seeing project v2: Towards general relation comprehension of the open world","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.580179Z"},"links":{"cited_paper":"/paper/2402.19474","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:5210904f86423dfd49dd40bceffee448fc27e18a8c9c2e1a46e7239ca51b7e08","observation_id":"2a88959a-3481-4f4e-a554-dbe640691a1e","resolution":{"observed_at":"2026-08-12T18:30:41.580179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.584721Z","title":"Chain-of-thought prompting elicits reasoning in large lan- guage models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.584721Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:b2c343c71344b250d5cfca9f934717696f1d24e7efdc510bea69f6e142137034","observation_id":"b366899d-bf7e-465f-abfb-37269829f384","resolution":{"observed_at":"2026-08-12T18:30:41.584721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-12T18:30:41.589077Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.589077Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:db743cb94ac4b40e0a6d5f8d07a9073a2ff37c05e1ade82d0aa9caf4d73e1ca5","observation_id":"e379fc76-cd15-471b-8a53-037700bb61db","resolution":{"observed_at":"2026-08-12T18:30:41.589077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.900402Z","title":"Cm-net: Concentric mask based arbitrary-shaped text detection","venue":null,"work_id":"774407c9-f5f3-4c03-a3a5-f8a0f0218d0f","year":2022},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.593518Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:488154c504291737bd8c27d0ee350a2685b30f616688bee3a0a75eedb4abd55a","observation_id":"b1ed8875-de66-45da-a56b-5150b4f2fbf2","resolution":{"observed_at":"2026-08-12T18:30:41.904453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.887377Z","title":"Text growing on leaf","venue":null,"work_id":"79f458b3-83d8-4b5b-bf5e-93261214d8a1","year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.597330Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:9be092306a1dc6aa85e32f3b1e1e2e0377c8a7b7e04ab09d7933178a25a17d0f","observation_id":"e8a50527-f78a-470c-b42e-a2a973e33df0","resolution":{"observed_at":"2026-08-12T18:30:41.891356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.873903Z","title":"Traffic sign interpretation via natural language description","venue":null,"work_id":"60e27d43-a567-4f21-94a0-6519cf9e0b93","year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.601448Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:e9859da4475265cca8f7bda8dfa0ed214825dd2e2eb931746e68d140f27023b9","observation_id":"dfc21d11-20e7-4fd2-9258-1eeb0ab79d92","resolution":{"observed_at":"2026-08-12T18:30:41.878270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.860353Z","title":"Towards real-time traffic sign detection and classification","venue":null,"work_id":"3467878b-ce0f-4ef0-b401-ca3a5cdeacc3","year":2022},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.605434Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ff12f597cca0de07c18ccb09e6f98709b01ac503015d8cd29a25f7e2d44f66b1","observation_id":"c6163d55-bc7b-4126-a9c3-ff0cc7fcc955","resolution":{"observed_at":"2026-08-12T18:30:41.864862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T18:30:41.609325Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.609325Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:496a6bc6cd02555e544823c019a9f757f7f51147139473007c3d29d9fcde069a","observation_id":"29abadf9-6fc5-4e50-a377-959867d2ba41","resolution":{"observed_at":"2026-08-12T18:30:41.609325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.613582Z","title":"Deepsolo: Let transformer decoder with explicit points solo for text spot- ting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.613582Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:c2a6e9034acad67c7c37b40d48dddc090c1228c49a21d08d30f5a43c6d24f97a","observation_id":"8942e2c7-cf40-4ec0-a09a-d8a9b7d39abf","resolution":{"observed_at":"2026-08-12T18:30:41.613582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-08-17T20:16:19.173618Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-12T18:30:41.617694Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.617694Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:37c3eb4c2b1d8013f5c37d0017bb20833725e01cffdf0a3f564ceccd2df3e786","observation_id":"422fc425-340a-42e6-a6f9-1127a2a23398","resolution":{"observed_at":"2026-08-12T18:30:41.617694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.838143Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"3692d29d-7692-4fdb-a54e-72b6f0ea24cf","year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.622138Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:d9ae966767d74e751cd15d4b38949efbbbb2c729c7089346397fdc779e395516","observation_id":"7c7fcbf5-b0fc-49a7-8ad6-bfed0ff0a25c","resolution":{"observed_at":"2026-08-12T18:30:41.842468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T18:30:41.626130Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.626130Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:ac2b74124a35f666bd84e6f1b481e0764031d9b0073fe029bcefa81b06f8a364","observation_id":"e897133f-037d-4679-b9e9-9c052cae0daf","resolution":{"observed_at":"2026-08-12T18:30:41.626130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:30:41.821729Z","title":"Traffic-sign detection and classifica- tion in the wild","venue":null,"work_id":"f005f8fc-b3b5-458d-84f6-e7c703906e1e","year":null},"citing_paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:30:41.630296Z"},"links":{"citing_paper":"/paper/2411.11507"},"observation_digest":"sha256:335ea38ca4393b15452afc9cd0812599658d45df2730e7f836407deab736c160","observation_id":"553aa9c7-00b5-48a7-bf5a-d465d1be82e9","resolution":{"observed_at":"2026-08-12T18:30:41.828328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.11507","last_updated":"2024-11-18T12:12:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:03:09.503436Z","submitted_at":"2024-11-18T12:12:33Z","title":"SignEye: Traffic Sign Interpretation from Vehicle First-Person View"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2411.11507."}