{"as_of":"2026-08-09T03:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:332d30f88d3cfdc981db22fa13340fbb1b1bdfc94e3aee6cd3d8d907cb9a18c7","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:08:30.800648Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26518/citation-record","integrity":"/paper/2607.26518/integrity","json":"/paper/2607.26518/citation-record.json","paper":"/paper/2607.26518"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-01T14:08:24.560604Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:24.560604Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:4abe21371d4cad469b94ae2c16a81c98c271e9cae86caf2c18219ce07300c4f3","observation_id":"1238daf1-96d0-4aeb-96f4-8c0376afe560","resolution":{"observed_at":"2026-08-01T14:08:24.560604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T14:08:24.655179Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:24.655179Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:c1858921f38bc804f3adbe9c9678def46895bcc964c052ff1c582dff92f47989","observation_id":"c5ee56d7-3138-4926-9a51-7f1977ea3575","resolution":{"observed_at":"2026-08-01T14:08:24.655179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T14:08:24.857336Z","title":"arXiv preprint arXiv:2502.13923 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:24.857336Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:f632f17aba6c37a79d30699510205b2fd3c38e2df754b6a66058ee2660addc53","observation_id":"966b3c20-cf93-4245-a8e6-71b25a394364","resolution":{"observed_at":"2026-08-01T14:08:24.857336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13106","snapshot_observed_at":"2026-08-01T14:08:25.013731Z","title":"arXiv preprint arXiv:2501.13106 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.013731Z"},"links":{"cited_paper":"/paper/2501.13106","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:193538b7d246886ef7c14ebaeb4212a25dcfa96282f6dfc51bc299cfdf5286df","observation_id":"4af56fb8-eba6-484e-8cf3-df061d59a1da","resolution":{"observed_at":"2026-08-01T14:08:25.013731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.192667Z","title":"In: 2020 25th International Conference on Pattern Recognition (ICPR)","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.192667Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:fbab44c6fafb88e67ca40f7a12d21c84540763c727b78e48f0bb40bf425e0709","observation_id":"fd793225-e6ef-455b-b183-eb0674d3f37d","resolution":{"observed_at":"2026-08-01T14:08:25.192667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-01T14:08:25.398866Z","title":"arXiv preprint arXiv:2406.07476 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.398866Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:87efc3ca90d1eccd3331541d6e95750ded9c1d51f8ccb021c7a6cd6eda480705","observation_id":"3e3b9c5e-c3c7-4ded-bcac-f45658f130eb","resolution":{"observed_at":"2026-08-01T14:08:25.398866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.567192Z","title":"IEEE Transactions on Pattern Anal- ysis and Machine Intelligence43(11), 4125–4141 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.567192Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:b566dad96cbfdb4edd24928c5d12be9f838fb884031b4c50e5e4d9f0b22cdf59","observation_id":"107ab560-8696-45ed-94ff-044ceaeebc2d","resolution":{"observed_at":"2026-08-01T14:08:25.567192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.734988Z","title":"In: Proceedings of the First Workshop on Comparative Performance Evaluation: From Rules to Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.734988Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:538611551fcebbd75b8275da0e921196e0156647fe00ba2bbd61a2ef0af0bbfa","observation_id":"076bc363-7d64-476d-9a14-c666586673a1","resolution":{"observed_at":"2026-08-01T14:08:25.734988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:25.882188Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:25.882188Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:0b81ea05909a6036b25dd7dac72f42ba73c61dddbea0286713a96ffaa393462b","observation_id":"dd3678dd-72d2-47b7-a8a1-12eda15f297a","resolution":{"observed_at":"2026-08-01T14:08:25.882188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:26.194007Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.194007Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:69017afeb0b0bf67eafbb867d0ebef9b2de9f0d6940ae9b745d43363a2b63ec4","observation_id":"355421b6-cc3b-46ca-bb22-782bcd7a0ebc","resolution":{"observed_at":"2026-08-01T14:08:26.194007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:26.474096Z","title":"In: 7th International Conference on Learning Representations, ICLR 2019, New Orleans, LA, USA, May 6-9, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.474096Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:6f77cb78b7f7746258d0e7a91e46cbe48a21557d646b31de54c7df4b2581a7bc","observation_id":"4b042e78-d559-4684-b3f2-14a1974c6724","resolution":{"observed_at":"2026-08-01T14:08:26.474096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05372","last_updated":"2025-05-29T01:27:33Z","snapshot_observed_at":"2026-08-08T10:32:41.260070Z","submitted_at":"2025-05-29T01:27:33Z","title":"DVD: A Comprehensive Dataset for Advancing Violence Detection in Real-World Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05372","snapshot_observed_at":"2026-08-01T14:08:26.709687Z","title":"arXiv preprint arXiv:2506.05372 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.709687Z"},"links":{"cited_paper":"/paper/2506.05372","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:2388f38e52a36ac70c86b95209ac1fe3f802f57e15fe030c8acdf6b87cee9f56","observation_id":"c85052ad-3a78-48d0-9fdd-0e2be3abff50","resolution":{"observed_at":"2026-08-01T14:08:26.709687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:26.870771Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (June 2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:26.870771Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:436a084f30f90ed8a12268b66a0633a978b6ebf6cd0364741a9769ac6c8fae0e","observation_id":"1601b9f8-cf4f-4edd-8f20-6d9d147efd5b","resolution":{"observed_at":"2026-08-01T14:08:26.870771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:27.144138Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.144138Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:e261c34f567dbba9470fce828dbbf9237795773d108ac47979c0c1c037028b56","observation_id":"9fa3b80e-61bc-445b-916c-fd8c11442806","resolution":{"observed_at":"2026-08-01T14:08:27.144138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-01T14:08:27.271392Z","title":"arXiv preprint arXiv:2311.10122 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.271392Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:c9f87c04b00a56d35ff9918d665a83999d63cfef84f387c7b5ba63e77a8cdc6b","observation_id":"6406b937-e5b1-48cf-9be5-41fadc9d541e","resolution":{"observed_at":"2026-08-01T14:08:27.271392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:27.405741Z","title":"In: Ku, L.W., Martins, A., Srikumar, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.405741Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:de0793eccf8b26dbaea025c29d8498e1e751b3a509e56b604a1a5038900c9924","observation_id":"9d118a28-ca90-4308-82f2-bc63c6c22e9d","resolution":{"observed_at":"2026-08-01T14:08:27.405741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:27.645005Z","title":"In: Proceedings of the 40th annual meeting of the Association for Computational Linguistics","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:27.645005Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:23180ad58b5ed72367bfa7020c7378764d2dc9c1dff78731a3b7412181315f55","observation_id":"36611968-9571-481b-8141-34487f7cbbd2","resolution":{"observed_at":"2026-08-01T14:08:27.645005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.014800Z","title":"Soft Computing24(15), 11007–11017 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.014800Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:3bd73cbec7d80c405797c55eba747f952fd9bb9ab404ad6a904c59fd142b1979","observation_id":"32affd18-9ea6-406c-abdc-338ff0ea617a","resolution":{"observed_at":"2026-08-01T14:08:28.014800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.101263Z","title":"Multimedia Tools and Applica- tions83(22), 62107–62158 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.101263Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:369689138c852e17b9f3465440a6735bc4209ead531a1f8425e6382f2345ff82","observation_id":"1ec5ac7d-a3d1-43bf-8241-d7eb9da0accd","resolution":{"observed_at":"2026-08-01T14:08:28.101263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.208282Z","title":"In: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition (CVPR) (June 2018) EgoSafe 19","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.208282Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:a6cc5e9303d423842cbb1fb6cd0e2d53ba53ea2b763e820fdc133d39b306b791","observation_id":"6f24fa02-669e-42da-b1b7-e6fe14e69d4b","resolution":{"observed_at":"2026-08-01T14:08:28.208282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-01T14:08:28.354148Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.354148Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:49335e2e66207f334521c264eb8fba493b9d2a22a74ea47b8d8dc4f96db832c8","observation_id":"c8dea55e-e46c-4460-84cd-7104afeafac7","resolution":{"observed_at":"2026-08-01T14:08:28.354148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-01T14:08:28.540578Z","title":"arXiv preprint arXiv:2403.05530 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.540578Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:f6edf3bbbab4630c67e2c256e5be8735ecbac05cf5225286fe254d97845a277f","observation_id":"e9d3524b-fee0-4c0d-bafa-b670e763960b","resolution":{"observed_at":"2026-08-01T14:08:28.540578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.725690Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.725690Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:4d525dbaba43c937be4d7b5def09020c53c6e2b61c1a230105970b9fe9b537a1","observation_id":"493aa63f-ad35-4f23-9a1f-73952c6478ae","resolution":{"observed_at":"2026-08-01T14:08:28.725690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:28.855112Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:28.855112Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:82515202a34ef093b6876b7aa95b16dddcc0b1c162d4000f130b17e8a4235ec1","observation_id":"43291a9f-e330-4fae-8b52-84c2df60345f","resolution":{"observed_at":"2026-08-01T14:08:28.855112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T14:08:29.039815Z","title":"arXiv preprint arXiv:2409.12191 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.039815Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:82081d1b5a80214831ae4a8489dae4eb98d99258b8c4726afb90d1f5fb0c7442","observation_id":"5f0b5937-b160-48b0-bc2a-a1e94bbfca78","resolution":{"observed_at":"2026-08-01T14:08:29.039815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T14:08:29.150412Z","title":"arXiv preprint arXiv:2508.18265 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.150412Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:d62958ca8c99545111ada996e5ecdecc3594b9951e93e121f549c3e1f61ee19a","observation_id":"3a66ad8a-2a45-4741-8394-25dfa51c96f8","resolution":{"observed_at":"2026-08-01T14:08:29.150412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08380","last_updated":"2024-11-13T07:05:40Z","snapshot_observed_at":"2026-07-06T19:49:34.518432Z","submitted_at":"2024-11-13T07:05:40Z","title":"EgoVid-5M: A Large-Scale Video-Action Dataset for Egocentric Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08380","snapshot_observed_at":"2026-08-01T14:08:29.408596Z","title":"arXiv preprint arXiv:2411.08380 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.408596Z"},"links":{"cited_paper":"/paper/2411.08380","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:6f1f1a41023a85da2378248ac223a3875822a45c4b17d7e596fde5ab7ce550b6","observation_id":"3f261905-45cb-4fb0-b2d3-10ff1f52fe30","resolution":{"observed_at":"2026-08-01T14:08:29.408596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:29.612634Z","title":"In: European Conference on Computer Vision (ECCV) (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.612634Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:537582467de5b7ea051ceab63ed85c832427d854e047f8714fe4256c508358a1","observation_id":"2195768c-a2a3-46c9-bb03-4f9e0d50e3f4","resolution":{"observed_at":"2026-08-01T14:08:29.612634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:29.867639Z","title":"IEEE Transactions on Multimedia26, 8557–8568 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.867639Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:5277a4c4d527596993f5dd275632395df8c8a19f2cb44e92e607f238d2eb05e7","observation_id":"cb1fa7f8-7e9d-4faa-a6ec-e1f7c1a10388","resolution":{"observed_at":"2026-08-01T14:08:29.867639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:29.965345Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:29.965345Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:225c36dfcbb185e81d0a593dbefe5c65cf6086163ebe35acb274a1704c00ae71","observation_id":"6b3eb700-223a-450f-ba72-9eb2d5a93b85","resolution":{"observed_at":"2026-08-01T14:08:29.965345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06513","last_updated":"2022-08-22T14:37:16Z","snapshot_observed_at":"2026-08-04T16:35:39.908448Z","submitted_at":"2021-10-13T05:59:39Z","title":"Benchmarking the Robustness of Spatial-Temporal Models Against Corruptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06513","snapshot_observed_at":"2026-08-01T14:08:30.257012Z","title":"CoRRabs/2110.06513(2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.257012Z"},"links":{"cited_paper":"/paper/2110.06513","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:a2cc02b0bbeb35b47eee0bf8bb0cd74736972e07771cce1d046871102acb65ab","observation_id":"17a34a6f-8fd3-46c6-8a05-67961826e038","resolution":{"observed_at":"2026-08-01T14:08:30.257012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:30.416011Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.416011Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:5cd98670456cf38d9de8c4d865b7a4fdec19afcc89e0a3c16d74d6160a5b357c","observation_id":"6af20450-3880-4bfe-8fdd-51bd3d9b54d0","resolution":{"observed_at":"2026-08-01T14:08:30.416011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02858","last_updated":"2023-10-25T06:23:31Z","snapshot_observed_at":"2026-07-06T15:38:39.712379Z","submitted_at":"2023-06-05T13:17:27Z","title":"Video-LLaMA: An Instruction-tuned Audio-Visual Language Model for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02858","snapshot_observed_at":"2026-08-01T14:08:30.544061Z","title":"arXiv preprint arXiv:2306.02858 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.544061Z"},"links":{"cited_paper":"/paper/2306.02858","citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:7e0000cb2168a3d37556f74f70bbb5d4234c94b8fb5f566a042f968064ab2f66","observation_id":"11a02e51-0662-40f4-92ad-3a969d6db804","resolution":{"observed_at":"2026-08-01T14:08:30.544061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:30.648617Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.648617Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:69c41d06e444021a3fae644d0035d81734eb36825cb4d371c37bca4216e54cf5","observation_id":"44e2df20-b144-4986-8c0f-970959fcf388","resolution":{"observed_at":"2026-08-01T14:08:30.648617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:08:30.800648Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:08:30.800648Z"},"links":{"citing_paper":"/paper/2607.26518"},"observation_digest":"sha256:e1a73cb2bec52d92ba552b657c2923b66b4f955ac8b94f914b50dbf4f41f643d","observation_id":"a4697c95-0698-472d-95c5-89e4f4302d38","resolution":{"observed_at":"2026-08-01T14:08:30.800648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26518","last_updated":"2026-07-30T02:44:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T10:19:01.133292Z","submitted_at":"2026-07-29T06:33:11Z","title":"EgoSafe: A First-Person Mobile-Captured Benchmark for Visual Safety Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.26518."}