{"as_of":"2026-08-19T02:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c931e95b204418929cc62f4281a38e7f1d9867cbef6aef011fe8494e0716b58c","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T22:27:52.861022Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05859/citation-record","integrity":"/paper/2607.05859/integrity","json":"/paper/2607.05859/citation-record.json","paper":"/paper/2607.05859"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.315467Z","title":null,"venue":null,"work_id":"35bc4236-2eaf-4f10-b740-3770eb5d5556","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:34c78a27a2b3ed842e54bed4b16ee781bde47bbdea3e71a802b2783f192ad9dc","observation_id":"c4c887a8-553f-4055-92b9-b475a4163984","resolution":{"observed_at":"2026-07-08T22:35:41.316541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.276703Z","title":null,"venue":null,"work_id":"3842d8ca-5a0a-4e32-9742-133362fe4513","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:48e16d5232df1fb57a34777ad71a919ed86eb3d4587063d21fd4534d67983211","observation_id":"a86a0f61-0c8d-4e7c-8256-b81a4a0d4b11","resolution":{"observed_at":"2026-07-08T22:35:41.277778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.285290Z","title":"Spice: Semantic propositional image caption evaluation, in: European conference on computer vision, Springer","venue":null,"work_id":"2919b522-9db7-4671-8b0b-3a247a1eb9bb","year":2016},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:d2a4e101b24bff1fdd3040066b249fa3ae6bb9b2ed7ea57dbd27102673a4d526","observation_id":"a8204efc-3275-425c-b072-f346397254a0","resolution":{"observed_at":"2026-07-08T22:35:41.286591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.297996Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization, text reading, and beyond","venue":null,"work_id":"bbb07df6-af64-46f6-95ba-84cb5668d44b","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:e31f08f0861b444b4ab83e92d3aca1ad214b29ba9af5af05d36fa75fbfc1923b","observation_id":"7d62fa39-4409-48df-8b4a-4e9159c111c0","resolution":{"observed_at":"2026-07-08T22:35:41.299263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.270449Z","title":null,"venue":null,"work_id":"682c50c4-d076-4a29-8704-f5b5f491e8f9","year":2005},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:e02fb8407d02148ba9e923d771d211e8154bd1302a51b04349cc45cc4ad7d75a","observation_id":"5609b157-c88b-48ac-a63b-e511b5f6377f","resolution":{"observed_at":"2026-07-08T22:35:41.272360Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.266029Z","title":"Context-awarevision-languagemodelagentenriched with domain-specific ontology for construction site safety monitoring","venue":null,"work_id":"4e093255-8c3c-43c7-bf48-5e8f4e1e2802","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:a86ceb3e3d9696f96bc7da18b943baa41917c4a8e848cfc4fc37266e3d59e973","observation_id":"c04100e3-cd8e-4ba3-a284-21d5c58c1a73","resolution":{"observed_at":"2026-07-08T22:35:41.267250Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.273055Z","title":"Enhancing vision-language model for construction safety inspection via visually grounded reasoning and reinforcement learning","venue":null,"work_id":"56cf553a-3fcd-4fd2-a2f4-360b2e6e7b08","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:b7cfa91a98b54bbc7ca862b4cba9eaec228cbdeb323817008d18efc55d764817","observation_id":"db022c64-081e-45f2-8731-59aa3cee9036","resolution":{"observed_at":"2026-07-08T22:35:41.274283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2023.105158","doi":"10.1016/j.autcon.2023.105158","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Augmented reality, deep learning and vision-language query system for construction worker safety","venue":"Automation in Construction","work_id":"2c88b9e0-c740-4fab-a8a0-7c2bcb152acc","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:1eee950d2a7f2784593e4ed2b0fc36e83c93f3e1a42b69cd3d9e94075f813fa3","observation_id":"15e6ae3a-8d24-4bda-a6f4-97f1cf8b41fa","resolution":{"observed_at":"2026-07-08T22:35:40.449701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:48:58.545989+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:48:58.545989+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":"2310.09478","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-07-08T22:35:40.586981Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","venue":"cs.CV","work_id":"fb62cd1b-3991-40be-a987-3cfa5772b5b5","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:089d843d05392cd924e8d30a3b828a4e7e86613a98041d25232fbe07f20eea83","observation_id":"b97a474a-15c1-478c-a0d9-7f4144f25c6a","resolution":{"observed_at":"2026-07-08T22:35:40.588253Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06764","last_updated":"2024-09-02T05:48:54Z","snapshot_observed_at":"2026-08-16T14:10:58.157918Z","submitted_at":"2024-03-11T14:35:32Z","title":"An Image is Worth 1/2 Tokens After Layer 2: Plug-and-Play Inference Acceleration for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":"2403.06764","doi":"10.48550/arxiv.2403.06764","metadata_source":"pith","pith_arxiv_id":"2403.06764","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":"cs.CV","work_id":"b09c06ba-a6cd-48cf-83f7-30a010a04ef4","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2403.06764","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:07d5a96903bcb7aaae77a092327e8de1507f0e6d2d8ba0d84eac0102dbedb90b","observation_id":"a8b5b3c8-cc53-4915-913d-0bbd6b662b3b","resolution":{"observed_at":"2026-07-08T22:35:40.573081Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.103478","doi":"10.1016/j.aei.2025.103478","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Tailored vision-language framework for automated hazard identification and report generation in construc- tion sites","venue":"Advanced Engineering Informatics","work_id":"ef0640c0-3009-483f-8482-f928f8e0ba31","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:b30f43c48c1293ffe5473b328b8f995b0d0280b15dba841670abad117ea92cfb","observation_id":"50a78136-ca05-4dfb-b2c1-b1ec9f796d1c","resolution":{"observed_at":"2026-07-08T22:35:40.452922Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:48:58.842347+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:48:58.842347+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.309084Z","title":"Canmultimodallargelanguagemodelstrulyperform multimodalin-contextlearning?,in:2025IEEE/CVFWinterConferenceonApplicationsofComputerVision(WACV),IEEE.pp.6000–6010","venue":null,"work_id":"23c374c5-e949-4b56-8af2-a4ac13d0ecfd","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:f9ee582d81353b43ecee902f6fc45e3dcd5d4769adeb4bdc4b85fb2cab270385","observation_id":"79dd781b-948c-4f84-b7e2-c20924fd489e","resolution":{"observed_at":"2026-07-08T22:35:41.311086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.10044","doi":"10.1017/dce.2026.10044","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Are large pre-trained vision language models effective construction safety inspectors","venue":"Data-Centric Engineering","work_id":"900407dc-a66a-4f69-baaf-5cd05cc61ea1","year":2026},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:9e9ce0e04c0a88f49cfb46d99abdd735c4b750af01ce2a43d8e18a3bd4719722","observation_id":"1db83eaa-394d-4813-a22f-8ed71a09fd3d","resolution":{"observed_at":"2026-07-08T22:35:40.439667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:48:59.094062+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:48:59.094062+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.307249Z","title":"Expandingperformanceboundariesof open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":"78401886-9446-42ab-b3e7-1fb500822eed","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:2eac76166973e54cd8f1e0e4060cd41a09d88bcf7740cae277f329aa5e2a4122","observation_id":"e8539243-9771-4b00-9826-177b464188bd","resolution":{"observed_at":"2026-07-08T22:35:41.308515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07919","last_updated":"2023-06-17T06:40:27Z","snapshot_observed_at":"2026-08-18T10:10:16.111731Z","submitted_at":"2023-04-16T23:59:25Z","title":"Chain of Thought Prompt Tuning in Vision Language Models","version":2},"cited_work":{"arxiv_id":"2304.07919","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.07919","snapshot_observed_at":"2026-07-08T22:35:40.552642Z","title":"Chain of thought prompt tuning in vision language models","venue":"cs.CV","work_id":"7dca3fd0-213e-40c8-b279-2028d83d4498","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2304.07919","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:f83ad7ef60fabba8d89614ef3c5067586c034c2cda7819964717642800f42f73","observation_id":"41ae7e5f-ee17-45c6-a353-c484f16f95ec","resolution":{"observed_at":"2026-07-08T22:35:40.569827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.311885Z","title":"Intelligent virtual assistants with llm-based process automation","venue":null,"work_id":"25a342ea-f2ab-4c23-92fd-e5367f500196","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:86a33e0a3e384536ecbc6e8ac3b92215f9736e7b15acfb6fbd9ff8c1a342db72","observation_id":"1d220ae5-72a7-43e9-8af5-4a2abd499063","resolution":{"observed_at":"2026-07-08T22:35:41.313135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-17T18:04:53.578114Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2106.09685","doi":"10.4088/pcc.v03n0609","metadata_source":"pith","pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","venue":"cs.CL","work_id":"0426219a-789e-4964-adc8-a04538510818","year":2021},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:03a5f8aad5c3ef804b161d241edc02eec18ea8afddceff76e18b93deb2368e6c","observation_id":"64dbea47-ccd8-4b3e-a774-abadb1139a23","resolution":{"observed_at":"2026-07-08T22:35:40.595517Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.305475Z","title":null,"venue":null,"work_id":"f95a3b3b-c444-4d65-8b9b-14c0a878dd97","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:0c996897ae12f9e19107512c7edd7f991778079abe912185e8a40dc683aec99f","observation_id":"34e022b9-5582-4941-837f-beb8b64786bd","resolution":{"observed_at":"2026-07-08T22:35:41.306558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.301661Z","title":"Vru-accident: A vision-language benchmark for video question answering and dense captioning for accident scene understanding","venue":null,"work_id":"91dc115c-2b2f-4e1c-a42b-8223963dcc9a","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:59032f00bb1fd9f8252392f668a56e0a46baac6683974e76c0842f86cde245ea","observation_id":"8cd8e49b-6f76-4ef8-9070-523d55ac4409","resolution":{"observed_at":"2026-07-08T22:35:41.302910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.00192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:40.599391Z","title":"Safe-llava:Aprivacy-preservingvision-languagedatasetandbenchmarkforbiometricsafety","venue":null,"work_id":"19e3823b-82ed-4fb6-b249-71b028e0f90d","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:2d3ae369382fe8d1e4afa84ec5bd2c39b7e0e0fd1ccaeea856ac37f268eac07a","observation_id":"39d9e36e-2391-4d2c-8153-146d5dd508ea","resolution":{"observed_at":"2026-07-08T22:35:40.601075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.303459Z","title":"Res-bench: Benchmarking the robustness of multimodal large language models to dynamic resolution input, in: Proceedings of the AAAI Conference on Artificial Intelligence, pp","venue":null,"work_id":"e4fc5921-9006-41ec-bb04-0ec70dfa75cd","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:2c6533d8ec1aea6bdb3e1bbe56367daf1fe99391fb74efceb92a2c457be36edc","observation_id":"33641ca8-8c68-45d1-b53b-fddf2cd063c1","resolution":{"observed_at":"2026-07-08T22:35:41.304705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.106790","doi":"10.1016/j.autcon.2026.106790","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Construction site fall hazard identification and automated captioning using adapted vision-language models","venue":"Automation in Construction","work_id":"0f8701d3-9021-4674-808a-44c6e69db66e","year":2026},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:177c404c9a96ed64f53fee4faf514ee4561e4ed81b002a4b68af54c8a9ddbc87","observation_id":"ea9338c7-0f61-4527-99cb-c07ee5d7f74b","resolution":{"observed_at":"2026-07-08T22:35:40.467360Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:48:59.417053+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:48:59.417053+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.03794","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T11:37:03.230716Z","title":"AdaptVision: Efficient vision-language models via adaptive visual acquisition.arXiv preprint arXiv:2512.03794, 2025","venue":null,"work_id":"2b0bbd04-260e-48e5-83f3-b870b8a8a7c1","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:321f5e663714bb72c1e580767ed275096c86f5268e0bd7883f30d1e7ba6957bb","observation_id":"f3830f6e-72a3-44e8-b6b8-88a0da821de7","resolution":{"observed_at":"2026-07-08T22:35:40.551322Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.313683Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge","venue":null,"work_id":"156087bb-368a-42c1-b721-735a1b258f09","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:e024332ee05843129f730d8e0dbda09e88b938e54549ed12dc29b6eceb834cb7","observation_id":"3761a0a6-e163-4383-8877-fd02b169a6b3","resolution":{"observed_at":"2026-07-08T22:35:41.314843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.299863Z","title":"Visual instruction tuning, in: Oh, A., Naumann, T., Globerson, A., Saenko, K., Hardt, M., Levine, S","venue":null,"work_id":"2798ff11-9387-46db-9a4d-c8093a88bf68","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:933576781468fb878e824511f11248e3cdab8afdf365dd1a06251e3ab6b1c077","observation_id":"40e2f463-7018-460c-b20b-fa0004ecc42c","resolution":{"observed_at":"2026-07-08T22:35:41.301085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":"2303.05499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-07-10T23:17:45.410080Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","venue":"cs.CV","work_id":"3757dc8f-79d5-4beb-a03b-eb4c9a33427d","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:a2797341b0cb113b515a8747d3cb04b959f73d367bf8679ad9a787b67921e22a","observation_id":"0782e0f5-ef7b-4b50-bb0d-c21cd184fb6a","resolution":{"observed_at":"2026-07-08T22:35:40.580445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:28c86404c6b7f8b3f47511a1f674f2e627316c999aa7be9c739a2fc832c8aac4","observation_id":"675779f7-775f-42f0-8e63-74351b6ab11e","resolution":{"observed_at":"2026-07-08T22:35:40.575764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:25892381ffb70f65bb6720aadb81f78bf3a0d84fa40ec6c38536b860409ce9ab","observation_id":"7b142371-113d-4e6a-bd64-fcc9f6097183","resolution":{"observed_at":"2026-07-08T22:35:40.578047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17423","last_updated":"2026-06-24T07:49:12Z","snapshot_observed_at":"2026-08-16T13:48:56.031830Z","submitted_at":"2024-05-27T17:59:25Z","title":"Privacy-Aware Visual Language Models","version":4},"cited_work":{"arxiv_id":"2405.17423","doi":"10.48550/arxiv.2405.17423","metadata_source":"pith","pith_arxiv_id":"2405.17423","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Little data, big impact: Privacy-aware visual language models via minimal tuning","venue":"cs.CV","work_id":"a6d79074-dca1-4033-89fe-ea7cf54209aa","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2405.17423","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:f95b137436bda44913ef0081fc1baa9f6999fe976de27ec1076198eb40e166c3","observation_id":"b911e575-3131-4eb4-a6d0-3ddc7845e535","resolution":{"observed_at":"2026-07-08T22:35:40.590687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-05-21T23:52:51.144677+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T23:52:51.144677+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2603.06148","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:40.602232Z","title":"Vlm-robustbench: A comprehensive benchmark for robustness of vision-language models","venue":null,"work_id":"c85ec9fc-82a1-4579-bf53-ff5c57e36ce2","year":2026},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:425a587a349e0e4754ab5e0457cc3d1a2a4353abbc81a63aa3758fdb51519863","observation_id":"81a41807-1877-427e-a3fc-02ad0209459e","resolution":{"observed_at":"2026-07-08T22:35:40.603788Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.290990Z","title":"Vision-language models for edge networks: A comprehensive survey","venue":null,"work_id":"df204193-a183-456f-8bfe-ce2e04c071f9","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:176e3da7e60df6a2447b18166887ee22d35fc4d21ec32235ff9d76f31b340285","observation_id":"fa13d331-0a3d-4d9b-a0a6-27624befe93f","resolution":{"observed_at":"2026-07-08T22:35:41.292231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.295798Z","title":"Upop: Unified and progressive pruning for compressing vision-language transformers, in: International Conference on Machine Learning, PMLR","venue":null,"work_id":"4237b467-f099-45fb-91aa-f43adaa36150","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:4bd6356307f9626c7aaa494380b9b427aa3a34f17d75b0d42ad5e3eda901748b","observation_id":"4ef34baf-f4b8-43b6-b59e-71e9e1cfc553","resolution":{"observed_at":"2026-07-08T22:35:41.297412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.103889","doi":"10.1016/j.aei.2025.103889","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Real-time safety detection on construction sites using a vision-language and nlp- based model","venue":"Advanced Engineering Informatics","work_id":"d6663dc9-1090-4ae1-a3f5-22f893a1e938","year":2026},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:96b8b700e758ac3da123ad67873dfe97c329e29870600193d92246a1ea77989a","observation_id":"01db1329-854a-4e32-a16d-f8f63d9592ac","resolution":{"observed_at":"2026-07-08T22:35:40.446394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:48:59.741856+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:48:59.741856+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.289136Z","title":"A double thinking enabled visual language model for open-set construction site safety inspections","venue":null,"work_id":"39980bff-fbeb-4433-b477-f4e1e9a64f12","year":null},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:491762d7621404aa89fdc8647a4d5db3e72ef83a41f1b696dd9da7f4cf2e9169","observation_id":"ef1d064f-93a1-4846-9930-8abc511a1541","resolution":{"observed_at":"2026-07-08T22:35:41.290434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2026.365727","doi":"10.1109/tits.2026.3657271","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Region-level vision-language model for detecting distraction behavior and mobility attributes of vulnerable road users","venue":"IEEE Transactions on Intelligent Transportation Systems","work_id":"92156d3b-d430-4704-b224-8502041a815c","year":2026},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:ef635066d9ac7dceef4c41dd0d675d9cc8450c08350769c8c974d652115ee373","observation_id":"5a347992-f026-482e-9bb5-576ef879123e","resolution":{"observed_at":"2026-07-08T22:35:40.461810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:48:59.965265+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:48:59.965265+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.106127","doi":"10.1016/j.autcon.2025.106127","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual question answering-based referring expression segmentation for construction safety analysis","venue":"Automation in Construction","work_id":"0b99e3e0-0438-4ecc-bbf7-c999788a122c","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:9945cd3fca3ef2fb303891b012488130e4c99368a8c361cb4112c6fd224c5101","observation_id":"a9ca898f-8578-4960-ac15-8a82a00adb27","resolution":{"observed_at":"2026-07-08T22:35:40.458666Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-07-11T07:49:00.271915+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T07:49:00.271915+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.292797Z","title":"Selma: A speech-enabled language model for virtual assistant interactions","venue":null,"work_id":"a2353b14-0952-4b5a-a361-dc26fb8e7d7f","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:7b5c6d17ab9cdc4aeeaf6dcbb7ddc7797eb15d0b19e7f28ac03079cb7647c6d7","observation_id":"03238cdb-052e-49f1-8880-de628907165f","resolution":{"observed_at":"2026-07-08T22:35:41.295114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.287334Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":"632400a9-4d05-4caf-a2ee-c51b405ee9dd","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:a1c6647b24417d831e9e69cd107a3b601a1e2f483ae712d4bae390b84b342891","observation_id":"34c9128a-0134-4b53-9856-11c20b6f6627","resolution":{"observed_at":"2026-07-08T22:35:41.288555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":"2508.18265","doi":"10.48550/arxiv.2508.18265","metadata_source":"pith","pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","venue":"cs.CV","work_id":"b8f5e260-fff5-444e-bcf5-2c42cfefd83d","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:b85e6fb39f3b8d1c52ef3a2b1141b22e4b005e02b881cd9c4062e0e6a7118731","observation_id":"b89f6176-1db0-4b14-99ce-d82dc42d1d68","resolution":{"observed_at":"2026-07-08T22:35:40.582870Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-10T17:38:12.771444+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.14072","last_updated":"2024-10-17T22:45:13Z","snapshot_observed_at":"2026-08-16T13:08:13.358927Z","submitted_at":"2024-10-17T22:45:13Z","title":"Efficient Vision-Language Models by Summarizing Visual Tokens into Compact Registers","version":1},"cited_work":{"arxiv_id":"2410.14072","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.14072","snapshot_observed_at":"2026-07-08T22:35:40.607778Z","title":"arXiv preprint arXiv:2410.14072 , year=","venue":"cs.CV","work_id":"a421db48-d34b-4af9-9ac4-671fdb8cae3e","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2410.14072","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:5fa3b1e4e7585200495bb53c3a81c30b78cde398ed7e3c0c791e7eb7c183bf2c","observation_id":"845780f1-5d67-4024-8896-568df97ed835","resolution":{"observed_at":"2026-07-08T22:35:40.609039Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"cited_work":{"arxiv_id":"2410.17247","doi":"10.48550/arxiv.2410.17247","metadata_source":"pith","pith_arxiv_id":"2410.17247","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","venue":"cs.CV","work_id":"ca5cea36-45c6-4d00-8408-14876a5d59c3","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2410.17247","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:3cfa6b0cdfc8cd2708ad1e255c77ea85c1de45de7306a2f7a6c8b90ad267161f","observation_id":"55cfce7d-25f9-42f7-ad8f-44484ae995b2","resolution":{"observed_at":"2026-07-08T22:35:40.606423Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.280055Z","title":"Llava-cot: Let vision language models reason step-by-step, in: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"252fb77f-5711-461a-8a7e-47ee4ce8f00a","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:d19fefd8da4cb128e2fefc03e5c88e1e35ec0d8f8a9a9dc9104b4431602c3173","observation_id":"309f9b4b-22ac-4542-9287-bb29ee9c9b1e","resolution":{"observed_at":"2026-07-08T22:35:41.281322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.281852Z","title":"Edgevideoanalytics:Asurveyonapplications,systemsandenablingtechniques","venue":null,"work_id":"87eabc4c-60ca-4b17-929d-bae799fc28e1","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:1dcc4db6e3332dda446d5f31ee6c1525e3633f55aecd1463ea11a9c5fb65d7a1","observation_id":"ba0ffa3c-a517-4530-aa69-323d59955cd3","resolution":{"observed_at":"2026-07-08T22:35:41.282854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-08-17T18:50:07.059564Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.15115","doi":"10.1145/3581783.3612503","metadata_source":"pith","pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5 Technical Report","venue":"cs.CL","work_id":"d8432992-4980-4a81-85c7-9fa2c2b87f85","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:ab325147faa251bcc450867490739e624621690c35e423b8594662356d76103e","observation_id":"b0423c76-7678-438b-bf77-54c87ea12c95","resolution":{"observed_at":"2026-07-08T22:35:40.585730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.aej.2024.05.015","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Vision transformer-based visual language understanding of the con- struction process","venue":"Alexandria Engineering Journal","work_id":"354dff37-4ff4-426d-86fd-0856e5b1b0ec","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:ef24dcbd83e6204b3642e7d585b04177374a268573a3a82beb59b4a600b56665","observation_id":"1c8752b1-5b71-4006-b0fb-0b9598995377","resolution":{"observed_at":"2026-07-08T22:35:40.464393Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[{"edge_observation":{"observed_at":"2026-07-11T03:19:15.783975+00:00","source":"paper_reference_links","state":"open"},"event_date":"2024-05-21","event_type":"correction","notice_doi":"10.1016/j.aej.2024.05.064","provenance":{"observed_at":"2026-07-11T03:14:22.632143+00:00","source":"crossref","source_record_id":"10.1016/j.aej.2024.05.064->10.1016/j.aej.2024.05.015:correction"}}],"reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.283470Z","title":"Visionzip: Longer is better but not necessary in vision language models, in: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pp","venue":null,"work_id":"578538d8-b7ea-454e-b3da-8a5e7bc723a1","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:09468599fff59a88513192441a60d431aa684aca49fdb158fb41657e861de83f","observation_id":"d220c57d-6314-422a-94b9-67342edbee60","resolution":{"observed_at":"2026-07-08T22:35:41.284722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.278336Z","title":"Visionthink: Smart and efficient vision language model via reinforcement learning","venue":null,"work_id":"7f746f55-c6e1-4350-99b6-8750eb369308","year":2026},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:2b125b5028ccd3f98286c006916503544b0d19637d34955863602d1c40f23cdd","observation_id":"3f04773a-9683-4cc4-9277-5bd91c9cf822","resolution":{"observed_at":"2026-07-08T22:35:41.279512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":"1904.09675","doi":"10.48550/arxiv.1904.09675","metadata_source":"pith","pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERTScore: Evaluating Text Generation with BERT","venue":"cs.CL","work_id":"9eaaaac1-0a96-4f5f-9b13-30c46e9e1346","year":2019},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:7ae47562c7424cef8fba08596e37990ff4468251b6ecc2cbf42ad1ec5ed25400","observation_id":"aec977bd-d0e7-416b-90e9-f9dca407730b","resolution":{"observed_at":"2026-07-08T22:35:40.611532Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:14.227491+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:14.227491+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-08-15T01:31:24.363496Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":"2410.04417","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-09T21:36:34.338168Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","venue":"cs.CV","work_id":"691499bc-3ae3-49f0-aba6-ab6c7972a7a7","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:31fc02a9dabd3796e9c579926d9bade1a0a71e0316204bf9e865c3c37a631f9b","observation_id":"f908bd59-8cb1-41b8-b779-8b2e0a937fef","resolution":{"observed_at":"2026-07-08T22:35:40.598163Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":"2302.00923","doi":"10.48550/arxiv.2302.00923","metadata_source":"pith","pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","venue":"cs.CL","work_id":"cf983328-0c5e-4840-8f51-2b24cf4b21ee","year":2023},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:3ae87dec489dd1fd989d45a5646910b5bb170ebcb8d571edf085ef5d1624373b","observation_id":"01c5da41-714e-464d-9706-0f192a0a4c77","resolution":{"observed_at":"2026-07-08T22:35:40.593114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.274838Z","title":"Mmicl: Empowering vision-language model with multi-modal in-context learning, in: International Conference on Learning Representations, pp","venue":null,"work_id":"3778b9a7-5fd0-42ad-975f-d669cb5d8af6","year":2024},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:e6205067f0c58f519eaef31b94be4982cad316e7ec9e34f5e29963c20fc8c1e2","observation_id":"370f17ac-fcac-4490-a6de-21e2d736c31f","resolution":{"observed_at":"2026-07-08T22:35:41.276107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T22:35:41.267804Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":"450c586b-4c03-400e-b1ef-3a94e80d69ab","year":2025},"citing_paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-08T22:27:52.861022Z"},"links":{"citing_paper":"/paper/2607.05859"},"observation_digest":"sha256:88a68d8e8fdaff95e640f419e85fc939fc06cbfa5455e88ce8cb197b1a9c6c15","observation_id":"31197953-97f3-4862-a023-8cb7add18a2a","resolution":{"observed_at":"2026-07-08T22:35:41.269087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.05859","last_updated":"2026-07-07T05:30:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T09:25:02.104079Z","submitted_at":"2026-07-07T05:30:13Z","title":"AVA-VLM: Adaptive Visual Attention-Vision Language Model for In-the-Wild Construction Site Monitoring"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":4,"verified_exact":23,"verified_fuzzy":22},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.05859."}