{"as_of":"2026-08-21T10:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7efcb7edd70db46d4b5b32476b07932593dbb7eab5179502a8bdea1a64179b08","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T07:27:54.456241Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:12:58.548393Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-11T21:12:58.593946Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"cited_work":{"arxiv_id":"2607.05264","doi":null,"metadata_source":"pith","pith_arxiv_id":"2607.05264","snapshot_observed_at":"2026-08-11T21:12:58.593946Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","venue":"cs.CV","work_id":"ca942f5c-cd85-4470-aca2-5c71e5d8ed8f","year":2026},"citing_paper":{"arxiv_id":"2608.09230","last_updated":"2026-08-10T07:53:54Z","snapshot_observed_at":"2026-08-21T02:29:06.135185Z","submitted_at":"2026-08-10T07:53:54Z","title":"SafeSceneReason: A Multimodal Reasoning Benchmark Connecting Industrial Hazards with Accident Knowledge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T21:12:58.548393Z"},"links":{"cited_paper":"/paper/2607.05264","citing_paper":"/paper/2608.09230"},"observation_digest":"sha256:e3a35735c2c7c0b03c65b80c74526fdabf056fd8c60d95e2a434576a773dd6b6","observation_id":"643e46c7-13e4-4d2a-bea2-a1d0c20f02f0","resolution":{"observed_at":"2026-08-11T21:12:58.602649Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2607.05264/citation-record","integrity":"/paper/2607.05264/integrity","json":"/paper/2607.05264/citation-record.json","paper":"/paper/2607.05264"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Quo vadis, action recognition? a new model and the kinetics dataset","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:416e669017e7e63fdcd9df92180673887105f0f51e1a27c3f415340abee35b2e","observation_id":"affe6582-bed9-4e9a-96c5-8911af3c31ce","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"ActivityNet: A large-scale video benchmark for human activity understanding","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:14d0c4518f11fa73100712b5b31a2941a0d31587c5813d1e471e41b8779bc7e5","observation_id":"26aa29ea-bcec-4d31-a062-a31e05773830","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"A V A: A video dataset of spatio-temporally localized atomic visual actions","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:2fdcb8d126d17aceb34d63d1bf505e860090cd6cd9936a084e3e5185b5ac6e4c","observation_id":"e01849a8-2c79-49fb-9170-be84307f5c85","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Ego4d: Around the world in 3,000 hours of egocentric video","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:49cf015c94357ec7195d9c630d48275966bb34e28431fd35ec102cbd79413d1f","observation_id":"4d49fa25-0aad-4918-ac1b-49fd6eabdbee","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Assembly101: A large-scale multi-view video dataset for understanding procedural activities","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:6ba418cbb54ab9ac297101b3275760782925e563b8d77a120a38b1b74039140e","observation_id":"e97b1a78-ace9-403e-93b4-a9795f7cca53","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"IndustryEQA: Pushing the frontiers of embodied question answering in industrial scenarios","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:008e31e5bb187417a63fe810f16557874f40ef6213e3fdc49710c7e47f597add","observation_id":"48b6ba9c-06af-4cfe-a363-294bc5f2691d","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"SH17: A dataset for human safety and personal protective equipment detection in manufacturing industry.Journal of Safety Science and Resilience, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:b54a5da91dac370826631de70d229ac52f2944e390d2111e0063f710e26c02b8","observation_id":"51cd453b-c88f-4cd2-9752-e68a0d0b8a1e","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:be6798cab04b8d9762866eff88e7d43bd71e95d525661e46695898bee64c55e9","observation_id":"d21ccefa-026a-418b-aa7f-f0f812704329","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Vision language model for interpretable and fine-grained detection of safety compliance in diverse workplaces.Expert Systems with Applications, 265:125769, 11 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:efb0e1d540faec375ac3fd4bd9266cfde470a927a16e73dabfd9fc19fdb8527c","observation_id":"33fc2c4e-5f6e-46ef-924e-87abd09e5777","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Human-LLM collabora- tive annotation through effective verification of LLM labels","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:17cacd7ecec81dcabc9df21389af25481ef331e69f986f7954899cb33737000e","observation_id":"3720651b-fcbe-49c7-a3e3-ff27d9e80403","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22473","last_updated":"2025-01-03T16:12:16Z","snapshot_observed_at":"2026-08-16T17:23:25.344056Z","submitted_at":"2024-10-29T19:07:50Z","title":"The State of Data Curation at NeurIPS: An Assessment of Dataset Development Practices in the Datasets and Benchmarks Track","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22473","snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"The state of data curation at NeurIPS: An assessment of dataset development practices in the datasets and benchmarks track","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"cited_paper":"/paper/2410.22473","citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:0b47467a5e990802e838b82acb67109e8fd53792af610f0777a9757e26b4d9ae","observation_id":"aef6b8b3-248d-417f-be0e-8775c7ca6827","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06950","last_updated":"2017-05-19T12:07:01Z","snapshot_observed_at":"2026-08-20T22:03:51.775198Z","submitted_at":"2017-05-19T12:07:01Z","title":"The Kinetics Human Action Video Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.06950","snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"The ki- netics human action video dataset.ArXiv, abs/1705.06950, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"cited_paper":"/paper/1705.06950","citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:810ac254603e8822df7894cb2ee7528a7d0a8fc7bc878a5fb12d41278723ae9f","observation_id":"777f2235-0cca-4525-a1b9-1068de59d745","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-08-16T21:21:44.768787Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Ucf101: A dataset of 101 human actions classes from videos in the wild.ArXiv, abs/1212.0402, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:d004423a89fafd959bfb2e343b282b76930a1ce163cc7c8da533fac92af3d292","observation_id":"c5ed64c2-a275-45ac-b810-662938f02eda","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Preference leakage: A contamination problem in LLM-as-a-judge","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:2c472e5196306a2febbc19be2373fddf3591c902160b3655f6cffe6f4131c6d3","observation_id":"7ab53443-34e6-46f3-a75d-8d74635e3ec7","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Just put a human in the loop? investigating LLM-assisted annotation for subjective tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:1d6d00ba513fb737fc8f6e08465b6bd9a7454b08bb1084bb57b9c12f4d921cdf","observation_id":"4e18583c-4e8e-4d18-b139-7335806bf2dc","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Datasheets for datasets.Communications of the ACM, 64(12): 86–92, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:fab308c5613420e2cdb66cfc859f24254c8224efb9b1796d3087e0f477aa4309","observation_id":"b600ac63-3076-423b-9482-55469e7771cf","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"The MECCANO dataset: Understanding human-object interactions from egocentric videos in an industrial-like domain","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:aa0c25e31d795d3a813baa535f2d21b99ddf2fb132f664cc025296f576a3ac83","observation_id":"9162af95-4ca5-4a25-9dcb-31d0cafdc4fc","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Toyota smarthome: Real-world activities of daily living","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:16b091a641383cd3c3e23dfc1db650e98167ffc117431d59c2f9535a0349556d","observation_id":"2ccc4406-9093-4930-9e0c-b33bc17eca06","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Real-world anomaly detection in surveillance videos","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:df1a5de53c06a9e882b08a119752fb02e5678cb5e396db73f32119bfa518a5af","observation_id":"45470b38-38b9-40bd-9add-a26c2b52037d","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Future frame prediction for anomaly detection — a new baseline","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:5a3b9cb3f3f331a3f44f577e2b919a3974d30b3522f79fe3e59f04798fd6eeb8","observation_id":"47b293fc-de40-41ab-bea8-8f7afbba935d","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"iSafetyBench: A video-language benchmark for safety in industrial environments","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:212e4a9f46b4a6bfa5e0fb579d723b71dcda12783649c87b36c033bb2e3cf3b4","observation_id":"011dddc8-c7ff-403a-a95f-b41b8d4069f7","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Inspecsafe-v1: A multimodal benchmark for safety assessment in industrial inspection scenarios, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:e36595edd2c37f27ab56fe4337863155a3e8334bc1d117cfebf0823cd42e528f","observation_id":"77478e94-13fe-451f-bacb-4e7fab6fb6bf","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"MMMU: A massive multi-discipline multimodal understanding and reasoning benchmark for expert AGI","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:d38c81868713eaa139764a9580b40d9c32f667609c31adef14dbc04950ce785c","observation_id":"085bbdf1-7e8a-432d-86ba-30090f314c92","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Video-MME: The first-ever comprehensive evaluation benchmark of multi-modal LLMs in video analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:da179d3d99c7ed181f50ec7eb47bc1c9ff7b349c0788d6fcc03ad5a99661625c","observation_id":"0e27fc0e-c29f-4400-8f91-55aec9ee79a7","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"MVBench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:270a62e1e937fc87260c40cca07c92e511bba1eb3b1a4eabece00ccd07c01f93","observation_id":"5bbb2675-171c-4e31-84a7-5725b842a9b1","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Benchmarking neural network robustness to common corruptions and perturbations","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:64728fa546e0bbcfb3463d8c5ce0ae4b13695766ba85dc3005ac2a684578824b","observation_id":"00857507-d218-4272-b2b5-e86828b87701","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"NaturalBench: Evaluating vision-language models on natural adversarial samples","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:8b61661187cf4251fca39d0fa33dd46b71e61ef193b97116b96217783b655ca0","observation_id":"fd84bd44-419c-451e-b426-4a3820049cd3","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Fields/clip","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:f5ba090b7f8cf496bc370319e037467ac466c9ed04460ab67303f7527e523f16","observation_id":"c6a79ca0-3180-44e4-be5c-9d24d0d2039b","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:3bb9a966d1ea9ee5d72acac6de80bcabf285459db74da820e4f60be3badf9202","observation_id":"b99f544e-501b-4c11-9296-017609a54e8a","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:4b280e7b35764c2d73f0ce9ed4f39475d2b871e7d3d7c431fd3d7902fd06bddd","observation_id":"4a809ac2-392a-4ce8-8d12-291f22ffe80a","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:5be98740e19e76f1e51e1d329282eda76c664cc20d78ff9155277ea6c989056e","observation_id":"d4e9e799-5ef2-4f86-a0be-ee021aed640a","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:5810b0d309b0171b877fae0152d8daf87c0c7582b55920ed7fe20a44480c9f68","observation_id":"5b677058-eb61-47da-bd83-75cdb0e5f105","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:4c2c4052ca4c858db74d4e2d5a4295670ce983e00b74213255925db0acb1f15d","observation_id":"7a51d79d-a3b3-44e3-800b-075b02ef19c3","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:fd93ee7ac828a5e9f8625226c248343cebe2313024687dc96c878a7a36209238","observation_id":"ba2bd0e5-48ca-487a-a7ee-ad8cdaecdd87","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:1a052292a2dca72142365b54f1bffe5b0741ec3ec2647dbe9e84ce6a15d679ce","observation_id":"3aa229b9-1c65-49e3-854b-ba7a314c38dd","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:a7c528f3398626da544275a66604f40d497308d84b43cc5a09c72ac531b34777","observation_id":"c1649052-d06f-42dc-95d3-4f37409459f9","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:271083daee7626188456a983600322201a0a24ab6ae141aa2b8002f2e23d84d5","observation_id":"943f7433-9871-4327-9672-6a8c8407fb1e","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"worn” only if clearly visible; use “cannot_determine","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:740edfb7f786f9bcbc6bd72995b52fa150d35b200b63c4f49b81f7c908f0facd","observation_id":"dc568af3-21d1-4af2-b398-28216992e238","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T07:27:54.456241Z","title":"Experts and the Safety Officer are nominated by the plant to support the research","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T07:27:54.456241Z"},"links":{"citing_paper":"/paper/2607.05264"},"observation_digest":"sha256:9ee96cf8655cdb0e849449b44a6b3082b7fff7c76b8bfd83ba1e654b77bb5aa7","observation_id":"1a50b927-af9c-46a5-8e92-187da86c75e3","resolution":{"observed_at":"2026-07-11T07:27:54.456241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05264","last_updated":"2026-07-06T16:11:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T16:40:33.977252Z","submitted_at":"2026-07-06T16:11:45Z","title":"SteelBench: Evaluating Vision-Language Models in Real-World Industrial Environments"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2607.05264."}