{"as_of":"2026-08-17T13:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6d1208cc747e2a10556ebf9e047a6197c1ecc7d8b3c809c0dc37745a00330220","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T00:10:47.838698Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.12515/citation-record","integrity":"/paper/2608.12515/integrity","json":"/paper/2608.12515/citation-record.json","paper":"/paper/2608.12515"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-08-17T03:00:38.806206Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-16T00:10:47.751344Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.751344Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:c08b872cc65373cec1800cbd72098f851c9ec52bf92ac8bc59f0fa0ab984b5c7","observation_id":"8f84693a-3983-4bb9-9493-1176a072a200","resolution":{"observed_at":"2026-08-16T00:10:47.751344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-16T00:10:47.756376Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.756376Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:78e6c14bb94503ffb7ea80c8302ca811ae57d131cb8960649bf54c1dc63f72b7","observation_id":"91bb55f4-c132-40f3-9631-9805c1725261","resolution":{"observed_at":"2026-08-16T00:10:47.756376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-16T00:10:47.761130Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.761130Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:3f59be310190b29beacc1e35a66430b598bb96cb9207963664dc29f13ba3b0c7","observation_id":"fd01c464-49ad-4740-b74e-c6d19ef6e493","resolution":{"observed_at":"2026-08-16T00:10:47.761130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/mi120201932","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:47.892086Z","title":"Micromachines12(2), 193 (2021).https://doi.org/10.3390/mi120201932","venue":null,"work_id":"d88e1e0a-67d3-45fb-92b3-64c5ad6af047","year":2021},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.765749Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:d54da40ddcb78feb863076e0443ad26d254a5a71bf2af238f18d36ba7c47e71c","observation_id":"56792bab-2105-450a-9192-bd4bc74d45e2","resolution":{"observed_at":"2026-08-16T00:10:47.896706Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-16T00:10:47.770583Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.770583Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:31b62a0419310b42b027f2a9a6fd88f22ac85f7f43e8bcc2ad96ee46ebb5f951","observation_id":"7f747b71-e98f-4b92-ad52-c258711fc215","resolution":{"observed_at":"2026-08-16T00:10:47.770583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:48.419024Z","title":null,"venue":null,"work_id":"559663ee-42f0-4b97-a2bd-0fbee33aa88e","year":2020},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.775140Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:de8e4dd986f664acf78269baab1fd99e563070298109aaee08fc94a18644c8e4","observation_id":"6734bad1-9772-485d-9013-3dc3e20aa0bb","resolution":{"observed_at":"2026-08-16T00:10:48.423761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07919","last_updated":"2023-06-17T06:40:27Z","snapshot_observed_at":"2026-08-16T15:40:04.221534Z","submitted_at":"2023-04-16T23:59:25Z","title":"Chain of Thought Prompt Tuning in Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07919","snapshot_observed_at":"2026-08-16T00:10:47.779785Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.779785Z"},"links":{"cited_paper":"/paper/2304.07919","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:20169c6e395a11dc82a2f6b563a0d717bc64e751decfbb0fecbc0d1d597cec23","observation_id":"fe7216b3-dd71-4290-9565-75ffa964314f","resolution":{"observed_at":"2026-08-16T00:10:47.779785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:48.404477Z","title":"Doubleday (1966) 2, 4","venue":null,"work_id":"59f82b70-d0d5-4b65-94d9-2b11db392501","year":1966},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.784109Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:6922fbd0add2206376ed69c2a66b0291fe383af4c933fb22babc019456e3bd12","observation_id":"e893d4e0-8735-4a38-8f4d-80af8b076572","resolution":{"observed_at":"2026-08-16T00:10:48.409495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:48.390515Z","title":"co / HuggingFaceTB / SmolVLM-Instruct4","venue":null,"work_id":"27ee12e1-d7f1-4fa6-a5c9-c551981a0dce","year":2024},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.788329Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:f530365e7050c0b39d5809d2cf7d5fa054761c07d8a70bec8a37ec5b79f5dbdb","observation_id":"06da91a4-b78d-46f4-b201-3cb33b33a71f","resolution":{"observed_at":"2026-08-16T00:10:48.394935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:47.792298Z","title":"Rudas and D","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.792298Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:95f6c11e9191a1be621524ea585c6cc7c41de27b88a6e473f0f066018c0a729e","observation_id":"7cbcc615-b1cb-4391-8001-e1b58afe864f","resolution":{"observed_at":"2026-08-16T00:10:47.792298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-13T05:54:24.242465Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-16T00:10:47.796759Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.796759Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:6d639a114e4e2392a537ec78e7293f5610ce0a37103812a7105cd602bf35b708","observation_id":"1c836cc8-6a03-450a-a1d8-b74e4773046f","resolution":{"observed_at":"2026-08-16T00:10:47.796759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.03616","last_updated":"2026-04-04T07:16:28Z","snapshot_observed_at":"2026-08-14T19:57:37.924240Z","submitted_at":"2026-04-04T07:16:28Z","title":"The Format Tax","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.03616","snapshot_observed_at":"2026-08-16T00:10:47.801092Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.801092Z"},"links":{"cited_paper":"/paper/2604.03616","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:9c2ac0817949338da9cb7b96a721a3f9ba3c8b5ac22f1ea68814b6749caa8e57","observation_id":"69ef42a8-4a63-4abd-9fda-ab2b9c25cc26","resolution":{"observed_at":"2026-08-16T00:10:47.801092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-16T00:10:47.805686Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.805686Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:5bdf05cf6d05e9491265e4a9bf62f69198ee15d3a00daaf310979444fa9704c4","observation_id":"763ee66d-bd2e-466d-a9b0-01512c4223f6","resolution":{"observed_at":"2026-08-16T00:10:47.805686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:47.810156Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence45(6), 6748–6765 (2023).https://doi.org/10.1109/TPAMI.2021.30705432, 3","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.810156Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:9603cab954fd0eef0bd027a33a5be08841b07a83d167d892161284f58f307498","observation_id":"1c4ce6ef-8b05-4221-9717-c919f1d6cd52","resolution":{"observed_at":"2026-08-16T00:10:47.810156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s12369-019-00560-92","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:47.867313Z","title":"International Journal of Social Robotics12, 267–280 (2020).https://doi.org/10.1007/s12369-019-00560-92","venue":null,"work_id":"2f19b309-1703-49a1-8e48-b0387c3625b8","year":2020},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.814199Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:fa1db077037e6878b0781cd0fe402393a9be45382fdbb79d8101ac8ca2238e04","observation_id":"d632bebc-06db-4f3f-9d35-07029c2f224c","resolution":{"observed_at":"2026-08-16T00:10:47.873169Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-16T00:10:47.818214Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.818214Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:b214740ef442cd0185d8ff2614c5d7e5d1cbc6d385629630a297659a0e809164","observation_id":"1d32d408-ff84-473d-b97a-4b303ef6eeee","resolution":{"observed_at":"2026-08-16T00:10:47.818214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:48.376249Z","title":"Electronics11(16), 2490 (2022).https://doi.org/10","venue":null,"work_id":"1d6d4da3-4f93-4cdc-b6d6-aeefdd084058","year":2022},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.822534Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:1e0f4a29fb3d785f376a9dcd1f329240dcec488d52fd44e65bec98212e1cf969","observation_id":"1b89d68b-4d61-4d7a-9fde-01b25e62ebb1","resolution":{"observed_at":"2026-08-16T00:10:48.380520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-16T00:10:47.826444Z","title":"In: Advances in Neural Information Processing Systems (2017),https://arxiv.org/abs/1706.037623","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.826444Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:39021376229b9dddd12dfa3415eb42677c4d2995abdcb111554d485012ba712e","observation_id":"56860c06-b79d-455b-bdfb-7ea7ad657f8f","resolution":{"observed_at":"2026-08-16T00:10:47.826444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1411.45553","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:48.134003Z","title":null,"venue":null,"work_id":"25bad058-a777-4c38-8e54-35685fae8caa","year":2015},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.830747Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:eafb113f248e0bd0983d8fd7b0c427aa496294ec42b313f8373182cef93b49cd","observation_id":"ea39fe7c-823d-4ce6-a1ba-301e10558c9a","resolution":{"observed_at":"2026-08-16T00:10:48.140983Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:47.834568Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.834568Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:96a620b538ac48687c2052fef58017c128aec43e70ed14def77ef90f111fcefc","observation_id":"bcc04e46-f68f-4661-97cf-7e15880793a3","resolution":{"observed_at":"2026-08-16T00:10:47.834568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T00:10:47.838698Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T00:10:47.838698Z"},"links":{"citing_paper":"/paper/2608.12515"},"observation_digest":"sha256:8c459ec98da0760600871ea794f264952ce255ff73709b67a07c32dd4e42af76","observation_id":"e64bcc9b-1d90-4126-a0d2-2e9e9b24709e","resolution":{"observed_at":"2026-08-16T00:10:47.838698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.12515","last_updated":"2026-08-12T18:47:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T23:10:29.903210Z","submitted_at":"2026-08-12T18:47:43Z","title":"Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":3,"verified_fuzzy":3},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2608.12515."}