{"as_of":"2026-08-13T05:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:117e07c7ea0d48072eaf977ce7bd0abbd58ccd358cf5249f1b1a4c1fcdf9d525","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:38:34.786612Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18038/citation-record","integrity":"/paper/2411.18038/integrity","json":"/paper/2411.18038/citation-record.json","paper":"/paper/2411.18038"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.146453Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.146453Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:62aa89e0c23ee14c2ef1dbb39f9c39a81b19da5a9ec15379a0d5bfc03003de47","observation_id":"2a5237ee-346a-4d9e-8d89-29e96b39bfe1","resolution":{"observed_at":"2026-08-12T11:38:34.146453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.841691Z","title":"In: Proceedings of the IEEE international conference on computer vision","venue":null,"work_id":"0cf8d2f7-ed6b-48f9-828b-387e744f6e11","year":2015},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.150887Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:da673aded6a19e596c84501517a86f0a7579a15d5503799c67bc6bcf29a83d69","observation_id":"d0e264e1-1968-45a2-a10c-1191df854adc","resolution":{"observed_at":"2026-08-12T11:38:35.844543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.833947Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence 41(2), 423–443 (2019)","venue":null,"work_id":"760f2e76-3ae7-43fb-b250-37da9427f39e","year":2019},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.153944Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:659e72dbeb0b8719dd3b900f3c5bdb5dedb2e1237f0a6b1f5cc03b1a87f9958a","observation_id":"49eafe1f-9012-439b-bebf-cce652cfce60","resolution":{"observed_at":"2026-08-12T11:38:35.837010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.182657Z","title":"Advances in neural information processing systems33, 1877–1901 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.182657Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:d01fcb0c63640e303f894c97524c60b21d396247f747deacc5af3828895208d5","observation_id":"88b30466-0e00-46ad-ba7f-467c18b95f20","resolution":{"observed_at":"2026-08-12T11:38:34.182657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.229865Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.229865Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:b0a6424508b101b14e1d1a6e09d681acdd1aae8e827e53c5b435e1e5d78cacd7","observation_id":"85040c99-cefb-4f47-835b-4fd33acf2181","resolution":{"observed_at":"2026-08-12T11:38:34.229865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.770794Z","title":null,"venue":null,"work_id":"7e65510d-77a8-435f-9436-a53b14d4cbfb","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.257749Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:2da20e64dcd72d9f767f96a44c3863946ed5767ece6ab68ca4c193a960327fa7","observation_id":"c5d792de-6252-4937-b5dc-71d1c9c48ea9","resolution":{"observed_at":"2026-08-12T11:38:35.821530Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-12T11:38:34.307670Z","title":"arXiv preprint arXiv:1504.00325 (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.307670Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:e598cf99626cea514de1f6a537cb2a94faa5fcdfc277faab53deee939190852d","observation_id":"67d57506-ec78-4fc6-af1e-002d5bec64c5","resolution":{"observed_at":"2026-08-12T11:38:34.307670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.310959Z","title":"In: European conference on computer vision","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.310959Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:12eb3d10e82eaedbed21b60dcbd9ec22db5622037ec1aca4cfffdb7075c1d559","observation_id":"5c0fa5d8-16f1-45ed-b17e-e9edc0050153","resolution":{"observed_at":"2026-08-12T11:38:34.310959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-12T11:38:34.313458Z","title":"arXiv preprint arXiv:2204.02311 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.313458Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:2d260e94edf6d9123e4ef22f9e4ab590c2396e335d55ae5ece2338f426a359b2","observation_id":"38c3e4b8-3af2-4bdd-83da-fa6738dc59cb","resolution":{"observed_at":"2026-08-12T11:38:34.313458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.316285Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.316285Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:6fbca6dd1e3097df3ad1aa1d276906243aae529efa1a61d9a10e7852b2df538b","observation_id":"20608490-ee45-4f30-acd1-bfd3edbdf1d1","resolution":{"observed_at":"2026-08-12T11:38:34.316285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T11:38:34.319094Z","title":"arXiv preprint arXiv:1810.04805 (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.319094Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:3fb7a25f70e87fd7f847a92dd454b492c93c6627c15b0af9e53113c161edd207","observation_id":"baaf330d-1904-45b8-9a6b-72f93c1e3007","resolution":{"observed_at":"2026-08-12T11:38:34.319094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.675663Z","title":"In: British Machine Vision Conference (2018) 16 Kang et al","venue":null,"work_id":"d5551e19-60aa-4fef-a51e-7de00f7c7835","year":2018},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.322040Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:3072ea20490cb57435c92e16de7b721511b1a6ee4fe840395d339b1604545ea6","observation_id":"ce13505b-3646-405b-87d1-3f2fbce601ad","resolution":{"observed_at":"2026-08-12T11:38:35.702688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1505.04474","last_updated":"2015-05-17T23:21:35Z","snapshot_observed_at":"2026-08-08T14:01:30.800790Z","submitted_at":"2015-05-17T23:21:35Z","title":"Visual Semantic Role Labeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.04474","snapshot_observed_at":"2026-08-12T11:38:34.324732Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.324732Z"},"links":{"cited_paper":"/paper/1505.04474","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:77d901b82bc5884821e25ad095473d139fec5a4e668d71f3b854d62b4d6f3a91","observation_id":"16a34395-73be-4311-b0b8-76a56171dbc7","resolution":{"observed_at":"2026-08-12T11:38:34.324732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.668010Z","title":"In: Computer Vision–ECCV 2020: 16th European Conference, Glasgow, UK, August 23–28, 2020, Proceedings, Part XV 16","venue":null,"work_id":"f3f8762f-7b78-474a-900a-708d92b408b8","year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.327667Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:fcfc4810229fec5c17b5aff0839d3c41e75b4a01e4044ebaaa80f149e7c467a4","observation_id":"cfcfafc0-6767-4973-b30c-0997d789c924","resolution":{"observed_at":"2026-08-12T11:38:35.670782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.658653Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":"0ddd4d5b-44ba-4382-922f-ff06b7b5fb20","year":2015},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.330845Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:c9d2c4c34a53d62cf19ef21f80853648c985f02a5467456189b998d8a1dfc45a","observation_id":"3afe03d3-9352-462f-b2e0-99bf7a364685","resolution":{"observed_at":"2026-08-12T11:38:35.662741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.650009Z","title":"In: Proceedings of the IEEE/CVF Con- ference on Computer Vision and Pattern Recognition","venue":null,"work_id":"68f76626-3a49-4db3-b622-64035cce6f13","year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.333322Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:e7c71425c3531c6c8ef14882ae7db7ccbf2abb6db92b28dcd1a57fd25672ff73","observation_id":"49b950cf-6425-4459-8b2e-8763d375c1f4","resolution":{"observed_at":"2026-08-12T11:38:35.653126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.640343Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"f9851464-8564-4d8f-82b9-13ebb517f6ee","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.336324Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:cf360bd6c45f7f57c855eadd18970ffa5e209dd8b70c155b68f2261553a54613","observation_id":"6cb0126b-990e-4865-a4d0-51c92ddd8914","resolution":{"observed_at":"2026-08-12T11:38:35.643674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.631593Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"fb9af11d-713d-414f-811a-494378cc4fde","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.338694Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:86c4a771f6a43ee1399f1d7f76394f1a3e7aa1ac5f2173e4349e9aef542bf8a0","observation_id":"468cc232-0e42-412d-a22a-152e18e28359","resolution":{"observed_at":"2026-08-12T11:38:35.634586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1411.2539","last_updated":"2014-11-10T19:09:41Z","snapshot_observed_at":"2026-07-06T04:00:05.122784Z","submitted_at":"2014-11-10T19:09:41Z","title":"Unifying Visual-Semantic Embeddings with Multimodal Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.2539","snapshot_observed_at":"2026-08-12T11:38:34.341241Z","title":"In: arXiv preprint arXiv:1411.2539 (2014)","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.341241Z"},"links":{"cited_paper":"/paper/1411.2539","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:7a6de3cab18b30f5b154093962b53080be6158d4dff63aaff66b891c6ea30f8c","observation_id":"8c6ff187-c0d1-4a4d-b599-4fd492dc76d0","resolution":{"observed_at":"2026-08-12T11:38:34.341241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T11:38:34.344173Z","title":"arXiv preprint arXiv:2301.12597 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.344173Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:3cf25020a731a84d783ed5663547bb581c83d1b002f81de3607dfa8dadb0ab80","observation_id":"9b13d84c-4e55-4138-89f8-c3b2aec89ec1","resolution":{"observed_at":"2026-08-12T11:38:34.344173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.532091Z","title":"In: International Con- ference on Machine Learning","venue":null,"work_id":"64ed04d8-8e50-4c84-a184-b570197c5251","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.385069Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:dcae6615584751187a2db3407d02018e9f2549fe23a91fec6a8e1654acadd44e","observation_id":"dab8e512-0800-4166-b281-c06f3201a948","resolution":{"observed_at":"2026-08-12T11:38:35.588912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.440620Z","title":"Advances in neural information processing systems34, 9694–9705 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.440620Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:9ad90c10110c712179c5b82e917dc8750a97e874233cc5a4442f2b5bb3dbe840","observation_id":"b6a4ca7c-a1a0-47d8-bf5b-48f1acae6504","resolution":{"observed_at":"2026-08-12T11:38:34.440620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-12T11:38:34.443119Z","title":"arXiv preprint arXiv:1908.03557 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.443119Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:4478bf6fa26af4c3f67185eb92d087782a4ba50a71d9e521b6f0d7cd36df7fef","observation_id":"7907736c-465b-4605-9b58-b68df20fc304","resolution":{"observed_at":"2026-08-12T11:38:34.443119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.435699Z","title":"Advances in Neural Information Processing Systems33, 5011–5022 (2020)","venue":null,"work_id":"50003b64-e051-4046-9d7c-70b1a6154bec","year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.446028Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:cfc845ea0cc265aa4a540765c1fd775ec93a3af88904721a68206c8e61e4cd5a","observation_id":"68157de3-a025-4aea-b66f-c00cd57e16b2","resolution":{"observed_at":"2026-08-12T11:38:35.502440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.361596Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion","venue":null,"work_id":"26eb4db9-c7c7-49d2-a5ca-0d8ea4e6b079","year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.449299Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:d6d842a181b18f42f5ede5dd06a68638cb13c2ec6b9c4ec735bb1a3606766ec2","observation_id":"1d8b1ad2-6a37-4d19-bcee-c45414a361ea","resolution":{"observed_at":"2026-08-12T11:38:35.365178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.353055Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"addb7f5f-14c3-4f53-9a4a-f65d8590a9e6","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.451737Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:46f409c6480345201b6afa9f44ae970b1634580e02936c15123d84808c15d46a","observation_id":"4072d5d1-da5e-4bbb-9427-779fcd30977e","resolution":{"observed_at":"2026-08-12T11:38:35.356245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.454100Z","title":"In: Computer Vision– ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V 13","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.454100Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:5832a2107f6312185fe119ec083b2c39ec8039cdcb6344fdddae07150e4b68fe","observation_id":"b966a311-15c0-479a-8d53-fcdc31acef21","resolution":{"observed_at":"2026-08-12T11:38:34.454100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T11:38:34.457601Z","title":"arXiv preprint arXiv:2304.08485 (2023) VLM-HOI: Vision Language Model for Human-Object Interaction 17","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.457601Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:61bac0e098fbf4989c4ff0c21232ef3b3c089d3220354da7243d3972f95f56ef","observation_id":"ad934a85-b42e-47ef-9f5f-3b27c417013b","resolution":{"observed_at":"2026-08-12T11:38:34.457601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-12T11:38:34.460943Z","title":"arXiv preprint arXiv:1711.05101 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.460943Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:8a74630424878237c1bdc7f74586a36b5d92aabae7f642fbfe49dc3e46dddf09","observation_id":"39f77caa-80f2-428e-94a3-32c7a8f5a8a4","resolution":{"observed_at":"2026-08-12T11:38:34.460943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.193326Z","title":"In: Proceedings of the IEEE/CVF Confer- ence on Computer Vision and Pattern Recognition","venue":null,"work_id":"e77be7f3-fb88-4ba6-99e0-4fc0f18fc636","year":2019},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.463850Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:9cf3af4fd5eb5734ccefa790393f37f1472f375e93466bedb3b4215a43dfe341","observation_id":"b4590073-7e33-49eb-91f9-c9faf21b51ec","resolution":{"observed_at":"2026-08-12T11:38:35.266247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04019","last_updated":"2023-01-08T03:53:50Z","snapshot_observed_at":"2026-07-06T14:40:01.183227Z","submitted_at":"2023-01-08T03:53:50Z","title":"FGAHOI: Fine-Grained Anchors for Human-Object Interaction Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04019","snapshot_observed_at":"2026-08-12T11:38:34.466506Z","title":"arXiv preprint arXiv:2301.04019 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.466506Z"},"links":{"cited_paper":"/paper/2301.04019","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:bb29b8b193930cdae83ef12104f7ab8deec30366d62602272969b1e164e1a5e0","observation_id":"b3e67d8e-369d-4462-978f-93c180f89bb8","resolution":{"observed_at":"2026-08-12T11:38:34.466506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.184606Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"7b3caa00-69a1-4d99-888b-fc53b33b9808","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.469599Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:e8b9b4bab39398a3d3bd2a4e7b1cbdb46f89355e607810b2636f9fa277b1fb16","observation_id":"e0fbbeee-727a-4b37-8f9e-9fde518ce149","resolution":{"observed_at":"2026-08-12T11:38:35.188249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.481853Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.481853Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:198692d97b290f6202d1640e3fd1bdd05e3291c3c3fda48ab69d08cb1a329326","observation_id":"2e4a9699-9d60-4685-9290-cc2f3d8290e9","resolution":{"observed_at":"2026-08-12T11:38:34.481853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.172983Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"27cb12dd-9aa1-405d-95ef-87f9c60c06a8","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.545966Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:7d75ff62b963c0601bca15f09e50a3b1cde90a14ee8dae7184cdaa84d2cab26c","observation_id":"fb43d5f5-9c30-4e0d-a2dd-3b225be02050","resolution":{"observed_at":"2026-08-12T11:38:35.175904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.572935Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.572935Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:5be2737e041db8ba70285ddaa82d601324cc9dd028b6a47566026b3776718221","observation_id":"0f8ebe15-af04-4b86-8431-b3b2de892750","resolution":{"observed_at":"2026-08-12T11:38:34.572935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-08T09:19:20.381840Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-12T11:38:34.575819Z","title":"arXiv preprint arXiv:1908.08530 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.575819Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:ef6a34b5a3ad6b3ad765810f522660d81bfc4e952d540a7a80eba83349375176","observation_id":"b4e12a1d-933c-4d96-959e-d9ade6969be9","resolution":{"observed_at":"2026-08-12T11:38:34.575819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.578827Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.578827Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:8013a6a35efd1bdfa6790b9dddac56637860a1b70c0a920cb9d38f18579c0ceb","observation_id":"fe88a09e-a0fb-4683-b71e-33abee063a87","resolution":{"observed_at":"2026-08-12T11:38:34.578827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-10T05:13:08.988270Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.07490","snapshot_observed_at":"2026-08-12T11:38:34.581837Z","title":"In: arXiv preprint arXiv:1908.07490 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.581837Z"},"links":{"cited_paper":"/paper/1908.07490","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:9db86dc93ba04c1e7e05082e8620cdbb5f172062a9359a3e256f8c36d7acf285","observation_id":"b107420d-4051-46e9-80ec-a6028a59b865","resolution":{"observed_at":"2026-08-12T11:38:34.581837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.585350Z","title":"In: Proceedings of the IEEE conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.585350Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:c0ae2bf3d1b67d4e4fab6d636ae2412cb48480bbe1197180d8e586aaacd3db9e","observation_id":"d35a03d6-eefc-4750-8d05-0c575b4f22c2","resolution":{"observed_at":"2026-08-12T11:38:34.585350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.152266Z","title":"In: Pro- ceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recogni- tion","venue":null,"work_id":"33c414cb-8017-4cec-8a54-3f11517f59c9","year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.587955Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:1e2a26cc03e21d344ae2d62dc6f7443e26db2a1e3dba6277bcc949b7ddecaef6","observation_id":"92a2bf5e-367c-4af0-a9cf-aef629b6e4e3","resolution":{"observed_at":"2026-08-12T11:38:35.155168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.590551Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.590551Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:e688220be6a9557b0151cea58a70edcba46e508ad431f53510d0ba6ac3929a3c","observation_id":"0c545409-b1fa-429c-aec1-bd44cbf335ce","resolution":{"observed_at":"2026-08-12T11:38:34.590551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.139726Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"c9054165-5a42-4dc8-b5fe-bf5905844467","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.592927Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:db757f47227f1d847c5d51ab41c71f0716c20ef9d9258edb67113e74296755c2","observation_id":"9f4167a1-bedd-4c95-ae2b-021c5018a1d8","resolution":{"observed_at":"2026-08-12T11:38:35.142769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.132548Z","title":"In: International conference on machine learning","venue":null,"work_id":"2099b6df-23e2-4415-b5ce-74e44000c7c9","year":2015},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.595219Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:c5be93a5a66556df58f762097ac5267ed82cfb5fef9415b10339ec5d8ada8d8c","observation_id":"0aa0769e-cb68-4b33-86d1-a54c3a8f39e8","resolution":{"observed_at":"2026-08-12T11:38:35.135268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.597799Z","title":"In: Proceedings of the AAAI conference on ar- tificial intelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.597799Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:3d2fba991a1423d06dfcf8c10cecc477bfc736782e0e023a101370b277d73ed2","observation_id":"4aa3d3be-222d-4f32-ad08-a1709fca3df6","resolution":{"observed_at":"2026-08-12T11:38:34.597799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.061148Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":"5aad4fdb-b049-4561-ae58-cbb45fa4a3b1","year":2018},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.600717Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:1225c83ccb63827739afaacb8b063b30a4c8fd3e1324fb285064969cfd79db75","observation_id":"e68e1ace-973d-47f8-98b4-5382e19484b6","resolution":{"observed_at":"2026-08-12T11:38:35.063951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-12T11:38:34.603288Z","title":"arXiv preprint arXiv:2205.01917 (2022) 18 Kang et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.603288Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:d950aee7c4398630054de3c9987b4ef853f80712e3068ba911f0abcffcf0118f","observation_id":"2259e9ad-ec0a-4263-a383-d3de78fb876f","resolution":{"observed_at":"2026-08-12T11:38:34.603288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.054002Z","title":"Ad- vances in Neural Information Processing Systems35, 37416–37431 (2022)","venue":null,"work_id":"0933225a-a605-4a55-92de-715ba9ff3ae9","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.605972Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:5f4d40e33cb10c14f366cdb7ad65bcaf962963d172c865591e3ae04c46654f41","observation_id":"51144232-2b26-4a49-814f-47954a3cf100","resolution":{"observed_at":"2026-08-12T11:38:35.056817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.046234Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"ec5df163-e0e0-4552-a1ff-56a9f660ae50","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.609372Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:a52cb2ec6f5f29a8e6838503e4b1fc0943f4fc1b3bdba757963ae79a57f3cdff","observation_id":"e59024cd-59db-416d-9f8d-5aaee0c493b5","resolution":{"observed_at":"2026-08-12T11:38:35.049340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.038110Z","title":"Advances in Neural Information Processing Systems 34, 17209–17220 (2021)","venue":null,"work_id":"ce562505-35a9-4181-bdbd-668a4411de27","year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.611855Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:4dd54fa96eb0ea1d8e79880e0e70a801679bf15dec568e68d22ccf22e740c3aa","observation_id":"7daa7899-863e-45fb-9a7c-dfced26d0ea8","resolution":{"observed_at":"2026-08-12T11:38:35.041544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.029268Z","title":"In: Proceedings of the IEEE/CVF International Con- ference on Computer Vision","venue":null,"work_id":"6908c792-b5ca-4a3a-818b-9678adec9462","year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.614276Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:205539184f2906f9b89aa2ca374b4380e279ea4d88c63fd5d7f645c9708114eb","observation_id":"e2cc35e1-7672-4cb1-96a8-009b93664ed7","resolution":{"observed_at":"2026-08-12T11:38:35.033708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.019804Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"ef052f9d-d91d-4d42-94ba-fe8db3edcf46","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.617496Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:0ed4f256497966dc28098a5c7326d4d7103b590ef8b1cc34826caf8b15fd09c0","observation_id":"e3cb7b2c-7c06-4f1f-b2c5-99a5d09d6a06","resolution":{"observed_at":"2026-08-12T11:38:35.024223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:35.011518Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"6d9f986e-a766-4ff2-933a-135e7dd96564","year":2023},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.619939Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:8483773814cb9bb34b616e07c8b6e8bcc9efa3f2a970c25fbc07c56c703b4434","observation_id":"36ab7426-2f8c-4757-82b5-f92ab22e4fe5","resolution":{"observed_at":"2026-08-12T11:38:35.014544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.937616Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pat- tern Recognition","venue":null,"work_id":"e2b8a9b6-4dd9-4b3a-ae0a-ded14e76d17a","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.647682Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:05b1ba59082d4bb147f5fd83227be3897173473c23443583529499615b2b3215","observation_id":"1e058d5a-d39d-46f1-af68-ebd671d072ec","resolution":{"observed_at":"2026-08-12T11:38:34.967395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.907632Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"a298481b-42ad-4f67-817c-074352a717f8","year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.669349Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:29560ed890fc2fc461634fb8eaed8fc832afb0c5479f462f0a3636fdc7306a4b","observation_id":"7295c9bf-9a7e-4229-9ae1-8e8eb082b4e2","resolution":{"observed_at":"2026-08-12T11:38:34.917075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.900297Z","title":null,"venue":null,"work_id":"398e7781-fe61-4999-bea9-dae4ea76124e","year":2022},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.723346Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:f47e0a5af00ab23c509e873c4a0f51f23f6a8bd93db34b1df9c57613c923b149","observation_id":"70d86c36-21bb-43a2-828c-5ea64e462e26","resolution":{"observed_at":"2026-08-12T11:38:34.902737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.892359Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":"c54fd183-198a-4a6c-8d81-befef10821cb","year":2020},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.746698Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:8552fa3e0ac68c07df99826fe0af84b2719fb8570168f6398b57e3077b5adced","observation_id":"919cee17-65ca-4fa3-b275-6fa30cb2a7c2","resolution":{"observed_at":"2026-08-12T11:38:34.895432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:38:34.883227Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pat- tern recognition","venue":null,"work_id":"e65cc768-6641-4e69-a35d-9471f46b434b","year":2021},"citing_paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:34.786612Z"},"links":{"citing_paper":"/paper/2411.18038"},"observation_digest":"sha256:31838eda6dd9b9bc2c0ed30ce3d52d056ae06d4182ed9d8733207c6c7ebcc359","observation_id":"652a7513-062d-4bf7-8d56-9714bd8b9d39","resolution":{"observed_at":"2026-08-12T11:38:34.887328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18038","last_updated":"2024-11-27T04:13:23Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T02:21:52.304691Z","submitted_at":"2024-11-27T04:13:23Z","title":"VLM-HOI: Vision Language Models for Interpretable Human-Object Interaction Analysis"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2411.18038."}