{"as_of":"2026-08-20T10:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:513c9252464582ae6d7e78b327c570ea3db298f463ea5929a5b0cf6c4f6a3b4b","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:25:53.096072Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.10977/citation-record","integrity":"/paper/2507.10977/integrity","json":"/paper/2507.10977/citation-record.json","paper":"/paper/2507.10977"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:49.724738Z","title":"End-to-end object detection with transformers,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:49.724738Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:7c53ea7ca199553fae27afaf2aaf11ea68490cf8c5c07eb956b8c15961f3d1ba","observation_id":"85c4596a-1237-4b69-bf43-465640666583","resolution":{"observed_at":"2026-08-06T17:25:49.724738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:49.801341Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:49.801341Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:779799af38fa01551e157fd0a9145c7bef4d426f44e0b04ba9b0a8e5f4a9c907","observation_id":"f04a7af1-9637-45d2-b2ac-7805a2cf038a","resolution":{"observed_at":"2026-08-06T17:25:49.801341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:56.271641Z","title":"Real-time end-to-end action detection with two-stream networks,","venue":null,"work_id":"bfa58ac6-b3b8-42c2-bc39-e92696fb84e3","year":2018},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:49.912079Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:ddf9d32d045c15835ccca94811ffdcb75d5f227577a73561b2503525ddc08091","observation_id":"b8d725ec-9921-460d-ba9b-fc71c42cb9b7","resolution":{"observed_at":"2026-08-06T17:25:56.338116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.01024","last_updated":"2021-11-01T15:27:35Z","snapshot_observed_at":"2026-08-19T23:28:35.978339Z","submitted_at":"2021-11-01T15:27:35Z","title":"With a Little Help from my Temporal Context: Multimodal Egocentric Action Recognition","version":1},"cited_work":{"arxiv_id":"2111.01024","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.01024","snapshot_observed_at":"2026-08-06T17:25:53.206176Z","title":"With a Little Help from my Temporal Context: Multimodal Egocentric Action Recognition","venue":"cs.CV","work_id":"84093355-485e-4283-a338-74fd6f6d86f2","year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:49.998226Z"},"links":{"cited_paper":"/paper/2111.01024","citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:2ee493e565176bbcc8fdfec600ab21d6127633cebea9de4477f121cd98300125","observation_id":"ba5af705-0306-48e5-b861-352a689abc2e","resolution":{"observed_at":"2026-08-06T17:25:53.254496Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:50.079934Z","title":"Hierarchical reasoning network for human-object interaction detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.079934Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:5dbf6159ca7ea1724f465f3c645486735d0377299ff086e572606bf88b020c90","observation_id":"0cd61a5a-8948-44c8-ac94-45d35aa6069e","resolution":{"observed_at":"2026-08-06T17:25:50.079934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:56.134871Z","title":"Hier r-cnn: Instance- level human parts detection and a new benchmark,","venue":null,"work_id":"06976574-a6db-4129-9792-592d348e5fb9","year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.146902Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:15a1beafb77952c55c8c4434500c7df823d0100ad3694d79ab863848fd2cbebd","observation_id":"b4c0dce5-34a1-4829-a421-53dec2cb4a9e","resolution":{"observed_at":"2026-08-06T17:25:56.191639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:50.212358Z","title":"Reformu- lating hoi detection as adaptive set prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.212358Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:f7d9703d47cfe9ce72ce56302e2b2731bcdfdc18cc8ac7b5a96671c785224899","observation_id":"03ad6aa4-47ed-4599-885b-c0088457b6a6","resolution":{"observed_at":"2026-08-06T17:25:50.212358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:50.262176Z","title":"Image captioning with semantic attention,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.262176Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:5f67889f3557cd71a006e9665ceb3e0625f2dc86591bb98f8db062c408b5b3d4","observation_id":"895ab613-ba50-4bce-b183-36f83ac862fd","resolution":{"observed_at":"2026-08-06T17:25:50.262176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:55.990473Z","title":"Vqa: Visual question answering,","venue":null,"work_id":"47057002-daf6-4903-835a-7bdd2e8a51f5","year":2015},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.383491Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:ac4d08ed04726e68b8774398d8ec83182112297a580a1ea48556c0eddeb2b05f","observation_id":"25bd32c9-e4b3-4cc3-839c-b9db67a25d9b","resolution":{"observed_at":"2026-08-06T17:25:56.050612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:55.863833Z","title":"Human- object interaction: Application to abandoned luggage detection in video surveillance scenarios,","venue":null,"work_id":"14dba240-b5e7-4666-b893-fffcbc15f3af","year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.486656Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:4ba9d4739222523ea368db3ee2594bd831f3fb560b046479e632240471c9ffaa","observation_id":"ce6eb008-98cb-463b-bd7a-c95b4c78a8bd","resolution":{"observed_at":"2026-08-06T17:25:55.920906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:50.573798Z","title":"A survey of autonomous driving: Common practices and emerging technologies,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.573798Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:a67ff2bdaaf71c11012fc17af75718582099ef6ea216ef8e9bb0a9fb528ce431","observation_id":"ef84b8f8-0e8d-4af6-bc5f-9a5b92170809","resolution":{"observed_at":"2026-08-06T17:25:50.573798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T17:25:50.668336Z","title":"Deformable detr: Deformable transformers for end-to-end object detection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.668336Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:3f2058808613b33c2cf30d8144edeb89b01e77c455e58bcfd121b2faae6e1a00","observation_id":"ee504f2b-e6b2-4a24-9a78-9cef2a477a3f","resolution":{"observed_at":"2026-08-06T17:25:50.668336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:50.759917Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.759917Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:e08704f004f5836afd0a670fd3b3b43fa326f58c8193e892b3ec79e1f7d351ca","observation_id":"4744d144-176a-4c3f-b3fe-a248e1a769dd","resolution":{"observed_at":"2026-08-06T17:25:50.759917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:50.857297Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.857297Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:c31083cfdf800142aac7a89daa159f2823eb45b60d2c2e5ce1ef235b2b9c1f61","observation_id":"bd72b719-0b78-4df6-915f-3d16e8c9ab79","resolution":{"observed_at":"2026-08-06T17:25:50.857297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:55.708741Z","title":"Qahoi: Query-based anchors for human-object interaction detection,","venue":null,"work_id":"699ec81c-9404-4587-afd9-ebd515b756de","year":2023},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:50.929675Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:d4c31421053bb6fd8bac1816d406c2741f4a00e69561fc91595069bbb7f8538c","observation_id":"2f39fa19-6b41-49bf-84f6-a012c5c53551","resolution":{"observed_at":"2026-08-06T17:25:55.759307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.011561Z","title":"Ernet: An efficient and reliable human-object interaction detection network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.011561Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:8f7dd3128a745e6ddb9c9752fd91b33c3d11f06cf69d801633c59f1c02ee35a9","observation_id":"ed344bd2-34d6-4a11-8add-785a16df1d9d","resolution":{"observed_at":"2026-08-06T17:25:51.011561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:55.523627Z","title":"Learning transferable human-object interaction detector with natural language supervision,","venue":null,"work_id":"f9f0f2af-91d2-460f-bf08-83037164f6df","year":2022},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.100405Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:a4033515c8d458958801e3f29244e49b19557cd3fa7956ec9c952d4bdb584dfe","observation_id":"8b5b142a-2c88-465a-bd53-9eb0371f70b1","resolution":{"observed_at":"2026-08-06T17:25:55.592690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.173864Z","title":"Rlip: Relational language-image pre-training for human-object inter- action detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.173864Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:ac539ebc1cf19bcf05cfdfcd8e2c56c4560db690e279e7ce1f1c0d7e50673f52","observation_id":"4b99a4ea-8fe1-49c5-bf9d-6a8818f902df","resolution":{"observed_at":"2026-08-06T17:25:51.173864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.239522Z","title":"Spatially conditioned graphs for detecting human-object interactions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.239522Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:8b15589f192a76d3c58a74a81f516909c51c12044b5d5f5dffdcce809cc64496","observation_id":"a3e72074-96e0-46e3-9e16-40953b9aae65","resolution":{"observed_at":"2026-08-06T17:25:51.239522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:55.332579Z","title":"Pose graph parsing network for human-object interaction detection,","venue":null,"work_id":"0ca58daa-b020-41a5-a9aa-484f90dc90e8","year":2022},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.317281Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:c1859f88483b0c005f1b63ea1875a1fc678b82b3c63cf4412ad544171faf615f","observation_id":"cb9d09dd-2912-4ed0-8478-16932eb7b5dc","resolution":{"observed_at":"2026-08-06T17:25:55.420781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.373928Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.373928Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:b13df9f1854d354b1caa58a58b78dc172f7641cb30da2c327e0d35546ba78047","observation_id":"09fa77f9-e67e-4a98-b0a8-5d0aa617ec81","resolution":{"observed_at":"2026-08-06T17:25:51.373928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.06236","last_updated":"2022-11-07T16:47:51Z","snapshot_observed_at":"2026-08-16T17:42:30.278700Z","submitted_at":"2021-11-11T14:35:20Z","title":"Discovering and Explaining the Representation Bottleneck of DNNs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.06236","snapshot_observed_at":"2026-08-06T17:25:51.455075Z","title":"Discovering and explaining the representation bottleneck of dnns,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.455075Z"},"links":{"cited_paper":"/paper/2111.06236","citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:4a5d5c2d892f14cc80cdf2e8f4b48f407cfa4f2ba113a98b85626634d0f7dd41","observation_id":"faec57e3-8964-4a01-9069-fd1e2ebf6a74","resolution":{"observed_at":"2026-08-06T17:25:51.455075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.568148Z","title":"Fgahoi: Fine-grained anchors for human-object interaction detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.568148Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:5ce1d8b51498d639da72cd24d82f8380f5006e2b15b0ac80f0704c259233b6c7","observation_id":"3f79630f-79c0-41b2-8a29-18b21ed94967","resolution":{"observed_at":"2026-08-06T17:25:51.568148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.646515Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.646515Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:daa4ece4dfac0491e46c45b799931a09d6238ab18ed47900745d6622a4c1cdf8","observation_id":"234255c3-576a-4475-8208-088966b7d4c9","resolution":{"observed_at":"2026-08-06T17:25:51.646515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:55.136261Z","title":"Learning human-object interactions by graph parsing neural networks,","venue":null,"work_id":"ea776656-da8b-4192-939d-0e81ca82e728","year":2018},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.736154Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:8c770f9bbd0900af9ec78d03a66f3576939af1193192581e2ab2372bb39ad90f","observation_id":"afe0dcf4-0e6a-46c5-856c-706b60bceacf","resolution":{"observed_at":"2026-08-06T17:25:55.233557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:51.845878Z","title":"Visual compositional learning for human-object interaction detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.845878Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:449abd09009b6fbf689c6941ab52dd6e5305a35fec442231d501ab52044a0e6a","observation_id":"c4f1161b-b649-4e8e-9bfc-e7e7c3482cdc","resolution":{"observed_at":"2026-08-06T17:25:51.845878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.978675Z","title":"Uniondet: Union-level detec- tor towards real-time human-object interaction detection,","venue":null,"work_id":"4a2a8eb0-5854-4d88-82be-1ac9bbee0f50","year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:51.965585Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:e876c71182152f06a189911e0f7fdc145f29bddcadf036c67c5ff84cdb5d9dcc","observation_id":"e9c91374-d460-4cea-a06e-7bfafb5414ec","resolution":{"observed_at":"2026-08-06T17:25:55.012555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:52.069006Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.069006Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:e28223e2da51b9307fd913a3b5130f803b3198b80008eddca47dc2bc43f85234","observation_id":"150123c7-f3f3-40ae-891a-d4a373a15586","resolution":{"observed_at":"2026-08-06T17:25:52.069006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.819174Z","title":"Dual- branch knowledge enhancement network with vision-language model for human-object interaction detection,","venue":null,"work_id":"3c5a6dd5-a220-400f-bd05-f9816cd09ad7","year":2024},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.143864Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:764aedb4f1948666c489cb494f21428b0c1fd9b772bb2575227be1aa8105538d","observation_id":"872015a2-81cc-4e67-9caf-a6d6440d7702","resolution":{"observed_at":"2026-08-06T17:25:54.876259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.689284Z","title":"Deep adaptive wavelet network,","venue":null,"work_id":"e02ca862-686d-4e69-a479-5fe45198b1b8","year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.224780Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:2d27c72c6a2f413320129f4ccc435757666017c06770dcd9a4fe9acda48e6eb2","observation_id":"11286da9-89a1-4a92-89e6-303d987c4ad7","resolution":{"observed_at":"2026-08-06T17:25:54.752986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.572179Z","title":"Wavelet convolutional neural networks,","venue":null,"work_id":"7007d227-81bc-4c16-babc-8e83e89273ac","year":2018},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.319111Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:6f9619e0305d3ec3ce868ec1071617e1c9ba43b091564a4d7eb8ba1af4dd0914","observation_id":"2afe0e9a-1d4f-4fe8-b41c-7a248246b341","resolution":{"observed_at":"2026-08-06T17:25:54.628258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.392698Z","title":"Learning-based image compression using convolutional autoencoder and wavelet decomposition,","venue":null,"work_id":"1f6067f9-c377-412d-be42-1bd3d1a331a3","year":2019},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.375453Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:b0818afb43ab1f79d64102ef98eeff576d63960fd70a7f543aaf7420e27babeb","observation_id":"7aec76dd-dac7-4376-bd75-c3d8e9af49d0","resolution":{"observed_at":"2026-08-06T17:25:54.477606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.246870Z","title":"Wavelet-srnet: A wavelet-based cnn for multi-scale face super resolution,","venue":null,"work_id":"3907eaf6-d6ec-463d-90ae-d14ba3d531d7","year":2017},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.430221Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:2686bf8f9720f35601b4bf0a34e1331c01d944e7c9aca5ae74a38ed77b8202a9","observation_id":"0cc3595a-a785-4769-9b57-d3185b0d4447","resolution":{"observed_at":"2026-08-06T17:25:54.310478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:52.501407Z","title":"Winnet: Wavelet-inspired invertible network for image denoising,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.501407Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:3d36b9f6ae47ce90f6a7c649efa564a151845ace8eb8d7dc590254c33b4fc7d7","observation_id":"d45fdf6f-20b8-47c4-82a0-5e3a6a2d2285","resolution":{"observed_at":"2026-08-06T17:25:52.501407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:54.140726Z","title":"An explainable spatial-frequency multi-scale transformer for remote sensing scene classification,","venue":null,"work_id":"2e1a973e-2b95-4e4c-890d-a727b5acf535","year":2023},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.553282Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:d196ee4afd70ad09853147b5fd0d4467f1dc02e12b8d362d430d1616a9b93a0f","observation_id":"85e731cc-2f1a-485f-98dc-e76795ca527c","resolution":{"observed_at":"2026-08-06T17:25:54.195295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:53.984495Z","title":"Light field networks: Neural scene representations with single- evaluation rendering,","venue":null,"work_id":"78e779b1-48f1-408b-84e9-da447f6e22bc","year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.597207Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:640cbe883dfab2e8513f2141e3551026957265e3faf4015e9deba25e58e7b784","observation_id":"30bc5418-0050-4fe5-8476-8582747ac06e","resolution":{"observed_at":"2026-08-06T17:25:54.051319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:53.839933Z","title":"Point- ersect: Neural rendering with cloud-ray intersection,","venue":null,"work_id":"2d5e4361-82b7-4a6f-a787-9ea9d71720a9","year":2023},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.636002Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:65f4bc17d51754ddd6fc0980dceea8e19d159218c04bf6995016eb0c44a372e9","observation_id":"a1cd1900-644f-4fc6-8f12-0c62d15f6391","resolution":{"observed_at":"2026-08-06T17:25:53.899612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:53.670086Z","title":"Generalization and network design strategies,","venue":null,"work_id":"b29fdc48-f958-4d93-afcd-29094b4e9f5b","year":1989},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.684828Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:5314c0709350b464412dbf627358fe68b26622b4e4c03c8924f492077be69f26","observation_id":"59e0cb18-f315-44ed-846c-fcd5ccd27f1e","resolution":{"observed_at":"2026-08-06T17:25:53.757949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11943","last_updated":"2022-11-22T01:39:45Z","snapshot_observed_at":"2026-08-19T23:27:18.049987Z","submitted_at":"2022-11-22T01:39:45Z","title":"Conv2Former: A Simple Transformer-Style ConvNet for Visual Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11943","snapshot_observed_at":"2026-08-06T17:25:52.762629Z","title":"Conv2former: A simple transformer-style convnet for visual recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.762629Z"},"links":{"cited_paper":"/paper/2211.11943","citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:cddac4a07b954c372c0f394f16a6dd212503581b8b7942e86e201c038aeae65d","observation_id":"be5590ad-385a-4e35-a344-d1b984887602","resolution":{"observed_at":"2026-08-06T17:25:52.762629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:52.817353Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.817353Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:04124e688bbf68831af0566efc51ec648857b54f1c9cd1779316e339dc8573a3","observation_id":"b5ff9f50-940b-40a5-a805-8fefd4a5d50a","resolution":{"observed_at":"2026-08-06T17:25:52.817353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:52.865755Z","title":"Global filter networks for image classification,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.865755Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:aaa292b08c41cfe7508aa2fd553f8b04feb68194c7ceb5a88591c0e6ca5e6096","observation_id":"d25f8815-4418-40ce-9afa-a7a083518ead","resolution":{"observed_at":"2026-08-06T17:25:52.865755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:52.924120Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.924120Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:d4a3010cda529de839601b1ff574d27b99e8ea84122095f90510f49620d84d08","observation_id":"9eeccb1a-2095-4f99-975b-630cf9da76a9","resolution":{"observed_at":"2026-08-06T17:25:52.924120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:52.998569Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:52.998569Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:ae693766310be26d9350c98b1fc442c355271d15d3f7815b43ee399aef5f44e0","observation_id":"c9e112e1-6ef3-4d0e-941e-874da99e2e37","resolution":{"observed_at":"2026-08-06T17:25:52.998569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:53.486665Z","title":"Deep feature factorization for concept discovery,","venue":null,"work_id":"05006572-93bb-4311-a8c0-cdb611ee9b61","year":2018},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:53.050231Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:ed7380f4a639fab728e83895ab2bb0a8eb73036d493216bb5f3f21c0321808bf","observation_id":"e57b3c2a-cc86-4296-a888-38cb9789d0da","resolution":{"observed_at":"2026-08-06T17:25:53.571854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:25:53.318977Z","title":"Eigen-cam: Class activation map using principal components,","venue":null,"work_id":"a49a293e-484d-45c6-b651-c0d686aa8085","year":2020},"citing_paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T17:25:53.096072Z"},"links":{"citing_paper":"/paper/2507.10977"},"observation_digest":"sha256:910d4e5f90abaa82fed22df90d0ae071a8c75ca50f54c5134ded5ff480b546b5","observation_id":"4a3cdbee-c976-4e42-a78c-d70b73936969","resolution":{"observed_at":"2026-08-06T17:25:53.410966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.10977","last_updated":"2025-07-15T04:44:54Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T23:27:33.764432Z","submitted_at":"2025-07-15T04:44:54Z","title":"Conceptualizing Multi-scale Wavelet Attention and Ray-based Encoding for Human-Object Interaction Detection"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.10977."}