{"as_of":"2026-08-06T02:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4987d0fe11cb9ec840a1f15c78ac7b38b1c0a9d797b730348a9abfad127b37a4","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T02:31:10.316351Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.13637/citation-record","integrity":"/paper/2502.13637/integrity","json":"/paper/2502.13637/citation-record.json","paper":"/paper/2502.13637"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ca2b32de-543a-46a8-93fe-1b3b50985193","year":1979},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:4e50ef6e965870e3bb5994eeba7eecc5aed0577559644ad5bab0a60a8f86ab1d","observation_id":"56eda60e-fa6e-4eee-b785-e935535a20fd","resolution":{"observed_at":"2026-05-23T02:32:27.008943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reasoning about object affordances in a knowledge base representation","venue":null,"work_id":"df0e9eb5-52ea-46a8-a47b-affaf764db6e","year":2014},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:6abd32a3b9a7ecde4067189b508b6885c807045f444511233bafb87bf5ea7023","observation_id":"23202bde-0493-4917-acaa-c543e24a6005","resolution":{"observed_at":"2026-05-23T02:32:26.990334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to act properly: Predicting and explaining affordances from images","venue":null,"work_id":"e49c50de-6db0-4a90-9c46-323924146b61","year":2018},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:d710753b7c899c0543da0f886dd17eafe726e8cc6e0e63cdf8316e25bd213a86","observation_id":"0487d92c-834f-4e24-8d9c-3d7e7309a95c","resolution":{"observed_at":"2026-05-23T02:32:26.993991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Binge watching: Scaling affordance learning from sitcoms","venue":null,"work_id":"a489ccaa-ac74-49b5-b949-ba5c32d83e6f","year":2017},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:0a496cb68deac44a50f3d937555d522d6b46aa41794957efe2efa5e1dd157adb","observation_id":"8426c105-f98c-4d8a-90d0-ac2b74ecd055","resolution":{"observed_at":"2026-05-23T02:32:26.986003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene-aware generative network for human motion synthesis","venue":null,"work_id":"fe6ba1a4-8900-4ba4-8bbc-74742255f221","year":2021},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:14b7121cdb8a086128842c24c7ff9da6b00d92e1f38a355b10c0cb03c811f516","observation_id":"596beda4-6eb6-4f21-a073-a5e0f4c37d48","resolution":{"observed_at":"2026-05-23T02:32:26.971816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Inpaint2Learn: A self-supervised framework for affordance learning","venue":null,"work_id":"7bcb711d-17a0-45a7-8c74-ad0ef2fcf000","year":2022},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:3c6f3248d18df921a9e42e73b72cf3a72986aaeacb5bb7fae60bd37c8f079f3b","observation_id":"ae04f838-48e2-461e-b2fb-107da44a60e5","resolution":{"observed_at":"2026-05-23T02:32:26.975511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene-aware human pose generation using transformer","venue":null,"work_id":"7b91d9aa-ef61-4a05-92b4-c7da2835f815","year":2023},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:2b4aac236ae86b45823f2a4ae2215de58ae92c6b858bf138142149dcaa66e3ad","observation_id":"37ee6304-6c11-41a6-82b3-f333283272a8","resolution":{"observed_at":"2026-05-23T02:32:26.978979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attentional processes link perception and action","venue":null,"work_id":"c75de048-1e37-4356-97b8-9370bca7c666","year":2002},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:07cff175c0a4456cfe548a74475affcebca2be5f83fcfaad07b55984b6bd08ff","observation_id":"fdf7c6a8-8f4c-4d4e-aa76-f0843c7dbf12","resolution":{"observed_at":"2026-05-23T02:32:26.982348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A multi-scale cnn for affordance segmentation in rgb images","venue":null,"work_id":"6f7f66f1-3e6f-4a99-b52e-b5ade623ec24","year":null},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:0df94dc5e2287d0056cb9e0d7ec03c4c9d94c420ec7bb41a280bcd217d3bd295","observation_id":"9214fc81-403d-475b-8ae4-d21dcaed7e53","resolution":{"observed_at":"2026-05-23T02:32:26.997916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AffordanceNet: An end-to-end deep learning approach for object affordance detection","venue":null,"work_id":"19a9d5e9-e123-40c5-99b5-5f2a9bb8064f","year":2018},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:8dff1929264f17c06576d07d0e03f1579cc62855f54015f254ba9abba9f81a96","observation_id":"a6d1c11a-10bf-49c0-8188-39e2e6fd2010","resolution":{"observed_at":"2026-05-23T02:32:27.001594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"HP-GAN: Probabilistic 3d human motion prediction via gan","venue":null,"work_id":"fd69ed6a-73aa-4c12-afe1-432ede2ee3a4","year":2018},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:9931cd601a38e6cd2e4628f5f578b7b5004efcc0e066e31190e22ede2df6792c","observation_id":"1509fafe-93b5-4e28-9705-5109b0490e34","resolution":{"observed_at":"2026-05-23T02:32:27.121552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep video generation, prediction and completion of human action sequences","venue":null,"work_id":"fbb49681-d2b4-4e81-8582-d04fee1b8ec7","year":2018},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:c11ca45b5ab56102048a988cacb805270f5eaf56b879068a0727471d796c828e","observation_id":"80b09226-0116-4c05-8a1e-192a7ecdb629","resolution":{"observed_at":"2026-05-23T02:32:27.129428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pose guided human video generation","venue":null,"work_id":"425c6048-c5e2-43da-b136-963f48f2e1c5","year":2018},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:573ad23ad81f8730ca55cd68086c131027cef98067e1961804f01683b8516310","observation_id":"2e52f4f8-2b08-4374-996f-265489643eed","resolution":{"observed_at":"2026-05-23T02:32:27.005190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convolutional sequence generation for skeleton-based action synthesis","venue":null,"work_id":"956f6f4a-1efd-46d5-b5ab-a7901da8917a","year":2019},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:10612aa38cbfa179768632a5eb5f1396089b19ad923ec8714b8cbfc75b5f14e7","observation_id":"b63712d3-7e3b-4927-8d52-ca79e394944d","resolution":{"observed_at":"2026-05-23T02:32:27.109769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Action2Motion: Conditioned generation of 3d human motions","venue":null,"work_id":"dba69ed4-388d-47bf-8a70-2fe38d153b94","year":2020},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:9864f2fa214095aed2b9f6b1546a17b7ba368adf9dc20110a3673849fc9a6a0a","observation_id":"8fe0dca4-abac-4559-a59c-79c48fa55168","resolution":{"observed_at":"2026-05-23T02:32:27.113970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ImageNet: A large-scale hierarchical image database","venue":null,"work_id":"1302baa0-a4cd-4524-a6c0-5cb99acf6d80","year":2009},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:661f273364e1a46d7a151faedb53e6c12a503ad235f3b9652638f7fc486f3532","observation_id":"2dee31cc-07da-43ff-a245-7a3c7bf2ea8e","resolution":{"observed_at":"2026-05-23T02:32:27.106280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":"982eee4d-a00e-447e-9e85-95b3b7da52db","year":2015},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:8da36a311dec2409d9b6ca2d6c8b273193dac5942c953775fabea497661691ab","observation_id":"63e07cc2-3dc3-497b-8d6c-9dd232baff1d","resolution":{"observed_at":"2026-05-23T02:32:27.095817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need","venue":null,"work_id":"ce41ccda-67bc-416f-988e-c1713566ca8e","year":2017},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:4118a3f98f29c8d27c199228331e2489a3e35ab2bdff9b7d2e2726a888352b3c","observation_id":"17fd7bc8-285b-4d43-84ab-dc3ee6a4c837","resolution":{"observed_at":"2026-05-23T02:32:27.099269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Non-local neural net- works","venue":null,"work_id":"04840f25-d5a8-4621-9cdd-ba5ed8be9f83","year":2018},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:ea5a4fc075248cac2c1738417856d7131dcf8534d6aae4d2c8749aafd9822338","observation_id":"7b39ddcc-2fe4-4572-b707-62805d96a0df","resolution":{"observed_at":"2026-05-23T02:32:27.102573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"One- former: One transformer to rule universal image segmentation","venue":null,"work_id":"cd19c77b-96d8-4b22-b90e-2331ba7d8d7f","year":2023},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:aefbff4893bac3c0a1c9d330838216558cf25bbfa926b762ad53c451c1170176","observation_id":"c6ad767a-1d3f-46bd-b0d8-9e3f20ad959c","resolution":{"observed_at":"2026-05-23T02:32:27.117704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15001","last_updated":"2023-01-16T18:58:58Z","snapshot_observed_at":"2026-08-04T04:56:00.219481Z","submitted_at":"2022-09-29T17:57:08Z","title":"Dilated Neighborhood Attention Transformer","version":3},"cited_work":{"arxiv_id":"2209.15001","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.15001","snapshot_observed_at":"2026-06-28T22:32:44.082476Z","title":"Dilated neighborhood attention transformer","venue":null,"work_id":"c61473a8-4ca6-4cd4-a948-f1fc0f2a98d2","year":2022},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"cited_paper":"/paper/2209.15001","citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:e1d31603f4ecb243a567f5e7571e347d817d7f8de9a02ec2ddc51a5ffa63bca3","observation_id":"948befb2-69a2-4dfd-a200-23b2bd27e59f","resolution":{"observed_at":"2026-05-23T02:32:25.973736Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Semantic understanding of scenes through the ade20k dataset","venue":null,"work_id":"ec9ba9c8-f9bf-44b3-bb52-f5f7aa9d5afc","year":2019},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:6205c3f817036d00c14fcd1b5f8821cfb501c976fce22f26dbe6cb3d331eed6a","observation_id":"c2dbe93d-8d20-4214-8ca8-9d482c459134","resolution":{"observed_at":"2026-05-23T02:32:27.088421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Root mean square layer normalization","venue":null,"work_id":"f4ab430e-9ce0-49fc-a755-b17f2a2eedb1","year":2019},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:3b7278fe62a1d384d5fae7ca9c1189d9f33bd523c4db70e6153f74e8111e1a73","observation_id":"bd2d3337-a0fa-4efc-8109-0909312e2a3b","resolution":{"observed_at":"2026-05-23T02:32:27.080744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Auto-encoding variational bayes","venue":null,"work_id":"6eb4e5d9-c620-41c8-9dfb-7a12234364ba","year":2014},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:a0f671e5047cf725e7f64782b57f7b095f29ddc8b6aaed756c78331ab9990c27","observation_id":"b2dd2b42-0b54-40d5-ba56-2eab4f1a3649","resolution":{"observed_at":"2026-05-23T02:32:27.076749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On information and sufficiency","venue":null,"work_id":"11f88b7c-6539-452a-a2ea-1b2be6a8b1ef","year":1951},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:1f7258d3ddc3a3b40aa2e7e8586a20eb553120ca7432f638c2afd853f0a4aed1","observation_id":"94231886-be78-44ea-8424-8c71ae94ad94","resolution":{"observed_at":"2026-05-23T02:32:27.084186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"a0bf6da1-936b-4ba5-aee0-adb5f6b8e7b2","year":2015},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:d38145a37cd632c25e7bf282318ac13f60e9e7bfb1e72188843939d5a53a5620","observation_id":"24b84d51-1b31-4a49-ba43-8e5da3064864","resolution":{"observed_at":"2026-05-23T02:32:27.073099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"ac4812d1-1a13-4fd7-9d25-5222e244bc09","year":2017},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:f6a514a168c48739e953fb3e10cfa8ee0c7c4ca5b9c6b8efedba5ecf10719345","observation_id":"6e980308-33df-491c-b1c5-787b11bca5a0","resolution":{"observed_at":"2026-05-23T02:32:27.052343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep high-resolution representa- tion learning for human pose estimation","venue":null,"work_id":"fc88630b-bd18-435f-a1a0-9397628af980","year":2019},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:74899f5bd4d5ce91af0f4612262bf30a67f3024d7edce4e2120f6a5188a874ed","observation_id":"55b9880f-a31b-4c21-ace0-97b19bce2e6b","resolution":{"observed_at":"2026-05-23T02:32:27.061741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ViTPose: Simple vision transformer baselines for human pose estimation","venue":null,"work_id":"bc2b5d48-5c34-488b-a434-184abd2c7c9f","year":2022},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:468797f7e6dab610abee1f95977a0bd2bc39758ab7e10306bc64535c0b056cba","observation_id":"44b7308c-9c78-4c4f-9810-86d4d77d114c","resolution":{"observed_at":"2026-05-23T02:32:27.065413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human pose as compositional tokens","venue":null,"work_id":"0a54fe16-db92-4767-8167-da82770f6d5f","year":2023},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:06ffab889b932a572a702b03b348128031625350217797af0f30ecbdda03c730","observation_id":"5bfc79b8-b15f-4e50-8ba8-ed92a4dab1c2","resolution":{"observed_at":"2026-05-23T02:32:27.040351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene aware person image generation through global contextual conditioning","venue":null,"work_id":"c9358831-449c-4b86-8aba-aa287281a898","year":2022},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:45825ae90a46734a0abfca255cf79c93ae8a58e0a27bd06ff2efbb91f0731b7c","observation_id":"86538e42-45b7-4ae2-9bb8-f64dc6e91d5a","resolution":{"observed_at":"2026-05-23T02:32:27.044343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A simple and fast algorithm for k-medoids clustering","venue":null,"work_id":"2ec68ebe-fe16-4fda-95a3-ad09bc2cdd23","year":2009},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:5119c91cd5d79fb50117cbf6bc679fbf58b388f64a1efda3df4634c57958ecf0","observation_id":"a35fd255-eec3-4f1f-a6ab-602e3ca05a16","resolution":{"observed_at":"2026-05-23T02:32:27.032430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2d human pose estimation: New benchmark and state of the art analysis","venue":null,"work_id":"30d82f34-9c77-4354-84f9-3ccc5f075024","year":2014},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:119e03c96fbabbdc6dd943edfe3f822fdc57994eb4956f21ccca7f71bb26499e","observation_id":"9ba05c54-b2a7-4284-a876-41676b667eb3","resolution":{"observed_at":"2026-05-23T02:32:27.035813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TopNet: Transformer-based object placement network for image compositing","venue":null,"work_id":"5b5ae01e-1139-49d4-83d2-19be241c09db","year":2023},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:22699b5a501280e12c609743abea3788bb39f406dc322e1bdad7b3d73fdb53a5","observation_id":"17186c98-a56f-47af-bf5a-35d891c6e52d","resolution":{"observed_at":"2026-05-23T02:32:27.048094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Resolution-robust large mask inpainting with fourier convolutions","venue":null,"work_id":"d12fbccb-ceea-407f-970d-e81b9cd1d0fb","year":2022},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:8f64842f56c63863458c74fa96d28f93578793d2aadbef5fe06286457b671ac9","observation_id":"e87b6ddc-e715-4b3b-b1d7-31326649c8dc","resolution":{"observed_at":"2026-05-23T02:32:27.069073Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Articulated human detection with flexible mixtures of parts","venue":null,"work_id":"138bedeb-f28b-4f52-a586-4e4a3525f887","year":2012},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:359ce0331ccfb967a937a81574847680162eed0b740fbc0eb60f755ba0c037d6","observation_id":"64cb9717-e5c6-46d1-a104-0f541187d2d8","resolution":{"observed_at":"2026-05-23T02:32:27.092414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"UniPose: Unified human pose estimation in single images and videos","venue":null,"work_id":"5b9561cb-5b04-48e5-8921-25d1531c2b52","year":2020},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:7d496898ad38b0031bcf5a79b4228fe730396aa5be87027d20ab9551357b0a46","observation_id":"ee745ee5-1457-4775-a244-9447b2777784","resolution":{"observed_at":"2026-05-23T02:32:27.125166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pose recognition with cascade transformers","venue":null,"work_id":"5a78da4e-7c04-400f-bac6-5d134fe8e582","year":2021},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:384d93b4de50f86305a8eba589ce44030767880edc63268b2c3829202d05b546","observation_id":"95654f81-e53b-4128-a9ea-93b1bcb45d95","resolution":{"observed_at":"2026-05-23T02:32:27.025371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning object placement by inpainting for compositional data augmentation","venue":null,"work_id":"ae1a5a66-1459-4207-8ec3-62317be9e93d","year":2020},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:5cd156c5d65d9d18175f826496466c6591816c5593ec7a96ba866129c4f606f6","observation_id":"59119a2c-e618-4d53-85a2-c6f45bda473d","resolution":{"observed_at":"2026-05-23T02:32:27.016996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning object placement via dual-path graph completion","venue":null,"work_id":"c7f12c52-2aa9-481a-9d37-492ebf5d726c","year":2022},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:c953e2c60e4094103e51e2c6cd3943214b493169a8b6087ce58f57d166a29d89","observation_id":"7fdcceb8-ad1a-423f-b0c2-4b9d91286f87","resolution":{"observed_at":"2026-05-23T02:32:27.012685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"6023196f-ed2c-486a-8d4a-79f951fcfb70","year":2024},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:738ebcb7e2df55ca9e205fa4bbbac18bcd33ecd2311a143b479f1a433fa72497","observation_id":"5fde974c-e178-4637-9f03-2777fa75dedf","resolution":{"observed_at":"2026-05-23T02:32:27.020433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Person image synthesis via denoising diffusion model","venue":null,"work_id":"9a7cb2ba-e429-4dab-8cfc-373db4e6b3a2","year":2023},"citing_paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T02:31:10.316351Z"},"links":{"citing_paper":"/paper/2502.13637"},"observation_digest":"sha256:45f86d41b75e24d6319096abbb17df3cd337727c040f84192dda79ccee76a702","observation_id":"5ef7e584-102b-4913-8b1f-131cec48f3ce","resolution":{"observed_at":"2026-05-23T02:32:27.029020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.13637","last_updated":"2026-04-18T19:45:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T20:39:06.470648Z","submitted_at":"2025-02-19T11:24:45Z","title":"Exploring Mutual Cross-Modal Attention for Context-Aware Human Affordance Generation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":1,"verified_fuzzy":40},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2502.13637."}