{"as_of":"2026-08-09T15:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:743e6ef8bc8c9756a4b76042748f136b9cbb4c5991badc60a95d5a913bbfff8f","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T23:37:31.790580Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23921/citation-record","integrity":"/paper/2607.23921/integrity","json":"/paper/2607.23921/citation-record.json","paper":"/paper/2607.23921"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:26.890326Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:26.890326Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:3f365744893a262df53f0b5ed268664b61253f6b7f7ea15e71e909fb2f4a3d26","observation_id":"5514a6d1-87d4-41bf-8238-e43848838b99","resolution":{"observed_at":"2026-07-31T23:37:26.890326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:26.932743Z","title":"In: Proc","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:26.932743Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:20ca4a9b9ba279cf7decd6a37415eda27a5b372fbd57a3a8f6187c3bcb69329a","observation_id":"2899f9ff-1142-4fe5-9134-43863de89887","resolution":{"observed_at":"2026-07-31T23:37:26.932743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:26.986401Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:26.986401Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:0c12e634243eff950f4288ae2cea2a0abf4c6f67ff3f340c38c8d06920cb324f","observation_id":"a142830e-5a89-4f87-b402-994ddbdff793","resolution":{"observed_at":"2026-07-31T23:37:26.986401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.037296Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.037296Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:f8e3979a5038eb7a4a6fdd19e68b94a8651cb05eaa728c73e0e9412e23d356e2","observation_id":"a614c20e-9ec5-4408-a6bf-855957a4f482","resolution":{"observed_at":"2026-07-31T23:37:27.037296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.084574Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.084574Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:2eb48dc85202a97b72bfccdf6480c4e6e2cec1784c1386e3d0bd09a754abc2e3","observation_id":"e208b736-31a4-406b-a122-f30368c2cd43","resolution":{"observed_at":"2026-07-31T23:37:27.084574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.154593Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.154593Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:3924a1c39ceb17776867d0213353953dbc3774d7ed53cf68edfe6bc8850928a4","observation_id":"97df0a50-7bce-426a-9cac-8c1f969def51","resolution":{"observed_at":"2026-07-31T23:37:27.154593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.238527Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.238527Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:29f8203cbd40fd14d7e551ccf0d01c9941bff4fe4974a60452d7c39db42d9837","observation_id":"e8ee2bf8-e75f-4b05-97fb-a46dfb59b3a4","resolution":{"observed_at":"2026-07-31T23:37:27.238527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.311524Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.311524Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:52cdc2333c3480850563bb03fa397748c7faa8348e8b174c7f506a313e80907a","observation_id":"695b4473-88bf-4eda-b3c2-2b2c611ba44f","resolution":{"observed_at":"2026-07-31T23:37:27.311524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.400762Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.400762Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:274bb475129fab5b53dfe85daba1e486c67d1cfd8941e4f5b62184bb97f73614","observation_id":"a7e4e934-3a42-44fc-9646-68719b9cec0e","resolution":{"observed_at":"2026-07-31T23:37:27.400762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.528569Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.528569Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:fd13637d4371512672949d71803200eaf7df55f1eb439cd5dd118c3daaac774f","observation_id":"6e5660e6-d437-4957-98e0-c4db4543d381","resolution":{"observed_at":"2026-07-31T23:37:27.528569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.662037Z","title":"IEEE Trans","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.662037Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:f2e856360603af636a820585e93c132673d8a01a329f526765bf68cc03652edb","observation_id":"b63b7579-be24-4be4-9050-48b12ea6285c","resolution":{"observed_at":"2026-07-31T23:37:27.662037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.814508Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.814508Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:5e11450006a1aa1902bc8ba32aabbbfbab7e87e1e26b117cb431e9b1d72fc994","observation_id":"f1174197-b27c-46cc-8744-bc0050030077","resolution":{"observed_at":"2026-07-31T23:37:27.814508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:27.993600Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:27.993600Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:f4bf862b4def452537376a60132af1f8af07e55801cd186b8b0bf4598f04cf94","observation_id":"191ba121-0199-4c80-b7da-1941bba6cd51","resolution":{"observed_at":"2026-07-31T23:37:27.993600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:28.168226Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:28.168226Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:cfd67ec360371de3954def4b1d06dad6101f68456b8fae5e627031ed7ace13fb","observation_id":"f071bade-763b-4e47-a19f-f00b0f91f60f","resolution":{"observed_at":"2026-07-31T23:37:28.168226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:28.342454Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:28.342454Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:2f71ae8f0081834ed76706a9673e6545a2fb062590f89825846cfddf19e1a467","observation_id":"2a1f6cf2-35d8-443a-bbab-a7597119c1f1","resolution":{"observed_at":"2026-07-31T23:37:28.342454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:28.517509Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:28.517509Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:9fa4d551b4ad45e9fa4c4deca0d95b9f5fee9001eae095a5b2c7a496eb2f5546","observation_id":"5b818648-238f-4af1-9467-79761e35dce8","resolution":{"observed_at":"2026-07-31T23:37:28.517509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.09956","last_updated":"2018-07-27T17:31:54Z","snapshot_observed_at":"2026-08-03T16:31:36.404755Z","submitted_at":"2018-07-26T04:57:43Z","title":"Pythia v0.1: the Winning Entry to the VQA Challenge 2018","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.09956","snapshot_observed_at":"2026-07-31T23:37:28.657528Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:28.657528Z"},"links":{"cited_paper":"/paper/1807.09956","citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:8ca1208bc8289b80fe248ec11bff9dda4548f83360f42e6ca7efa2607b2ade23","observation_id":"16de2528-297d-4381-a2f0-234fd3784af5","resolution":{"observed_at":"2026-07-31T23:37:28.657528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:28.795306Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:28.795306Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:6e516f78b59afaceaeaa854f0754614ae91985a59f85d0820f94e78c2508ad47","observation_id":"0f286f5d-21ac-4d99-ae80-928e242cdc48","resolution":{"observed_at":"2026-07-31T23:37:28.795306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:28.951138Z","title":"In: EMNLP","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:28.951138Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:eac33efdb713993c635745e1817493b87a5e3d9bdce9134003b2c4a7edf7f7b6","observation_id":"bdc9b4af-6d15-4e83-b88c-decac5dba1e3","resolution":{"observed_at":"2026-07-31T23:37:28.951138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.040613Z","title":"IEEE Signal Process","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.040613Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:c4dd99939866584f512d87f7b5bc5093f30d3dcc5eca677a5d692a475d342a94","observation_id":"d09e2262-2d08-4304-8719-c4c389807f27","resolution":{"observed_at":"2026-07-31T23:37:29.040613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.181375Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.181375Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:8dc565fcf8d298f62dda71973755f8183797647362ec918b93bd7bf3e6da3cfc","observation_id":"318966a5-61a4-4380-b737-3ca44ce5e559","resolution":{"observed_at":"2026-07-31T23:37:29.181375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.309676Z","title":"IEEE Signal Process","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.309676Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:84103e1a1edc4256cb075a89dfc8cb42a43c55d41ad60e66a27cbe5ba7b91530","observation_id":"43a35a7e-a8d5-45b3-95ff-30fac123ed9b","resolution":{"observed_at":"2026-07-31T23:37:29.309676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.445902Z","title":"NIPS30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.445902Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:90b69c4c3460e46d7583f03af9350bd63f5d9b00b72f1f172858c80acda18174","observation_id":"bf7b4b48-caf9-4712-b312-1bfcdaaf7407","resolution":{"observed_at":"2026-07-31T23:37:29.445902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.616592Z","title":"IEEE Signal Process","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.616592Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:15e029e39802d00140824cd66f5082f19077403b18dae32fc49852c3849118bb","observation_id":"1f90e392-35c1-45b9-a316-575130618ec8","resolution":{"observed_at":"2026-07-31T23:37:29.616592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.755299Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.755299Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:8f17ce09a5cd9768801538e24143e762cc5b381108cf16bd8a10412623d2248f","observation_id":"3a1f483f-6747-4880-9cbb-c33a89f63586","resolution":{"observed_at":"2026-07-31T23:37:29.755299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:29.918607Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:29.918607Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:0052b43a3179e25ae72a3ace81c535334a2a0aca9152318f53a90884251fcf77","observation_id":"fa7de954-9624-4c4f-afb9-cd7583a35ef0","resolution":{"observed_at":"2026-07-31T23:37:29.918607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.034498Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.034498Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:ff6ad94c7b314663fb71320f1769d8c387de4725cefba8c43a05554df8ad8e06","observation_id":"d4a2cd97-fd3c-4303-8e2c-4321528615fe","resolution":{"observed_at":"2026-07-31T23:37:30.034498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.135325Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.135325Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:5e89b999a407bda3d716aef0bdf807d1d45c18e0ac039d045692b9a1bdd179e1","observation_id":"659a79f3-6d52-4683-9b36-fdd69be04c11","resolution":{"observed_at":"2026-07-31T23:37:30.135325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05703","last_updated":"2022-06-21T03:15:27Z","snapshot_observed_at":"2026-07-06T13:30:28.485107Z","submitted_at":"2022-06-21T03:15:27Z","title":"Tell Me the Evidence? Dual Visual-Linguistic Interaction for Answer Grounding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05703","snapshot_observed_at":"2026-07-31T23:37:30.253357Z","title":"CoRR abs/2207.05703(2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.253357Z"},"links":{"cited_paper":"/paper/2207.05703","citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:368e65da071cd8ca713adb9131126bc6fbeef6e83195463d64f20edb6806448e","observation_id":"4e0454d2-a260-4975-b6e6-90fb45399fce","resolution":{"observed_at":"2026-07-31T23:37:30.253357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.363957Z","title":"Annual Conference on Neural Information Pro- cessing Systems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.363957Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:a71d6eb447248619a3dc8f4a9713074d27ab2c0cb38e00b4c148b533c3484f91","observation_id":"5fc888c5-150b-4be3-9b28-b4361d25df27","resolution":{"observed_at":"2026-07-31T23:37:30.363957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.513256Z","title":"Sensors20, 2281 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.513256Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:ad27f9aaffd882e3dc6cf418a20625da12b87fbea05a46a44151dbc2c9632a94","observation_id":"ef906170-b6a1-4716-9875-4697c1b61dbb","resolution":{"observed_at":"2026-07-31T23:37:30.513256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.588789Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.588789Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:b73d2928aaad5fecc632c7b3cd595417f5b3cc9f62a8cae7cf87b30f42ce663b","observation_id":"32f2e136-22c8-437d-bebd-3dca5a05aa0a","resolution":{"observed_at":"2026-07-31T23:37:30.588789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.733415Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.733415Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:1a0030a9a470d44a9a951e5e6d628f50a46fef7990095076acf73ffd964972c4","observation_id":"d7b93289-fda6-47fd-ac61-b92e90813d27","resolution":{"observed_at":"2026-07-31T23:37:30.733415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.847464Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.847464Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:ab31127b2f672382680055de5477c1fa4857dde4409219b0bb5ddfa182ec4bbc","observation_id":"4e0c266b-06a5-4677-8292-73a6306dcf43","resolution":{"observed_at":"2026-07-31T23:37:30.847464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:30.999531Z","title":"In: EMNLP","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:30.999531Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:d927a7bca5878b43a00c688db9070aacc72b0c349e6149d2434266a4deae9196","observation_id":"ade89df7-f9e6-4377-8eb5-152fc7dbd77c","resolution":{"observed_at":"2026-07-31T23:37:30.999531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.153526Z","title":"Annual Conference on Neural Information Processing Systems32(2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.153526Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:068a05c220b1b1430ccd4397bafaa6a631d2fdd6d943eb90b5f86f8abb1e5fb2","observation_id":"eb54863d-a078-4e27-a081-0d5c27ade739","resolution":{"observed_at":"2026-07-31T23:37:31.153526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.316475Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.316475Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:071a7a4e43fb784d1d89e5b8e92283453ecfb47e77d22ffab03b999077084ca7","observation_id":"0d4f8993-ba14-49c9-9819-13908622c6dc","resolution":{"observed_at":"2026-07-31T23:37:31.316475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.413633Z","title":"Annual Conference on Neural Information Processing Systems 201932(2019) 15","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.413633Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:418ec43e853f98a12e4e784b0c6748655b3703bdeea2cf1cca4549cf9e946cc5","observation_id":"8dbd4cd0-e8b9-418c-8e76-b7e7069286d6","resolution":{"observed_at":"2026-07-31T23:37:31.413633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.487939Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.487939Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:2d6197208d6d737fcf85f207385993d5db9eba4b13c733345be813c397202e6e","observation_id":"fd960f35-f50f-44a8-98cc-a5b771827722","resolution":{"observed_at":"2026-07-31T23:37:31.487939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.555166Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.555166Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:e7a64e110c208236542753fac7d298e79ebb2bfebb653f67e48d4a0629c9733b","observation_id":"2c4e1e6a-30aa-44e3-bf82-84c64bfd56e1","resolution":{"observed_at":"2026-07-31T23:37:31.555166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.595821Z","title":"In: IJCAI Int","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.595821Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:25d35bd691e119971a4f06141fc8a93c48c098b09f166b23b6377d89a5e338e2","observation_id":"46bda1ab-3b52-488c-a036-add6c3ed371a","resolution":{"observed_at":"2026-07-31T23:37:31.595821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.646473Z","title":"In: Proc","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.646473Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:ddccd0ea827ebe57a16566f5b92dd3929080fe48a69f0e1e06bb713846653897","observation_id":"9cd99046-f7be-4650-bcf1-b01f24431ae8","resolution":{"observed_at":"2026-07-31T23:37:31.646473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.713750Z","title":"Pattern Recognit","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.713750Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:c17b19dce0179e63305a4205727ea0c37409739ee6a2ea5a55c01e65ae77f6f7","observation_id":"2634d37a-e12b-4a86-b93c-0d72af51e8a2","resolution":{"observed_at":"2026-07-31T23:37:31.713750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T23:37:31.790580Z","title":"Annual Conference on Neural Information Processing Systems34, 27319–27330 (2021) 16","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-31T23:37:31.790580Z"},"links":{"citing_paper":"/paper/2607.23921"},"observation_digest":"sha256:f3bba491c66928cba46f13f1445452c5ff8b695063c50cdbc0eddf43736f7f76","observation_id":"fbeb6621-06a3-40af-9bda-fab377e9b4b3","resolution":{"observed_at":"2026-07-31T23:37:31.790580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23921","last_updated":"2026-07-27T01:26:15Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T21:57:32.918876Z","submitted_at":"2026-07-27T01:26:15Z","title":"DDVT: Dynamic Dual-level Vision Transformer Fusion Network for Answer Grounding in Visual Question Answering"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2607.23921."}