{"as_of":"2026-08-16T02:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb74c9385ea9a6d1661a8c8d244cf9164e986be11c8b431cfca06f8769d9d6ed","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:55:26.757084Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:22:25.662003Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:39:30.840356Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04107","snapshot_observed_at":"2026-08-14T12:22:25.662003Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-14T12:12:43.486524Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T12:22:25.662003Z"},"links":{"cited_paper":"/paper/1908.04107","citing_paper":"/paper/1908.07490"},"observation_digest":"sha256:fa524faee19240b12dcc7112ef46d2d4fa7404cdc606786dfd029fb7d4a8b1f9","observation_id":"e801b09e-8839-475b-bff5-3d70b5134379","resolution":{"observed_at":"2026-08-14T12:22:25.662003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"cited_work":{"arxiv_id":"1908.04107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04107","snapshot_observed_at":"2026-07-04T03:39:30.840356Z","title":"Multimodal unified attention networks for vision-and-language interactions,","venue":null,"work_id":"0b33c9b5-1894-495e-9263-f41e1a304e47","year":1908},"citing_paper":{"arxiv_id":"2605.29302","last_updated":"2026-05-28T03:33:07Z","snapshot_observed_at":"2026-08-16T01:04:48.930771Z","submitted_at":"2026-05-28T03:33:07Z","title":"ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:50:03.872247Z"},"links":{"cited_paper":"/paper/1908.04107","citing_paper":"/paper/2605.29302"},"observation_digest":"sha256:2427a11513ad755628b654da61a5a768210b9ddcc52b3575c51d5228bfa4ec6a","observation_id":"727d9b13-5265-4449-ad2c-613515bb85a3","resolution":{"observed_at":"2026-06-29T08:53:15.881026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"cited_work":{"arxiv_id":"1908.04107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04107","snapshot_observed_at":"2026-07-04T03:39:30.840356Z","title":"Multimodal unified attention networks for vision-and-language interactions,","venue":null,"work_id":"0b33c9b5-1894-495e-9263-f41e1a304e47","year":1908},"citing_paper":{"arxiv_id":"2606.20037","last_updated":"2026-06-18T10:11:14Z","snapshot_observed_at":"2026-08-14T06:06:56.304235Z","submitted_at":"2026-06-18T10:11:14Z","title":"Alzheimer's Disease Diagnosis using a Multimodal Approach with 3D MRI and PET","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:44:50.842397Z"},"links":{"cited_paper":"/paper/1908.04107","citing_paper":"/paper/2606.20037"},"observation_digest":"sha256:3add86538b18ece3461025430d6bfe2f16918aa5ca03d523584fdb0fe59a95e6","observation_id":"419bf000-2dcf-42f0-a8e1-6427010faba4","resolution":{"observed_at":"2026-07-04T03:39:30.843132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.04107/citation-record","integrity":"/paper/1908.04107/integrity","json":"/paper/1908.04107/citation-record.json","paper":"/paper/1908.04107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:28.003318Z","title":"Multimodal deep network embedding with integrated structure and attribute information,","venue":null,"work_id":"f9b797f0-9dfe-4168-bc74-4e9e92d14c70","year":2019},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.405870Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:37839150f2c8eeb8e3614da35098bcd7617b23e05614c4f23f0e8ff552aa8c5e","observation_id":"e9783f87-858d-4eb4-812b-65d09ad8df0b","resolution":{"observed_at":"2026-08-14T13:55:28.008716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.986490Z","title":"Discrim- inative coupled dictionary hashing for fast cross-media retrieval,","venue":null,"work_id":"dae60276-9665-46d9-8bc7-48f5056c0d1e","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.411450Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:bc0b294bbe90be080545bfadf9a8c21a10976c31dd2a72242b437795dbc79283","observation_id":"70e901c3-cc0d-40bc-a28c-5f92950e3cc7","resolution":{"observed_at":"2026-08-14T13:55:27.991927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.969393Z","title":"Shared predictive cross-modal deep quantization,","venue":null,"work_id":"f71de6ea-b524-4b73-8b31-d463da3eed9a","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.416382Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2bc397cbe09bd7b34014682fea6bada25346d1ccb21d07b3df428b59deaa39da","observation_id":"f6859418-36ed-429d-b6ab-d99ffa1366d7","resolution":{"observed_at":"2026-08-14T13:55:27.974963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.952274Z","title":"Show, attend and tell: Neural image caption generation with visual attention","venue":null,"work_id":"226f4072-3ae6-483a-b7fe-caa310b38e94","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.422009Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:4371de164beff97e96eee92d5f31f0503e6901bb8b43e2901d6430df2b7f0d5c","observation_id":"8b5b2dbe-a68f-456a-b955-3ba975161532","resolution":{"observed_at":"2026-08-14T13:55:27.957946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.935853Z","title":"From deterministic to generative: multi-modal stochastic rnns for video cap- tioning,","venue":null,"work_id":"84bca54c-fc43-4b00-814f-c373df0437d3","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.427042Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:194138ff1e0582ef5eadf7edad8b4cce4f17e3aa31bef44a1dd1f5a850e6e94b","observation_id":"3c17dd8c-eeeb-4498-98a4-fcdeaf39fe57","resolution":{"observed_at":"2026-08-14T13:55:27.940902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.918728Z","title":"Vqa: Visual question answering,","venue":null,"work_id":"9f7be5ad-129a-446d-963a-db826f768356","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.432661Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:385f7ffaff2be53ea37fffd655a8a9a19c12b4ba4f00f94a8f1ee80c95c7f5a1","observation_id":"24dfb2cb-350e-48d1-8b1c-330066e7bc33","resolution":{"observed_at":"2026-08-14T13:55:27.923633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.902523Z","title":"Ground- ing of textual phrases in images by reconstruction,","venue":null,"work_id":"451f2c19-94d4-4f4a-9f7a-d7763f3da53a","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.439241Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:17375f1bccf8d3222949f34cd9ab9496c69402438e29d541fa65e9c1b1c6efd9","observation_id":"a712be8a-2deb-440c-8c4c-31ffb95e8ab3","resolution":{"observed_at":"2026-08-14T13:55:27.907818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T13:55:26.444239Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.444239Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2465ce23426af7e53a6082e93e5a28c48b423ac107b3d89892e07739859f5312","observation_id":"8391a958-710e-4be9-8f55-50c76d8493db","resolution":{"observed_at":"2026-08-14T13:55:26.444239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.886492Z","title":"Recurrent models of visual attention,","venue":null,"work_id":"204e170e-c3e6-4602-be6f-e196b0014c33","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.449809Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:f097febd5badce447be13dbb38169b13929be70f750711e926a5148a3eee1e44","observation_id":"d9c99a69-6c26-4d21-9df4-79d3556906e4","resolution":{"observed_at":"2026-08-14T13:55:27.891612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.870875Z","title":"Draw: A recurrent neural network for image generation,","venue":null,"work_id":"16e71964-cc13-49d9-ad62-41def4e7f046","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.454446Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:c4916237cf19351d123e45a72c991a4955a00832ce9a3e3fd27ea556baaee282","observation_id":"76a48858-2880-49ab-904d-fddcbfed84a8","resolution":{"observed_at":"2026-08-14T13:55:27.875785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.854412Z","title":"Attention to scale: Scale-aware semantic image segmentation,","venue":null,"work_id":"030a1516-e572-4852-bb40-29229214c2b1","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.459270Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:5df742b79d6c23c7ff2bfe4b2959d3c0590bbf66df603c57e920fc487e81e113","observation_id":"025187f2-3715-4aa0-b7cb-2d689b66bb17","resolution":{"observed_at":"2026-08-14T13:55:27.859785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.04025","last_updated":"2015-09-20T08:25:52Z","snapshot_observed_at":"2026-08-14T22:36:17.759859Z","submitted_at":"2015-08-17T13:43:19Z","title":"Effective Approaches to Attention-based Neural Machine Translation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.04025","snapshot_observed_at":"2026-08-14T13:55:26.465116Z","title":"Effective ap- proaches to attention-based neural machine translation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.465116Z"},"links":{"cited_paper":"/paper/1508.04025","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:d1d274c89fbc5e42fcbed20ff7561a7a9fd04cfb1b6748bc17448d8a25d63304","observation_id":"cc9ad11a-415f-4503-a2dd-4b836808f174","resolution":{"observed_at":"2026-08-14T13:55:26.465116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.836196Z","title":"Deep biafﬁne attention for neural dependency parsing,","venue":null,"work_id":"3b5d11a1-7e26-4de9-abcf-12f0a0cef09f","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.470402Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:76caa6ee30745495849926af3044888a71e93f617a32815e19956dd312fb2fbd","observation_id":"7b80ff55-9a49-41b6-9d8f-8b089392bd47","resolution":{"observed_at":"2026-08-14T13:55:27.842087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.00685","last_updated":"2015-09-03T19:55:45Z","snapshot_observed_at":"2026-08-14T22:34:07.154893Z","submitted_at":"2015-09-02T13:20:40Z","title":"A Neural Attention Model for Abstractive Sentence Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.00685","snapshot_observed_at":"2026-08-14T13:55:26.475737Z","title":"A neural attention model for abstractive sentence summarization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.475737Z"},"links":{"cited_paper":"/paper/1509.00685","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:23e6de7b566a433e9f5b8ab2fe9f6a673c58e07b2c34301eaaef671e2fb71bc7","observation_id":"83ed30e9-de93-4058-95d8-f2258e795eb8","resolution":{"observed_at":"2026-08-14T13:55:26.475737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.819049Z","title":"Stacked attention net- works for image question answering,","venue":null,"work_id":"5d7c61cd-aa6f-482d-a7c8-a6b495bcb320","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.481939Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:527f04eed28655c9928c2ce930309917102f1bc57d9a4ff800a70348ae28b1dd","observation_id":"5ead648f-1b4b-4cdd-b058-1cc5db435c55","resolution":{"observed_at":"2026-08-14T13:55:27.824687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.801474Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding,","venue":null,"work_id":"98c83eaa-09f7-4e27-b91d-487c0752904d","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.487055Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b690bf813c1f22dee84f5b6c527468b129eba92fb8c82edb9ff4efb857021405","observation_id":"24d92376-f32e-44b1-9559-3cda4b74118f","resolution":{"observed_at":"2026-08-14T13:55:27.807046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.783864Z","title":"Hierarchical question-image co-attention for visual question answering,","venue":null,"work_id":"4fb826a5-8143-4690-959f-5a0eab2b8a6b","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.491852Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2f2ed0d26d0f23547f8e9de441e1729358866e92dd89e6a934b3d41bdd383ec8","observation_id":"93828af5-dd98-46b0-99cb-bde6d74cd5c6","resolution":{"observed_at":"2026-08-14T13:55:27.790038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.766205Z","title":"Multi-modal factorized bilinear pooling with co-attention learning for visual question answering,","venue":null,"work_id":"be26206b-fe0c-429c-af60-f6ee34cbd8ee","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.496532Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:5e1a7ff464a28c20787f917cca900dffafb26031d1acc91faf03dc942e1f688c","observation_id":"79de54b6-0d38-4847-8c0d-9db88de40266","resolution":{"observed_at":"2026-08-14T13:55:27.771611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.747895Z","title":"Bilinear attention networks,","venue":null,"work_id":"71437fce-4322-4835-9d77-9e44cb15f216","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.501649Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:40a2d236487b0dc9d8c231f470088e00e6975da9db5ff0c7ca352d4e4bc78184","observation_id":"2217e021-5f31-4498-b185-6e8a8e8ec933","resolution":{"observed_at":"2026-08-14T13:55:27.754499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.725570Z","title":"Improved fusion of visual and language representations by dense symmetric co-attention for visual question an- swering,","venue":null,"work_id":"9c4cd080-cb35-4d73-bc65-cf4a6239867f","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.506742Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b95f91fc0b1fdc8408928aba8ad54bdbcbe4eecac025263f9e47dcb4ed14960f","observation_id":"b0fe8842-fcf6-4eea-ba58-794f04ddea9e","resolution":{"observed_at":"2026-08-14T13:55:27.731604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.705207Z","title":"Attention is all you need,","venue":null,"work_id":"268546fb-bb24-455c-ba81-9b34611da4e1","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.513064Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:1839b453cf411072f469a3b64725978fc43c9cd38e10f51d009973bc374eeeb3","observation_id":"8d40dc6e-7186-4ff5-bb03-b5adeb46d1d9","resolution":{"observed_at":"2026-08-14T13:55:27.710634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T13:55:26.518164Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.518164Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:5ea3025ef2e4c647a7bff7ae340b025cefb37fd47cfe229118a08a97eae98e3e","observation_id":"e4dea28e-54d3-44f4-9553-ddbda29ecfb3","resolution":{"observed_at":"2026-08-14T13:55:26.518164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.687301Z","title":"Non-local neural net- works,","venue":null,"work_id":"b73d8ae0-4a4b-42b7-89c2-6f4eded62f79","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.523097Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:9dfc9c715970d7b538b8cef0d90506c36a38a25c990af1b9c06a3d72d5f0de3f","observation_id":"c50333a2-4c3f-4f51-8dc1-1ac7acbcc3b1","resolution":{"observed_at":"2026-08-14T13:55:27.692996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.667826Z","title":"Relation networks for object detection,","venue":null,"work_id":"c49636f7-5cf6-45d2-b6cc-e3a653879a95","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.527825Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0185c09f45930d293b9da8abe6889573167298b91caf772a91845eda968d2cd6","observation_id":"4d6962c0-7f30-4f83-80b5-ac0d6d0eff6b","resolution":{"observed_at":"2026-08-14T13:55:27.674066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.650566Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"20e6193f-d400-42c4-b6a7-b3e544a19242","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.532554Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:fd5237e07bea411ff57b0af0d50516ace062acdf8f6beeb2290d2e9723c2a39d","observation_id":"c4fdcde9-6287-4302-8336-8c7a46ddfa72","resolution":{"observed_at":"2026-08-14T13:55:27.655703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.632775Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning,","venue":null,"work_id":"dccd93a4-50ee-467b-99b2-94e17b22090b","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.538915Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:3147595d5c57b12a0d1a054d651112bcecd6d0305548afd2eed994b6b60a87e7","observation_id":"51ff0f0b-5de1-4252-830d-3b16362c1344","resolution":{"observed_at":"2026-08-14T13:55:27.638537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:26.543907Z","title":"Referitgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.543907Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:451b7853a14b84f72fae9462bd71aa90adad864f5b741ee38d631c70640c122d","observation_id":"6e577d9d-4dcb-4137-b9d6-1b817db4de5c","resolution":{"observed_at":"2026-08-14T13:55:26.543907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.604563Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":"40ba735e-e103-45ea-8afb-00a52e5821a1","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.549092Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:00fdde60ef5dae35b7d2a246ab12e33c00e5b4f430e8a28743eb18cfbe5b4a86","observation_id":"f30f20a7-9f63-40b1-b93a-9a8f24d590bd","resolution":{"observed_at":"2026-08-14T13:55:27.610143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02167","last_updated":"2015-12-15T05:17:49Z","snapshot_observed_at":"2026-08-14T22:19:39.710069Z","submitted_at":"2015-12-07T19:00:54Z","title":"Simple Baseline for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02167","snapshot_observed_at":"2026-08-14T13:55:26.554516Z","title":"Simple base- line for visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.554516Z"},"links":{"cited_paper":"/paper/1512.02167","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:78252ca932620a50d6cb49d63ba558bce48131fea76ebdd076d417d3a08d2b3d","observation_id":"6f797fb1-9b33-429f-a636-b0831eafd354","resolution":{"observed_at":"2026-08-14T13:55:26.554516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.587187Z","title":"Hadamard Product for Low-rank Bilinear Pooling,","venue":null,"work_id":"83953ed9-a547-4cbd-b65e-d4e8a60d4da1","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.559720Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2c3ffe3498b56ac7ef2c5a3f01dc7e7e82df9df7bd2d597358f679c00f8890af","observation_id":"3d147a9b-af1f-4fb7-82c0-5b22177aadf3","resolution":{"observed_at":"2026-08-14T13:55:27.592926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.566358Z","title":"Mutan: Multi- modal tucker fusion for visual question answering,","venue":null,"work_id":"01534947-59be-4b88-8e60-30f90061fd25","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.564802Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:6a15f197a59252cec34bee651207b79dfc0ce3efd9a254bc77d775f6f9ba302b","observation_id":"6d9aaaf4-c355-4c10-ab2c-6d3ebe5326e1","resolution":{"observed_at":"2026-08-14T13:55:27.573058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05960","last_updated":"2016-04-03T22:47:38Z","snapshot_observed_at":"2026-08-14T22:22:20.577801Z","submitted_at":"2015-11-18T20:59:50Z","title":"ABC-CNN: An Attention Based Convolutional Neural Network for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05960","snapshot_observed_at":"2026-08-14T13:55:26.570303Z","title":"Abc- cnn: An attention based convolutional neural network for visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.570303Z"},"links":{"cited_paper":"/paper/1511.05960","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:80487fbd53d6107c36c0eb742e350c9611d1acd2345fb95ca497f9a49424ec37","observation_id":"6d91550f-15d5-4026-88b0-8a0b3148f76a","resolution":{"observed_at":"2026-08-14T13:55:26.570303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01485","last_updated":"2016-04-06T05:16:10Z","snapshot_observed_at":"2026-08-14T22:02:54.812748Z","submitted_at":"2016-04-06T05:16:10Z","title":"A Focused Dynamic Attention Model for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01485","snapshot_observed_at":"2026-08-14T13:55:26.575466Z","title":"A focused dynamic attention model for visual question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.575466Z"},"links":{"cited_paper":"/paper/1604.01485","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:5dd530e9706f6767e814ae1e92ed42719677f03886f399325471c1466926527b","observation_id":"109b5f20-38ee-426c-8fee-c9af7d2abde6","resolution":{"observed_at":"2026-08-14T13:55:26.575466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.545934Z","title":"Where to look: Focus regions for visual question answering,","venue":null,"work_id":"4edfcc2c-ca54-432f-9fb9-10b2526ba1b7","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.580811Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:1264acbe8cdc29246a3b35299cd6105d4331927a5c1126dbb13a7358e1628468","observation_id":"bb9f24d8-e8e2-4819-8e40-6397ae70a6fa","resolution":{"observed_at":"2026-08-14T13:55:27.553523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.525582Z","title":"Beyond bilinear: Generalized multi-modal factorized high-order pooling for visual question answer- ing,","venue":null,"work_id":"d2667cce-55b4-4b3c-a1eb-0d4bf206abb7","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.586427Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:92ba661003a507cfe0fa98fe1917a7765351a20f35e6c00be5eb7e4ddb079882","observation_id":"fb59863f-722b-4c6c-be73-b56a7b16b79a","resolution":{"observed_at":"2026-08-14T13:55:27.533495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.494304Z","title":"A joint speaker-listener- reinforcer model for referring expressions,","venue":null,"work_id":"1f52e9f5-11ce-4c63-a396-83bb386408ac","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.591097Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:00fd43c4210334698fdb3839d2cd772ad21d607b926164375d33ccb5d82e087f","observation_id":"960371a1-dd9e-41eb-aca8-324d0c3487c9","resolution":{"observed_at":"2026-08-14T13:55:27.501146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.474384Z","title":"Edge boxes: Locating object proposals from edges,","venue":null,"work_id":"ffdec30d-d900-4823-b587-7b828d25cfa9","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.595646Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:575eda009b94f19ce479e6859217b2707a33e3b0e3ac5f0beea8e8f36c80eb48","observation_id":"fd8e2279-07a3-4bb7-a782-0b2172e20416","resolution":{"observed_at":"2026-08-14T13:55:27.481300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.456782Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"d9a239ff-1b28-400b-b835-8e59cce4d09c","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.600632Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:a22b7f1b9efa81bf78411600230291dfd40e14b20ac4b1b77f5c1d3d0af8ecf8","observation_id":"eaaee506-d5f9-455d-a353-4f846e9de4db","resolution":{"observed_at":"2026-08-14T13:55:27.462346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.438851Z","title":"Rethinking diversiﬁed and discriminative proposal generation for visual grounding,","venue":null,"work_id":"64267a88-f9c5-416c-affe-daf9df806626","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.606994Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:c1bbb5619c2e77b367d0e8e48de38081e3623c073624b45100b42bde54f24364","observation_id":"848abf49-fe14-48b4-8ed8-c3d6ab67e6a9","resolution":{"observed_at":"2026-08-14T13:55:27.444232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.420708Z","title":"Mattnet: Modular attention network for referring expression comprehension,","venue":null,"work_id":"1aa62531-bfe2-4090-ad76-ea4c2808489e","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.611863Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0d8cdb9404eac64bfe4b52d49d752f1fd16bdaf7adafcc1fb513fdeff142b832","observation_id":"09816d98-c73d-422d-96a0-3633ac698948","resolution":{"observed_at":"2026-08-14T13:55:27.426916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.402466Z","title":"Parallel attention: A uniﬁed framework for visual object discovery through dialogs and queries,","venue":null,"work_id":"2e439e99-35c7-4a4a-a9a3-0df96297d28c","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.616740Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0511b1911ca145c1def0dc11cf298811f12e0513b9aa5c1d738173d9da5eb491","observation_id":"23a1ab66-d516-47ae-a85e-05211370ff20","resolution":{"observed_at":"2026-08-14T13:55:27.407914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.385072Z","title":"Visual grounding via accumulated attention,","venue":null,"work_id":"c8dc0c09-f24d-41c0-b4de-e2165798ae5a","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.622160Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:852433d98e80ac57c0169a01b031c1f8084268d87ede8db0b8f18bf7c5483aa6","observation_id":"9aee77a4-0b7a-4c8d-8d49-bcb2a792117e","resolution":{"observed_at":"2026-08-14T13:55:27.390683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.368205Z","title":"Be- yond rnns: Positional self-attention with co-attention for video question answering,","venue":null,"work_id":"f0b8b5e8-a4c8-4b5b-af57-22e737130fff","year":2019},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.627435Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:5672f95b658a577ad336ab9936614542b672e1ab7396716bb4933a7bfcd42cb9","observation_id":"619e07f7-7290-4b83-a249-6b0e2840a833","resolution":{"observed_at":"2026-08-14T13:55:27.374092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05252","last_updated":"2019-08-23T19:25:25Z","snapshot_observed_at":"2026-08-15T20:19:06.192027Z","submitted_at":"2018-12-13T03:41:18Z","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","version":4},"cited_work":{"arxiv_id":"1812.05252","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.05252","snapshot_observed_at":"2026-08-14T13:55:26.895921Z","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","venue":"cs.CV","work_id":"d9c3b697-eb0b-4cdc-a5b9-17e513e2e4ee","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.632542Z"},"links":{"cited_paper":"/paper/1812.05252","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:173e520bce6748ba5e7dc0a8416f8dfb18eeca0f61f584f7ec197e5c8816e069","observation_id":"b487a113-c177-42c6-920b-73ddb6fbff3b","resolution":{"observed_at":"2026-08-14T13:55:26.904087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.352164Z","title":"Improving language understanding by generative pre-training,","venue":null,"work_id":"e4a32c40-b48c-451d-8b09-0fd9f1a9ef35","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.638333Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2f530e2d7afde45a71a709bad62794c0d22d9b35e502dc95361a7b680a050279","observation_id":"8e1ba17d-fc08-41e7-b6a5-609798755313","resolution":{"observed_at":"2026-08-14T13:55:27.357158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.335412Z","title":"Factorized bilinear models for image recognition,","venue":null,"work_id":"62cd8d11-bcab-4234-845a-8335fe048726","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.643030Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:20049268ac523c21dab856a48f51d34c39c5b15921ed31153236e4d044eaaf43","observation_id":"56e1d26b-e8d1-4ce0-84c8-e33d878dfbfc","resolution":{"observed_at":"2026-08-14T13:55:27.340667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-14T13:55:26.647648Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.647648Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:417e9ffc9d1ffd2bc88b70d31f93cd146a18f594b05f26daca5bb995565ea543","observation_id":"7c91eab1-0e15-4cd8-a276-5bb7285988bc","resolution":{"observed_at":"2026-08-14T13:55:26.647648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.316352Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"e9e05c1c-1d91-470b-a850-88a80a86f046","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.652624Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:e1a21119e455f16f17f257c2503c979a2125d4f314d0d328f3817f50d525662d","observation_id":"9c91039a-5194-42a8-a217-dc1fad636ef9","resolution":{"observed_at":"2026-08-14T13:55:27.322774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:26.657304Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.657304Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:e1cff225aa4beb1d9498b3450ed5f7abfb2003dbb6521da9a6761ff26dfc6c89","observation_id":"ca5f6cfb-f77c-4d5d-aa6c-22c2b451f2d7","resolution":{"observed_at":"2026-08-14T13:55:26.657304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.284782Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"ba8bea92-7294-478d-be0f-7d90cc5f26d5","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.662045Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:ef44a3c1c936b8e5f4a75742083f599d786b9ce8c3a355a8c89adceb56a4ca7c","observation_id":"e0c6bc30-b4b8-4e0b-a17d-62af13d28368","resolution":{"observed_at":"2026-08-14T13:55:27.290618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02711","last_updated":"2017-08-09T04:19:42Z","snapshot_observed_at":"2026-08-14T20:42:26.185801Z","submitted_at":"2017-08-09T04:19:42Z","title":"Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02711","snapshot_observed_at":"2026-08-14T13:55:26.666553Z","title":"Tips and tricks for visual question answering: Learnings from the 2017 challenge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.666553Z"},"links":{"cited_paper":"/paper/1708.02711","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:7b2aacaf212fc40587814aa6455b39cf76bd707c34e09387db20e37a8b8e4e78","observation_id":"a01fe0f2-a863-4ebd-9edd-2c4db59909f0","resolution":{"observed_at":"2026-08-14T13:55:26.666553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.263466Z","title":"Fast r-cnn,","venue":null,"work_id":"22e9e64d-6a4a-4a9c-9164-4e72cfba1930","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.671520Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:dc5d6b0e9dc7fa3e8bcecca30af14a8056678e8f314c8485c35818f3bc46abe9","observation_id":"9f73072f-c372-4c77-9609-1f8bc3152ae5","resolution":{"observed_at":"2026-08-14T13:55:27.271577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.245495Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"6c9e6e5e-9e72-4428-aa73-6d71fae329cb","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.676051Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:9d4001cdd75b213f168e9180305d8036c4d1656941cedb62a0d567df031e5bcf","observation_id":"59e2ed05-d7a5-4aba-9e46-0538c12b7244","resolution":{"observed_at":"2026-08-14T13:55:27.251132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T13:55:26.680958Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.680958Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:c225f60499919ea5717a424b0ac33f5ec6d383efc280ecb0f293560b06f1f4ce","observation_id":"5617209c-ca98-4c12-938a-ea8847087550","resolution":{"observed_at":"2026-08-14T13:55:26.680958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.226843Z","title":"Faster r-cnn: Towards real- time object detection with region proposal networks,","venue":null,"work_id":"21872ba7-70f8-4dc2-b204-0b84de7c1079","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.685644Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:3b1a76c5656558ca34739e5f20d106a0f0e1e3223d77be445fc5c58f79018bc4","observation_id":"ccee27c2-86b0-4da9-b579-2767d2a9f8b1","resolution":{"observed_at":"2026-08-14T13:55:27.233090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-08-14T22:09:05.495219Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-14T13:55:26.690283Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.690283Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:fb6993560cb9a512da9f44be65d34665c0aff12280d16d8809f67f5ae85af30f","observation_id":"75b9dd9d-9b4e-436b-a1c0-6d5dae966155","resolution":{"observed_at":"2026-08-14T13:55:26.690283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03067","last_updated":"2018-04-24T10:25:07Z","snapshot_observed_at":"2026-08-14T19:38:12.966052Z","submitted_at":"2018-03-08T12:37:14Z","title":"Compositional Attention Networks for Machine Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03067","snapshot_observed_at":"2026-08-14T13:55:26.694870Z","title":"Compositional attention networks for machine reasoning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.694870Z"},"links":{"cited_paper":"/paper/1803.03067","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:ac23bbf2e9b30aa0aa11e60606c37edcaa641a260af41a34e9951566a88af7bc","observation_id":"a5d1f2f3-65f2-427c-a4ef-e1246434acb0","resolution":{"observed_at":"2026-08-14T13:55:26.694870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.209088Z","title":"Mask r-cnn,","venue":null,"work_id":"d40b57cd-7205-43b7-9c2d-5fe82d6d9b0d","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.699662Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:a54b12a06d53d14c39cca80e902c263c38ca6f890ef875665801d164a2b3b16e","observation_id":"4b37c205-f5f0-4f0b-87de-189dacaa1a74","resolution":{"observed_at":"2026-08-14T13:55:27.214156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.192550Z","title":"Modeling context in referring expressions,","venue":null,"work_id":"e010b573-ee4e-4d6c-839a-32a3ac0ee2ce","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.704689Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:99a14211b6c8a250143499e0764cc036cad17fd11edfabd33daad17232f0a1f4","observation_id":"dc40e05e-a0b8-42f8-8ecb-56e048881c88","resolution":{"observed_at":"2026-08-14T13:55:27.197496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.176890Z","title":"Learning to count objects in natural images for visual question answering,","venue":null,"work_id":"b17af37d-6e69-4c0b-b716-342ec2df19ef","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.709730Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:6aaa78599c0853740e66db094373c664e1bb098297b9c05a15c208174fdb3ded","observation_id":"1cfe4aa3-3e50-4d06-89ae-46bce9abedf8","resolution":{"observed_at":"2026-08-14T13:55:27.182018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.161021Z","title":"Deep modular co- attention networks for visual question answering,","venue":null,"work_id":"583bc6d2-2734-426e-bbe2-e504a67792e8","year":2019},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.714365Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:686437a6cf08b394f30eb3e7f0eac3092021deac9543025f7134be5a7ae8f308","observation_id":"5513a91a-6151-457e-b88c-d5b26a4e0e03","resolution":{"observed_at":"2026-08-14T13:55:27.166305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.142769Z","title":"Learning to reason: End-to-end module networks for visual question answering,","venue":null,"work_id":"193b2e18-2c3e-4760-befa-040b800b33e8","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.719073Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:67a331fb0123b0b0dddcd355e74f714f9a85408845b5e0f616b73d252ba2a1a8","observation_id":"f5eae359-dab9-4bab-b5de-cd6fe415a587","resolution":{"observed_at":"2026-08-14T13:55:27.148630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:26.723698Z","title":"A simple neural network module for relational reasoning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.723698Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:009bdeec43511d190fe85ed60c4eb476907c3b9f3a2eccd44740bd53423967df","observation_id":"a20f6b27-33c3-4b36-a99a-bdcd5ada6b5e","resolution":{"observed_at":"2026-08-14T13:55:26.723698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.114390Z","title":"Inferring and executing programs for visual reasoning,","venue":null,"work_id":"82696139-bc43-4773-9f25-d3852572b11c","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.728584Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:a1d337998223eda2abd2a81f71bd7165cfd11dc59d4e5ea4e4d5c192859762c1","observation_id":"263fe6b5-0431-4cd3-9e01-869ad04fabc7","resolution":{"observed_at":"2026-08-14T13:55:27.120140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.097433Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"c5962a7f-952d-4aa6-8959-429f6d78221b","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.733087Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b11683c25445003bdd6b40b650328075e79bc40b9f2cb054f4b0a9389db71524","observation_id":"3982b222-2158-42f5-9eaa-2b9aa7fdce41","resolution":{"observed_at":"2026-08-14T13:55:27.102590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.081519Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":"54e1ff77-be93-48e5-b8eb-edd516d0ae95","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.737651Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:02f6b5fe3657fd6f277afdcbdb54172cca9284f326524e95960725178952a915","observation_id":"fe3807c5-9063-4fe5-b5ee-88a6eb62baa5","resolution":{"observed_at":"2026-08-14T13:55:27.086625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T13:55:26.742259Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.742259Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:e592573abd09c71af8f0451d8556d0cffb7afb3d1e3ebd08d146da0eee04d92a","observation_id":"cb4a4a63-7375-47e7-9e60-4868dba22dee","resolution":{"observed_at":"2026-08-14T13:55:26.742259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.063706Z","title":"Referring expression generation and comprehension via attributes,","venue":null,"work_id":"c8d0af14-8209-4e20-b0b1-2061080f643f","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.747240Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0fe5c5430c20193ae16d2c55b02ff758092c6fced7887bd9f8c3f37b88b042c1","observation_id":"113d83f9-c6f5-44b9-9627-4a54f7bf7bbf","resolution":{"observed_at":"2026-08-14T13:55:27.069979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.047493Z","title":"Modeling relationships in referential expressions with compositional modular networks,","venue":null,"work_id":"bf45a569-3598-455e-a689-a9d73f47262c","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.752432Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:504ba6f1846ba940239c738d3ea728245948a67f1ccac8de4f17ade3a595b445","observation_id":"056540f1-7b59-45d8-bbe2-4ec13864cf9e","resolution":{"observed_at":"2026-08-14T13:55:27.052588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.030425Z","title":"Grounding referring expressions in images by variational context,","venue":null,"work_id":"5a720427-6ef6-486e-9b5e-8f6a5e098b7d","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.757084Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:3edbbdc7ba89094430524d1631cdb9218422a2611e47d7b14912fa7129bcb087","observation_id":"ce81e276-226a-4c4f-9822-e6f343ce6cf9","resolution":{"observed_at":"2026-08-14T13:55:27.036101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T01:02:42.653950Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 3 inbound Pith citation observations for arXiv:1908.04107."}