III: Small: Datalog with Aggregates: Complexity, Optimization, Evaluation
III:小:带有聚合的数据记录:复杂性、优化、评估
基本信息
- 批准号:2314527
- 负责人:
- 金额:$ 60万
- 依托单位:
- 依托单位国家:美国
- 项目类别:Standard Grant
- 财政年份:2023
- 资助国家:美国
- 起止时间:2023-09-01 至 2026-08-31
- 项目状态:未结题
- 来源:
- 关键词:
项目摘要
Computer applications are increasingly data driven. They rely on processing large datasets from which they learn models that drive the application. Machine learning on massive datasets is routinely done today by leading software companies and academic institutions, however, using ML tools effectively is still an obscure practice mostly done by ML experts. Future applications of ML will be developed by data scientists, who need friendly tools to help them manage data of massive scale. The goal of this project is to lay the foundations for building such tools. It extends relational databases that are already widely used today with the ability to perform iterations that are indispensable in machine learning applications.Relational databases are some of the best engineered systems to date, and they are used routinely to process datasets from small to massive. But the query language that they support, SQL, is only optimized for queries that do not require iteration. Yet virtually all modern data science tasks require some form of iteration. As SQL does not support iteration well, data scientists do not use SQL for most of their needs. Datalog is a query language proposed decades ago, precisely to support iteration, however, datalog does not support aggregates, such as summation or counting, which are indispensable in any data science task. This project overcomes the fundamental roadblock that prevents datalog from supporting aggregates by using a new abstraction, where standard relations are extended to relations over a semiring. This modification allows all traditional SQL optimizations to be carried over to datalog, and at the same time it allows recursion and aggregates to be interleaved freely.This award reflects NSF's statutory mission and has been deemed worthy of support through evaluation using the Foundation's intellectual merit and broader impacts review criteria.
计算机应用程序越来越多地驱动数据。他们依靠处理大型数据集,从中学习驱动应用程序的模型。领先的软件公司和学术机构通常会在大规模数据集上进行机器学习,但是,使用ML工具有效地是ML专家所做的晦涩的实践。 ML的未来应用将由数据科学家开发,他们需要友好的工具来帮助他们管理大规模数据。该项目的目的是为建立此类工具奠定基础。它扩展了当今已经广泛使用的关系数据库,能够执行机器学习应用程序中必不可少的迭代。划分数据库是迄今为止最好的工程系统,并且通常将它们用于处理从小到大型的数据集。但是,他们支持的查询语言SQL仅针对不需要迭代的查询进行了优化。然而,几乎所有现代数据科学任务都需要某种形式的迭代。由于SQL不能很好地支持迭代,因此数据科学家并未将SQL用于大多数需求。 Datalog是几十年前提出的一种查询语言,恰恰是为了支持迭代,但是,DataLog不支持汇总(例如求和或计数),这在任何数据科学任务中都是必不可少的。该项目克服了基本的障碍,该障碍通过使用新的抽象来防止数据支持支持骨料,在该抽象中,标准关系扩展到半度性的关系。 这种修改使所有传统的SQL优化都可以传递到DataLog,同时允许递归和骨料自由交织。该奖项反映了NSF的法定任务,并被认为是值得通过基金会的知识分子优点和更广泛影响的审查标准来通过评估来获得支持的。
项目成果
期刊论文数量(0)
专著数量(0)
科研奖励数量(0)
会议论文数量(0)
专利数量(0)
数据更新时间:{{ journalArticles.updateTime }}
{{
item.title }}
{{ item.translation_title }}
- DOI:
{{ item.doi }} - 发表时间:
{{ item.publish_year }} - 期刊:
- 影响因子:{{ item.factor }}
- 作者:
{{ item.authors }} - 通讯作者:
{{ item.author }}
数据更新时间:{{ journalArticles.updateTime }}
{{ item.title }}
- 作者:
{{ item.author }}
数据更新时间:{{ monograph.updateTime }}
{{ item.title }}
- 作者:
{{ item.author }}
数据更新时间:{{ sciAawards.updateTime }}
{{ item.title }}
- 作者:
{{ item.author }}
数据更新时间:{{ conferencePapers.updateTime }}
{{ item.title }}
- 作者:
{{ item.author }}
数据更新时间:{{ patent.updateTime }}
Dan Suciu其他文献
SlimShot: In-Database Probabilistic Inference for Knowledge Bases
SlimShot:知识库的数据库内概率推理
- DOI:
- 发表时间:
2016 - 期刊:
- 影响因子:2.5
- 作者:
Eric Gribkoff;Dan Suciu - 通讯作者:
Dan Suciu
A Dichotomy for the Generalized Model Counting Problem for Unions of Conjunctive Queries
连接查询并集广义模型计数问题的二分法
- DOI:
- 发表时间:
2020 - 期刊:
- 影响因子:0
- 作者:
Batya Kenig;Dan Suciu - 通讯作者:
Dan Suciu
Cytosolic protein ubiquitylation in normal and endotoxin stimulated human peripheral blood mononuclear cells
正常和内毒素刺激的人外周血单核细胞中胞质蛋白的泛素化
- DOI:
- 发表时间:
2000 - 期刊:
- 影响因子:0
- 作者:
M. Majetschak;Dan Suciu;K. Häsler;U. Obertacke;F. Schade;H. Jennissen - 通讯作者:
H. Jennissen
Optimizing Large-Scale Semi-Naïve Datalog Evaluation in Hadoop
优化 Hadoop 中的大规模半简单数据记录评估
- DOI:
- 发表时间:
2012 - 期刊:
- 影响因子:0
- 作者:
Marianne Shaw;Paraschos Koutris;Bill Howe;Dan Suciu - 通讯作者:
Dan Suciu
Entity Matching in the Wild: A Consistent and Versatile Framework to Unify Data in Industrial Applications
野外实体匹配:统一工业应用中数据的一致且多功能的框架
- DOI:
10.1145/3318464.3386143 - 发表时间:
2020 - 期刊:
- 影响因子:0
- 作者:
Yan Yan;Stephen Meyles;A. Haghighi;Dan Suciu - 通讯作者:
Dan Suciu
Dan Suciu的其他文献
{{
item.title }}
{{ item.translation_title }}
- DOI:
{{ item.doi }} - 发表时间:
{{ item.publish_year }} - 期刊:
- 影响因子:{{ item.factor }}
- 作者:
{{ item.authors }} - 通讯作者:
{{ item.author }}
{{ truncateString('Dan Suciu', 18)}}的其他基金
NSF-BSF: III: Small: Data Driven Schema
NSF-BSF:III:小型:数据驱动模式
- 批准号:
2109922 - 财政年份:2021
- 资助金额:
$ 60万 - 项目类别:
Continuing Grant
III: Medium: Collaborative Research: Reasoning about Optimizers for Data-Intensive Systems
III:媒介:协作研究:数据密集型系统优化器的推理
- 批准号:
1954222 - 财政年份:2020
- 资助金额:
$ 60万 - 项目类别:
Continuing Grant
III:Small: Optimal Query Processing meets Information Theory: from Proofs to Algorithms
III:Small:最优查询处理遇到信息论:从证明到算法
- 批准号:
1907997 - 财政年份:2019
- 资助金额:
$ 60万 - 项目类别:
Continuing Grant
III: Medium: Collaborative Research: A Unified and Declarative Approach to Causal Analysis for Big Data
III:媒介:协作研究:大数据因果分析的统一声明式方法
- 批准号:
1703281 - 财政年份:2017
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
III: Small: Scalable Probabilistic Inference for Large Knowledge Bases
III:小:大型知识库的可扩展概率推理
- 批准号:
1614738 - 财政年份:2016
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
AitF: FULL: Query Processing with Optimal Communication Cost
AitF:FULL:具有最佳通信成本的查询处理
- 批准号:
1535565 - 财政年份:2015
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
BIGDATA: Mid-Scale: DCM: A Formal Foundation for Big Data Management
BIGDATA:中型:DCM:大数据管理的正式基础
- 批准号:
1247469 - 财政年份:2013
- 资助金额:
$ 60万 - 项目类别:
Continuing Grant
III: Small: Query Compilation on Probabilistic Databases
III:小:概率数据库上的查询编译
- 批准号:
1115188 - 财政年份:2011
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
III: Small: BeliefDB - Adding Belief Annotations to Databases
III:小:BeliefDB - 向数据库添加信念注释
- 批准号:
0915054 - 财政年份:2009
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
III COR: Query Evaluation and View Materialization in Probabilistic Data
III COR:概率数据中的查询评估和视图具体化
- 批准号:
0713576 - 财政年份:2007
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
相似国自然基金
靶向Treg-FOXP3小分子抑制剂的筛选及其在肺癌免疫治疗中的作用和机制研究
- 批准号:32370966
- 批准年份:2023
- 资助金额:50 万元
- 项目类别:面上项目
化学小分子激活YAP诱导染色质可塑性促进心脏祖细胞重编程的表观遗传机制研究
- 批准号:82304478
- 批准年份:2023
- 资助金额:30 万元
- 项目类别:青年科学基金项目
靶向小胶质细胞的仿生甘草酸纳米颗粒构建及作用机制研究:脓毒症相关性脑病的治疗新策略
- 批准号:82302422
- 批准年份:2023
- 资助金额:30 万元
- 项目类别:青年科学基金项目
HMGB1/TLR4/Cathepsin B途径介导的小胶质细胞焦亡在新生大鼠缺氧缺血脑病中的作用与机制
- 批准号:82371712
- 批准年份:2023
- 资助金额:49 万元
- 项目类别:面上项目
小分子无半胱氨酸蛋白调控生防真菌杀虫活性的作用与机理
- 批准号:32372613
- 批准年份:2023
- 资助金额:50 万元
- 项目类别:面上项目
相似海外基金
CSR: Small: Leveraging Physical Side-Channels for Good
CSR:小:利用物理侧通道做好事
- 批准号:
2312089 - 财政年份:2024
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
NeTS: Small: NSF-DST: Modernizing Underground Mining Operations with Millimeter-Wave Imaging and Networking
NeTS:小型:NSF-DST:利用毫米波成像和网络实现地下采矿作业现代化
- 批准号:
2342833 - 财政年份:2024
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
CPS: Small: NSF-DST: Autonomous Operations of Multi-UAV Uncrewed Aerial Systems using Onboard Sensing to Monitor and Track Natural Disaster Events
CPS:小型:NSF-DST:使用机载传感监测和跟踪自然灾害事件的多无人机无人航空系统自主操作
- 批准号:
2343062 - 财政年份:2024
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
Collaborative Research: FET: Small: Reservoir Computing with Ion-Channel-Based Memristors
合作研究:FET:小型:基于离子通道忆阻器的储层计算
- 批准号:
2403559 - 财政年份:2024
- 资助金额:
$ 60万 - 项目类别:
Standard Grant
政治参加の縮小期における政治的平等と政治資金
政治参与下降时期的政治平等与政治资本
- 批准号:
24KJ2165 - 财政年份:2024
- 资助金额:
$ 60万 - 项目类别:
Grant-in-Aid for JSPS Fellows