2016 · 21 citations · 18 references
Large-scale Global OptimizationCluster ComputingEngineeringComputer ArchitecturePopular LanguageTabu SearchString-searching AlgorithmInformation RetrievalData ScienceData MiningParallel ComputingCombinatorial OptimizationPig Latin ScriptsHigh-performance Data AnalyticsKnowledge DiscoveryComputer ScienceData-intensive ComputingProgram AnalysisOptimization ProblemCombinatorial Pattern MatchingParallel ProgrammingPig LatinData-level Parallelism
Pig Latin is a popular language which is widely used for parallel processing of massive data sets. Currently, subexpressions occurring repeatedly in Pig Latin scripts are executed as many times as they appear, and the current Pig Latin optimizer does not identify reuse opportunities. We present a novel optimization approach aiming at identifying and reusing repeated subexpressions in Pig Latin scripts. Our optimization algorithm, named PigReuse, identifies subexpression merging opportunities, selects the best ones to execute based on a cost function, and reuses their results as needed in order to compute exactly the same output as the original scripts. Our experiments demonstrate the effectiveness of our approach.
18
Christopher Olston, Benjamin Reed, Utkarsh Srivastava et al. · 2008 · 1.7K citations
Timos Sellis · ACM Transactions on Database Systems · 1988 · 804 citations · Full text
Efficient and extensible algorithms for multi query optimization
Prasan Roy, S. Seshadri, S. Sudarshan et al. · ACM SIGMOD Record · 2000 · 408 citations
Algorithms for Materialized View Design in Data Warehousing Environment
Jian Yang, Kamalakar Karlapalem, Qing Li · 1997 · 311 citations