MDFSchedulingStrategy.java example

Explorer

SEEPng-master
- examples
  - microbenchmark-mdf
    - src
      - main
        java
        Adder.java
        Base.java
        Branch1.java
        Choose.java
        Evaluator.java
        Snk.java
  - microbenchmark2-mdf
    - src
      - main
        java
        Adder.java
        Base.java
        Branch1.java
        Choose.java
        Evaluator.java
        Snk.java
  - simple-cycle-stateless-query
    - src
      - main
        java
        Base.java
        Processor.java
        Processor2.java
        Snk.java
        Src.java
  - simple-dag-memorymng
    - src
      - main
        java
        Adder.java
        Base.java
        Branch1.java
        Branch2.java
        Snk.java
  - simple-dag-schedule
    - src
      - main
        java
        Adder.java
        Base.java
        Branch1.java
        Branch2.java
        Snk.java
  - simple-dag-stateless-query
    - src
      - main
        java
        Base.java
        Processor.java
        Processor2.java
        Snk.java
        Src.java
  - simple-kafka-stateless-pipeline
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
        Src.java
  - simple-mdf-schedule
    - src
      - main
        java
        Adder.java
        Base.java
        Branch1.java
        Choose.java
        Evaluator.java
        Snk.java
  - simple-pipeline-scheduledef
    - src
      - main
        java
        Base.java
        CustomSink.java
        CustomSource.java
        Processor.java
  - simple-pipeline-stateful-query
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
        Src.java
  - simple-pipeline-stateless-barrier-query
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
        Src.java
  - simple-pipeline-stateless-query
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
        Src.java
  - simple-shuffle-query
    - src
      - main
        java
        Base.java
        Map.java
        Reduce.java
  - simple-sourcefile-stateless-query
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
  - static-scaleout-pipeline-stateful-query
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
        Src.java
  - static-scaleout-pipeline-stateless-query
    - src
      - main
        java
        Base.java
        Processor.java
        Snk.java
        Src.java
- seep-common
  - src
    - main
      - java
        uk
        ac
        imperial
        lsds
        seep
        api
        API.java
        APIMetadata.java
        CommAPI.java
        ConnectionType.java
        DataReference.java
        DataStore.java
        DataStoreDescriptor.java
        DataStoreType.java
        EvaluateResultsRuntimeEvent.java
        NotifyEndOfLoopRuntimeEvent.java
        QueryAPI.java
        QueryBuilder.java
        QueryComposer.java
        QueryExecutionMode.java
        QueryType.java
        RuntimeEvent.java
        RuntimeEventFactory.java
        RuntimeEventRegister.java
        RuntimeEventType.java
        RuntimeEventTypes.java
        ScheduleAPI.java
        ScheduleBuilder.java
        ScheduleComposer.java
        SeepChooseTask.java
        SeepTask.java
        SpillToDiskRuntimeEvent.java
        StatefulSeepTask.java
        annotations
        Any.java
        Collection.java
        ConsoleSink.java
        DriverProgram.java
        FileSink.java
        FileSource.java
        Global.java
        NetworkSource.java
        Partial.java
        Partitioned.java
        SinkType.java
        SourceType.java
        data
        Array.java
        CSVParser.java
        DataItem.java
        ITuple.java
        OTuple.java
        RowBatchITuple.java
        Schema.java
        SchemaParser.java
        TransporterITuple.java
        TupleInfo.java
        Type.java
        ZCITuple.java
        operator
        Connectable.java
        DownstreamConnection.java
        LogicalOperator.java
        Operator.java
        SeepLogicalOperator.java
        SeepLogicalQuery.java
        UpstreamConnection.java
        sinks
        MarkerSink.java
        SimpleConsoleSink.java
        Sink.java
        TaggingSink.java
        sources
        FileConfig.java
        FileSource.java
        Source.java
        StaticConnectable.java
        SyntheticSource.java
        SyntheticSourceConfig.java
        TaggingSource.java
        TextFileSource.java
        state
        Checkpoint.java
        DistributedMutableState.java
        Mergeable.java
        Migratable.java
        Partitionable.java
        SeepState.java
        Streamable.java
        Versionable.java
        stateimpl
        LogicalState.java
        SeepMap.java
        comm
        Comm.java
        Connection.java
        IOComm.java
        OutgoingConnectionRequest.java
        protocol
        AckCommand.java
        BootstrapCommand.java
        CodeCommand.java
        Command.java
        CommandFamilyType.java
        CommandType.java
        CrashCommand.java
        DeadWorkerCommand.java
        MasterWorkerCommand.java
        MasterWorkerProtocolAPI.java
        MaterializeTaskCommand.java
        ProtocolCommandFactory.java
        RequestDataReferenceCommand.java
        ScheduleDeployCommand.java
        ScheduleStageCommand.java
        SeepCommand.java
        StageStatusCommand.java
        StartQueryCommand.java
        StopQueryCommand.java
        WorkerWorkerCommand.java
        WorkerWorkerProtocolAPI.java
        serialization
        JavaSerializer.java
        KryoFactory.java
        KryoSerializer.java
        MapWrapper.java
        Serializer.java
        SerializerType.java
        config
        CommandLineArgs.java
        Config.java
        ConfigDef.java
        ConfigKey.java
        core
        DataStoreSelector.java
        DatasetMetadata.java
        DatasetMetadataPackage.java
        EventAPI.java
        EventBasedOBuffer.java
        IBuffer.java
        InputAdapter.java
        InputAdapterReturnType.java
        OBuffer.java
        errors
        AttemptToReconcileStateNotInSnapshotModeException.java
        ConfigException.java
        DeadlockException.java
        DoYouKnowWhatYouAreDoingException.java
        IllegalOperationOnStateException.java
        IncompatibleStateException.java
        InvalidEndPointException.java
        InvalidInitializationException.java
        InvalidQueryDefinitionException.java
        NotImplementedException.java
        NotSupportedException.java
        SchemaException.java
        SeepException.java
        infrastructure
        ControlEndPoint.java
        DataEndPoint.java
        ExecutionUnitType.java
        SeepEndPoint.java
        SeepEndPointType.java
        lview
        ArrayData.java
        LogicalView.java
        metrics
        SeepMetrics.java
        scheduler
        ScheduleDescription.java
        Stage.java
        StageStatus.java
        StageType.java
        tools
        GenerateBinaryFile.java
        Local.java
        util
        ExtendedObjectInputStream.java
        ExtendedObjectOutputStream.java
        RuntimeClassLoader.java
        Utils.java
    - test
      - java
        uk
        ac
        imperial
        lsds
        seep
        api
        BaseTest.java
        FileBase.java
        QueryComposerFileTest.java
        QueryComposerStatefulTest.java
        QueryComposerTest.java
        ScheduleAPITest.java
        StatefulBaseTest.java
        data
        OTupleCreationTest.java
        SchemaTest.java
        comm
        serialization
        KryoSerializerTest.java
        kryoserializers
        MaterializeTaskCommandSerializerTest.java
- seep-contrib
  - src
    - main
      - java
        uk
        ac
        imperial
        lsds
        seepcontrib
        kafka
        DefaultFetchConsumer.java
        KafkaSystemConsumer.java
        KafkaSystemProducer.java
        comm
        KafkaDataStream.java
        KafkaSelector.java
        components
        KafkaSink.java
        config
        KafkaConfig.java
- seep-integrationtests
  - src
    - main
      - java
        uk
        ac
        imperial
        lsds
        seep
        integration
        comm
        BasicWorkerWorkerCommunicationTest.java
        WorkerWorkerDataCommunicationTest.java
        performance
        microbenchmarks
        ByteComparisonOverheadToChooseDataStructurePerformanceTest.java
        ITupleAccessCostTest.java
        InputBufferPerformanceTest.java
        IteratorVsPlainForLoopToAccessListPerformanceTest.java
        JavaQueueSimplePerformanceTest.java
        OTupleCreationTest.java
        OutputBufferPerformanceTest.java
        ProducerConsumerTest.java
        SingleTupleVsListTuplesGetPerformanceTest.java
- seep-java2sdg
  - examples
  - src
    - main
      - java
        uk
        ac
        imperial
        lsds
        java2sdg
        ComputeCallGraph.java
        DriverProgramAnalyzer.java
        Main.java
        Util.java
        api
        DriverProgram.java
        bricks
        InternalStateRepr.java
        SDG
        OperatorBlock.java
        PartialSDGBuilder.java
        PartialSDGWrapper.java
        SDGBuilder.java
        SendType.java
        Stream.java
        StreamType.java
        SDGAnnotation.java
        SDGElement.java
        TaskElement.java
        TaskElementNature.java
        Variable.java
        WorkflowRepr.java
        codegenerator
        CodeGenerator.java
        OperatorBuilder.java
        QueryBuilder.java
        SDGAssembler.java
        SeepOperatorInternalCodeTemplate.java
        flowanalysis
        LiveVariableAnalysis.java
        NoDataForLine.java
        PointOfInterest.java
        StateAccessUtil.java
        TEBoundaryAnalysis.java
        input
        IllegalDriverProgram.java
        SourceCodeHandler.java
        output
        DOTExporter.java
        GEXFExporter.java
        SDGExporter.java
    - test
      - java
        Fake.java
        LVAProof.java
        ProofOfConceptTraverser.java
- seep-master
  - src
    - main
      - java
        uk
        ac
        imperial
        lsds
        seepmaster
        LifecycleManager.java
        Main.java
        MasterConfig.java
        MasterShutdownHookWorker.java
        comm
        MasterWorkerAPIImplementation.java
        MasterWorkerCommManager.java
        infrastructure
        master
        ExecutionUnit.java
        InfrastructureManager.java
        InfrastructureManagerFactory.java
        InfrastructureType.java
        PhysicalClusterManager.java
        PhysicalNode.java
        query
        GenericQueryManager.java
        InvalidLifecycleStatusException.java
        MaterializedQueryManager.java
        QueryManager.java
        ScheduledQueryManager.java
        scheduler
        ClusterDatasetRegistry.java
        CommandToNode.java
        ScheduleManager.java
        ScheduleStatus.java
        ScheduleTracker.java
        SchedulerEngineWorker.java
        StageTracker.java
        loadbalancing
        DataParallelWithInputDataLocalityLoadBalancingStrategy.java
        LoadBalancingStrategy.java
        LoadBalancingStrategyType.java
        LocalitySensitiveLoadBalancingStrategy.java
        memorymanagement
        MDFMemoryManagementPolicy.java
        MemoryManagementPolicy.java
        MemoryManagementPolicyType.java
        SizeObliviousLRUMemoryManagementPolicy.java
        schedulingstrategy
        MDFSchedulingStrategy.java
        ParallelLocalitySchedulingStrategy.java
        RandomSchedulingStrategy.java
        SchedulingStrategy.java
        SchedulingStrategyType.java
        SequentialSchedulingStrategy.java
        ui
        ConsoleUI.java
        SimpleConsoleUI.java
        UI.java
        UIFactory.java
        UIType.java
        WebUI.java
        web
        WebUIHandler.java
    - test
      - java
        uk
        ac
        imperial
        lsds
        seepmaster
        LifecycleManagerTest.java
        comm
        MasterWorkerAPIImplementationTest.java
        query
        BaseTest.java
        QueryManagerTest.java
        scheduler
        ComplexBranchingQuery.java
        ComplexManyBranchesMultipleSourcesQuery.java
        SchedulerEngineTest.java
        SequentialSchedulingStrategyTest.java
        SimplePipelineQuery.java
        WithSyntheticSource.java
- seep-worker
  - src
    - main
      - java
        uk
        ac
        imperial
        lsds
        seepworker
        Main.java
        WorkerConfig.java
        WorkerShutdownHookWorker.java
        comm
        ControlAPIImplementation.java
        ControlCommManager.java
        NetworkSelector.java
        core
        BufferPool.java
        Collector.java
        Conductor.java
        DataReferenceManager.java
        DataStoreSelectorFactory.java
        Dataset.java
        DiskCacher.java
        FileSelector.java
        ProcessingEngine.java
        ProcessingEngineFactory.java
        ProcessingEngineType.java
        ScheduleTask.java
        SimpleCollector.java
        SingleThreadProcessingEngine.java
        input
        CoreInput.java
        CoreInputFactory.java
        CoreInputType.java
        DatasetInputAdapter.java
        FacadeInputAdapter.java
        FacadeInputBuffer.java
        FileDataStream.java
        InputAdapterFactory.java
        InputBuffer.java
        NetworkBarrier.java
        NetworkDataStream.java
        output
        CoreOutput.java
        CoreOutputFactory.java
        FileOutputBuffer.java
        NullOutputBuffer.java
        OutputBuffer.java
        TextFileOutputBuffer.java
        routing
        ConsistentHashingRoutingState.java
        NotEnoughRoutingInformation.java
        RoundRobinRoutingState.java
        Router.java
        RouterFactory.java
    - test
      - java
        uk
        ac
        imperial
        lsds
        seep
        perf
        WriteToChannelWriteToBufferedOutputTest.java
        testutils
        LongPipelineBase.java
        MockChannel.java
        WriterOfTrash.java
        seepworker
        comm
        BasicAsyncConTest.java
        NetworkSelectorTest.java
        core
        DiskCacherTest.java
        FileSelectorTest.java
        NoSpaceToWMem_so_WDskRDskTest.java
        OutOfMemoryEventTest.java
        ScheduleTaskTest.java
        WDskLMemRMemTest.java
        WDskRDskTest.java
        WMemRMemTest.java
        WMemSDskLMemRMemTest.java
        WMemSDskWDskLMemRMemTest.java
        WMemSDskWDskRDskTest.java
        WMem_noSpace_WDskRDsk.java
        input
        DatasetInputAdapterTest.java
        InputBufferTest.java
        output
        OutputBufferTest.java
        routing
        ConsistentHashingRoutingTest.java
        RoundRobinRoutingStateTest.java

package uk.ac.imperial.lsds.seepmaster.scheduler.schedulingstrategy;

import java.util.ArrayList;
import java.util.HashMap;
import java.util.HashSet;
import java.util.List;
import java.util.Map;
import java.util.Set;

import uk.ac.imperial.lsds.seep.api.DataReference;
import uk.ac.imperial.lsds.seep.api.RuntimeEvent;
import uk.ac.imperial.lsds.seep.api.RuntimeEventTypes;
import uk.ac.imperial.lsds.seep.api.SeepChooseTask;
import uk.ac.imperial.lsds.seep.comm.protocol.Command;
import uk.ac.imperial.lsds.seep.scheduler.Stage;
import uk.ac.imperial.lsds.seep.scheduler.StageType;
import uk.ac.imperial.lsds.seepmaster.scheduler.ClusterDatasetRegistry;
import uk.ac.imperial.lsds.seepmaster.scheduler.ScheduleTracker;

public class MDFSchedulingStrategy implements SchedulingStrategy {

	private Map<Integer, Map<Integer, List<Object>>> evaluatedResultsPerChooseStage = new HashMap<>();
	
	private Set<Integer> chooseCandidates = new HashSet<>();
	
	@Override
	public Stage next(ScheduleTracker tracker, Map<Integer, List<RuntimeEvent>> rEvents) {
		Stage head = tracker.getHead();
		Stage nextToSchedule = nextStageToSchedule(head, tracker);
		
		// We want to intercept when the next stage to schedule is CHOOSE, as this means that the explore is done
		// and that we have already chosen one (CHOOSE has executed eagerly every time an upstream finished running
		// Here we want to capture the outputs (real data output) of the chosen upstream stage and put them as input of
		// CHOOSE downstreams, then, make CHOOSE finished and go on with the scheduling process, by calling recursively
		// to this function
		if(nextToSchedule.getStageType() == StageType.CHOOSE_STAGE) {
			// Check whether we have finished the choose stage and we can go ahead
			// TODO: pick stage according to the currentBestCandidate
			Set<Stage> upstream = nextToSchedule.getDependencies();
			Map<Integer, Set<DataReference>> chosenResultsOfStage = new HashMap<>();
			for(Stage s : upstream) {
				int stageId = s.getStageId();
				Set<DataReference> inputs = nextToSchedule.getInputDataReferences().get(stageId);
				if(chooseCandidates.contains(stageId)) {
					// Filter out potential inputs of CHOOSE to get only the chosen one
					chosenResultsOfStage.put(nextToSchedule.getStageId(), inputs);
				}
			}
			
			// Say that choose is done and assign results to its downstream stages
			tracker.setFinished(nextToSchedule, chosenResultsOfStage);
			
			// Reset CHOOSE structures to support next potential choose
			evaluatedResultsPerChooseStage = new HashMap<>();
			chooseCandidates = new HashSet<>();
			
			// Call recursively to next so that we give worker a stage to schedule
			nextToSchedule = next(tracker, null);
		}
		
		return nextToSchedule;
	}
	
	private Stage nextStageToSchedule(Stage head, ScheduleTracker tracker) {
		Stage toReturn = null;
		if(tracker.isStageReady(head)) {
			toReturn = head;
		}
		else {
			for(Stage upstream : head.getDependencies()) {
				if(! tracker.isStageFinished(upstream)) {
					toReturn = nextStageToSchedule(upstream, tracker);
				}
			}
		}
		return toReturn;
	}
	
	@Override
	public List<Command> postCompletion(Stage finishedStage, ScheduleTracker tracker) {
		// When the recently completed stage is upstream to a Choose task, then we need to store the results it produced and
		// evaluate them (with the choose task). For that we capture here the runtime events and filter those that contain
		// results. 
		// IMPORTANT: By results, we mean the results of the EVALUATE function, and not the actual data produced by the 
		// stage that is upstream to the EVALUATE. See "picture" below
		// SOME_FUNCTION_A ---> EVALUATE ----> CHOOSE_A
		// SOME_FUNCTION_B ---> EVALUATE ----> CHOOSE_A
		// SOME_FUNCTION_C ---> EVALUATE ----> CHOOSE_A
		// That graph depicts a situation where a explore generated three possible instantiations of SOME_FUNCTION, that we
		// call A, B and C. The three results produced by those are evaluated by EVALUATE, that runs in the cluster in parallel.
		// In particular, SEEP will pipelines EVALUATE with SOME_FUNCTION. EVALUATE must be implemented by the user of the system
		// and must generate a RuntimeEvent that contains EvaluatedResults. Then, this scheduler gets those results and uses
		// them to evaluate CHOOSE. This happens below.
		//
		// Some additional detail. SOME_FUNCTION_A, B and C are scheduled sequentially in the cluster (hence each has all 
		// resources available). Whenever one of them finishes, its results are captured here. CHOOSE can be run pairwise.
		// In that way, as soon as Choose knows whether A or B is better, it can instruct to discard the other results.
		// This eager evaluation leads to a situation where C and other subsequent tasks will have more memory available.
		
		List<Command> commands = new ArrayList<>();
		Map<Integer, List<RuntimeEvent>> rEvents = tracker.getRuntimeEventsOfLastStageExecution();
		// STORE EVALUATED RESULTS FOR CURRENT STAGE
		if( ! finishedStage.getDependants().isEmpty()) {
			StageType st = finishedStage.getDependants().iterator().next().getStageType();
			if(st == StageType.CHOOSE_STAGE) {
				Stage chooseStage = finishedStage.getDependants().iterator().next();
				int seepChooseTaskId = chooseStage.getWrappedOperators().iterator().next();
				SeepChooseTask sct = (SeepChooseTask) tracker.getScheduleDescription().getOperatorWithId(seepChooseTaskId).getSeepTask();
				
				rEvents = tracker.getRuntimeEventsOfLastStageExecution();
				List<Object> evalResult = new ArrayList<>();
				for(List<RuntimeEvent> re : rEvents.values()) {
					for(RuntimeEvent r : re) { 
						if(r.getEvaluateResultsRuntimeEvent().type() == RuntimeEventTypes.EVALUATE_RESULT.ofType()) {
							evalResult.add(r.getEvaluateResultsRuntimeEvent().getEvaluateResults());
						}
					}
				}
				put(seepChooseTaskId, finishedStage.getStageId(), evalResult, evaluatedResultsPerChooseStage);
				//evaluatedResults.put(finishedStage.getStageId(), evalResult);
				Map<Integer, List<Object>> evaluatedResults =  evaluatedResultsPerChooseStage.get(seepChooseTaskId);
				// Evaluate choose and get list of stages whose values are still useful
				this.chooseCandidates = sct.choose(evaluatedResults);
				
				ClusterDatasetRegistry cr = tracker.getClusterDatasetRegistry();
				// TODO: difference between evaluatedResults and goOn are datasets to evict
				for(int stageId : evaluatedResults.keySet()) {
					if(! chooseCandidates.contains(stageId)) {
						// get upstream of CHOOSE (which is my downstream), then go over output results and get all the
						// datasets Id, which together in a list are the payload of an eviction command.
						Stage choose = finishedStage.getDependants().iterator().next();
						Map<Integer, Set<DataReference>> badInputs = choose.getInputDataReferences();
						
						for(DataReference drToEvict : badInputs.get(stageId)) {
							cr.evictDatasetFromCluster(drToEvict.getId());
						}
					}
				}	
			}
		}
		return commands;
	}
	
	private void put(int chooseStageId, int finishedStageId, List<Object> evalResultsOfThisStage, Map<Integer, Map<Integer, List<Object>>> evalResultsPerChooseStage) {
		if(! evalResultsPerChooseStage.containsKey(chooseStageId)) {
			evalResultsPerChooseStage.put(chooseStageId, new HashMap<>());
		}
		evalResultsPerChooseStage.get(chooseStageId).put(finishedStageId, evalResultsOfThisStage);
	}

}